职位编号 J20260820192439130666
训练数据算法专家
70-130万上海市本科3-5年招聘 1 人预计佣金 168.5K1天前刷新/8月20日 19:51发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件: 1、本科及以上学历,计算机、AI、数学等相关专业,具备扎实的算法与编程功底; 2、深入理解大模型预训练基本原理,对预训练数据特性、分布及Scaling特性有深刻洞察; 3、具备优秀的数据敏感度与指标设计能力,能熟练运用ML算法进行数据筛选与特征工程;具备出色的自驱力与跨团队沟通协作能力。
优先条件:1、参与过大模型预训练数据准备工作,或有利用合成数据显著提升大模型核心能力的成功落地经验; 2、在顶会(如 NeurIPS、ICML、ACL、EMNLP 等)发表过大模型相关高水平论文,或在 GitHub 知名开源数据/模型项目中有核心贡献者优先。
目标公司/行业:AI互联网大厂
必问问题:
待发单方补充
JD基本信息
岗位职责
职位描述
1、主导海量数据 pipeline 建设:负责预训练数据从采集、高精解析、深度清洗、到实验分析的全链路自动化管线设计,为千亿级/万亿级参数基座模型提供稳定、高质量、多模态的预训练语料支撑
2、前沿合成数据(synthetic data)探索:深入研究基于大语言模型的数据合成与增强技术,设计创新的生成策略,突破物理世界数据的长尾限制,填补核心能力缺口
3、构建可信评估与闭环体系:建立针对合成数据的自动化质量评估体系,结合模型下游任务表现与scale规律,逆向迭代数据生成策略,实现"数据-模型"双向闭环
4、打造高并发分布式数据底座:设计并优化高并发、高弹性的数据工程架构,保障海量文本/代码/多模态数据的清洗与去重(minhash/semantic de-duplication)效率,提升资源利用率
5、沉淀高价值数据标签体系与策略:建设端到端的数据质量、多样性度量体系及高精细度标签系统,探索真实数据与合成数据的最优scaling law配比.
任职要求
职位要求
1、本科及以上学历,计算机、ai、数学等相关专业,具备扎实的算法与编程功底
2、深入理解大模型预训练基本原理,对预训练数据特性、分布及scaling特性有深刻洞察
3、具备优秀的数据敏感度与指标设计能力,能熟练运用ml算法进行数据筛选与特征工程
具备出色的自驱力与跨团队沟通协作能力.
加分项
1、参与过大模型预训练数据准备工作,或有利用合成数据显著提升大模型核心能力的成功落地经验
2、在顶会(如 neurips、icml、acl、emnlp 等)发表过大模型相关高水平论文,或在 github 知名开源数据/模型项目中有核心贡献者优先.
工作经验
所属行业:互联网、人工智能/大模型/算力、计算机软件
职能分类:其他后端开发
工作城市:
上海,招聘1人,详细地址:上海市
职位要求
学历要求:本科·统招·985/211
工作年限:3-5年
薪资福利
年薪范围:70-130万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-