职位编号 J20260811180910128561
预训练数据研究员/研发工程师
75-80万北京市本科3-5年招聘 1 人预计佣金 103.7K1天前刷新/8月11日 18:11发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:CS/AI相关专业,本科及以上学历,pretrain/posttrain数据和其他大规模数据如信息检索相关研究或工作经验
熟悉主流大模型训练流程(Pretrain / SFT / RL / OPD),理解数据对模型行为的驱动机制
优先条件:加分
对世界有好奇心,有自己对模型行为的独特理解,
具备良好的研究taste,善于思考和发现jagged *的低点
优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作
有顶会论文发表或核心模型贡献
有大规模数据清洗 pipeline 落地经验(TB级别tokens)
目标公司/行业:大厂,AI互联网公司
必问问题:
待发单方补充
JD基本信息
岗位职责
职位描述
作为预训练数据研究员/研发工程师,你将成为核心模型迭代的直接驱动者。日常工作会是以数据重塑大模型认知,探索Data-centric AI 的能力极限。
【岗位职位】
1. 数据质量与治理
设计并执行大规模训练数据清洗流程,构建数据质量评估体系,持续优化数据配比与筛选策略
研究预训练数据 quality, diversity, repetition 随 model scaling 的最优学习机制,探索数据收益的最大化路径
与上下游深度协作,制定标注规范与质量标准,搭建闭环反馈机制
2. 模型消融与评估
针对数据配方、数据质量、数据规模等维度设计消融实验,量化数据变更对模型能力的影响
构建多维度模型评估体系(自动+人工),覆盖通用能力、垂直场景及安全性
3. 垂直能力研究
多模态数据:参与图文、音视频等多模态训练数据的采集、清洗与质量把控
搜索与向量召回:优化 RAG 场景下的检索数据质量,参与 embedding 模型训练数据构建与召回效果评估
情感智能与意图理解:研究情感智能及意图理解相关数据策略
4. 跨团队协作与标准共建
与模型策略产品经理共建数据-模型-产品质量标准,推动数据驱动的模型迭代闭环
将业务需求转化为数据需求,协调研发、标注、产品多方资源
任职要求
【任职要求】
1. 基础要求
CS/AI相关专业,本科及以上学历,pretrain/posttrain数据和其他大规模数据如信息检索相关研究或工作经验
熟悉主流大模型训练流程(Pretrain / SFT / RL / OPD),理解数据对模型行为的驱动机制
熟练使用 Python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等)
具备扎实的实验设计与统计分析能力,能独立设计严谨的消融实验并得出可靠结论
有预训练数据、信息检索方向、多模态研究背景
(需要满足 2 条以上)
所属行业:互联网、人工智能/大模型/算力、大数据
职能分类:通信研发工程师
工作城市:
北京,招聘1人,详细地址:杭州/北京
职位要求
学历要求:本科·统招·985/211
工作年限:3-5年
薪资福利
年薪范围:75-80万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-