职位编号 J20260911142410135139
预训练数据研究员
120-220万北京市杭州市本科3-5年招聘 2 人预计佣金 299.2K1天前刷新/9月11日 16:01发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:顶尖高校,大厂背景1. 基础要求 cs/ai相关专业,本科及以上学历,pretrain/posttrain数据和其他大规模数据如信息检索相关研究或工作经验 熟悉主流大模型训练流程(pretrain / sft / rl / opd),理解数据对模型行为的驱动机制 熟练使用 python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等) 具备扎实的实验设计与统计分析能力,能独立设计严谨的消融实验并得出可靠结论 有预训练数据、信息检索方向、多模态研究背景 (需要满足 2 条以上)
优先条件:对世界有好奇心,有自己对模型行为的独特理解, 具备良好的研究taste,善于思考和发现jagged *的低点 优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作 有顶会论文发表或核心模型贡献 有大规模数据清洗 pipeline 落地经验(tb级别tokens)"
目标公司/行业:互联网大厂
必问问题:
待发单方补充
JD基本信息
岗位职责
1. 数据质量与治理 设计并执行大规模训练数据清洗流程,构建数据质量评估体系,持续优化数据配比与筛选策略 与上下游深度协作,制定标注规范与质量标准,搭建闭环反馈机制 2. 模型消融与评估 针对数据配方、数据质量、数据规模等维度设计消融实验,量化数据变更对模型能力的影响 构建多维度模型评估体系(自动+人工),覆盖通用能力、垂直场景及安全性 3. 垂直能力研究 多模态数据:参与图文、音视频等多模态训练数据的采集、清洗与质量把控 搜索与向量召回:优化 rag 场景下的检索数据质量,参与 embedding 模型训练数据构建与召回效果评估 情感智能与意图理解:研究情感智能及意图理解相关数据策略 4. 跨团队协作与标准共建 与模型策略产品经理共建数据-模型-产品质量标准,推动数据驱动的模型迭代闭环 将业务需求转化为数据需求,协调研发、标注、产品多方资源
任职要求
【任职要求】 1. 基础要求 cs/ai相关专业,本科及以上学历,pretrain/posttrain数据和其他大规模数据如信息检索相关研究或工作经验 熟悉主流大模型训练流程(pretrain / sft / rl / opd),理解数据对模型行为的驱动机制 熟练使用 python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等) 具备扎实的实验设计与统计分析能力,能独立设计严谨的消融实验并得出可靠结论 有预训练数据、信息检索方向、多模态研究背景 (需要满足 2 条以上) 2. 加分 对世界有好奇心,有自己对模型行为的独特理解, 具备良好的研究taste,善于思考和发现jagged intelligence的低点 优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作 有顶会论文发表或核心模型贡献 有大规模数据清洗 pipeline 落地经验(tb级别tokens)"
所属行业:互联网、人工智能/大模型/算力
职能分类:数据分析师
工作城市:
杭州,招聘1人,详细地址:拱墅区北京,招聘1人,详细地址:海淀
职位要求
学历要求:本科·985/211
工作年限:3-5年
薪资福利
年薪范围:120-220万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-