**********************
预训练数据研究员
  • 收藏职位
  • 分享职位
120-220万 北京、杭... 本科 3-5年 招聘 2 人 预计佣金 299.2K 16:01发布
72小时新发
JD基本信息
岗位职责
1. 数据质量与治理 设计并执行大规模训练数据清洗流程,构建数据质量评估体系,持续优化数据配比与筛选策略 与上下游深度协作,制定标注规范与质量标准,搭建闭环反馈机制 2. 模型消融与评估 针对数据配方、数据质量、数据规模等维度设计消融实验,量化数据变更对模型能力的影响 构建多维度模型评估体系(自动+人工),覆盖通用能力、垂直场景及安全性 3. 垂直能力研究 多模态数据:参与图文、音视频等多模态训练数据的采集、清洗与质量把控 搜索与向量召回:优化 rag 场景下的检索数据质量,参与 embedding 模型训练数据构建与召回效果评估 情感智能与意图理解:研究情感智能及意图理解相关数据策略 4. 跨团队协作与标准共建 与模型策略产品经理共建数据-模型-产品质量标准,推动数据驱动的模型迭代闭环 将业务需求转化为数据需求,协调研发、标注、产品多方资源
任职要求
【任职要求】 1. 基础要求 cs/ai相关专业,本科及以上学历,pretrain/posttrain数据和其他大规模数据如信息检索相关研究或工作经验 熟悉主流大模型训练流程(pretrain / sft / rl / opd),理解数据对模型行为的驱动机制 熟练使用 python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等) 具备扎实的实验设计与统计分析能力,能独立设计严谨的消融实验并得出可靠结论 有预训练数据、信息检索方向、多模态研究背景 (需要满足 2 条以上) 2. 加分 对世界有好奇心,有自己对模型行为的独特理解, 具备良好的研究taste,善于思考和发现jagged intelligence的低点 优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作 有顶会论文发表或核心模型贡献 有大规模数据清洗 pipeline 落地经验(tb级别tokens)"
所属行业:
互联网、人工智能/大模型/算力
职能分类:
数据分析师
工作城市:
杭州,招聘1人,详细地址:拱墅区北京,招聘1人,详细地址:海淀
职位要求
学历要求:
本科·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
120-220万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐