**********************
训练数据算法专家
  • 收藏职位
  • 分享职位
70-130万 上海 本科 3-5年 招聘 1 人 预计佣金 168.5K 19:51发布
72小时新发
JD基本信息
岗位职责
职位描述 1、主导海量数据 pipeline 建设:负责预训练数据从采集、高精解析、深度清洗、到实验分析的全链路自动化管线设计,为千亿级/万亿级参数基座模型提供稳定、高质量、多模态的预训练语料支撑 2、前沿合成数据(synthetic data)探索:深入研究基于大语言模型的数据合成与增强技术,设计创新的生成策略,突破物理世界数据的长尾限制,填补核心能力缺口 3、构建可信评估与闭环体系:建立针对合成数据的自动化质量评估体系,结合模型下游任务表现与scale规律,逆向迭代数据生成策略,实现"数据-模型"双向闭环 4、打造高并发分布式数据底座:设计并优化高并发、高弹性的数据工程架构,保障海量文本/代码/多模态数据的清洗与去重(minhash/semantic de-duplication)效率,提升资源利用率 5、沉淀高价值数据标签体系与策略:建设端到端的数据质量、多样性度量体系及高精细度标签系统,探索真实数据与合成数据的最优scaling law配比.
任职要求
职位要求 1、本科及以上学历,计算机、ai、数学等相关专业,具备扎实的算法与编程功底 2、深入理解大模型预训练基本原理,对预训练数据特性、分布及scaling特性有深刻洞察 3、具备优秀的数据敏感度与指标设计能力,能熟练运用ml算法进行数据筛选与特征工程 具备出色的自驱力与跨团队沟通协作能力. 加分项 1、参与过大模型预训练数据准备工作,或有利用合成数据显著提升大模型核心能力的成功落地经验 2、在顶会(如 neurips、icml、acl、emnlp 等)发表过大模型相关高水平论文,或在 github 知名开源数据/模型项目中有核心贡献者优先. 工作经验
所属行业:
互联网、人工智能/大模型/算力、计算机软件
职能分类:
其他后端开发
工作城市:
上海,招聘1人,详细地址:上海市
职位要求
学历要求:
本科·统招·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
70-130万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐