职位编号 J20260809225043128061
大模型预训练数据算法专家
60-120万北京市本科不限招聘 3 人预计佣金 124.4K1天前刷新/8月9日 22:53发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:第一学历最低985
优先条件:年轻高潜
加分项
1、参与过大模型预训练数据准备工作,或有利用合成数据显著提升大模型核心能力的成功落地经验;
2、在顶会(如 NeurIPS、ICML、ACL、EMNLP 等)发表过大模型相关高水平论文,或在 GitHub 知名开源数据/模型项目中有核心贡献者优先。
目标公司/行业:目标公司:字节,阿里,小米等IT科技类大厂,或者得物,小红书,知乎等中小型发展迅速的科技类公司。 新增目标公司:AI类公司,比如商汤,旷视,寒武纪,科大讯飞等
必问问题:
- 看机会原因,现司职级
- 当前年包,期望薪酬
- 目前有无offer,有几个面试流程,初期还是后期
- 近两年绩效,到岗时间
JD基本信息
岗位职责
职位描述
1、主导海量数据 Pipeline 建设:负责预训练数据从采集、高精解析、深度清洗、到实验分析的全链路自动化管线设计,为千亿级/万亿级参数基座模型提供稳定、高质量、多模态的预训练语料支撑;
2、前沿合成数据(Synthetic Data)探索:深入研究基于大语言模型的数据合成与增强技术,设计创新的生成策略,突破物理世界数据的长尾限制,填补核心能力缺口;
3、构建可信评估与闭环体系:建立针对合成数据的自动化质量评估体系,结合模型下游任务表现与Scale规律,逆向迭代数据生成策略,实现“数据-模型”双向闭环;
4、打造高并发分布式数据底座:设计并优化高并发、高弹性的数据工程架构,保障海量文本/代码/多模态数据的清洗与去重(MinHash/Semantic De-duplication)效率,提升资源利用率;
5、沉淀高价值数据标签体系与策略:建设端到端的数据质量、多样性度量体系及高精细度标签系统,探索真实数据与合成数据的最优Scaling Law配比。
任职要求
职位要求
1、本科及以上学历,计算机、AI、数学等相关专业,具备扎实的算法与编程功底;
2、深入理解大模型预训练基本原理,对预训练数据特性、分布及Scaling特性有深刻洞察;
3、具备优秀的数据敏感度与指标设计能力,能熟练运用ML算法进行数据筛选与特征工程;具备出色的自驱力与跨团队沟通协作能力。
所属行业:互联网、人工智能/大模型/算力、计算机软件
职能分类:大模型算法
工作城市:
北京,招聘3人,详细地址:海淀区
职位要求
学历要求:本科·统招·985/211
工作年限:不限
薪资福利
年薪范围:60-120万 16薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-