**********************
大模型预训练数据算法
  • 收藏职位
  • 分享职位
60-150万 上海 本科 不限 招聘 3 人 预计佣金 155.5K 1天前刷新/一周前发布
JD基本信息
岗位职责
职位描述 1、主导海量数据 Pipeline 建设:负责预训练数据从采集、高精解析、深度清洗、到实验分析的全链路自动化管线设计,为千亿级/万亿级参数基座模型提供稳定、高质量、多模态的预训练语料支撑; 2、前沿合成数据(Synthetic Data)探索:深入研究基于大语言模型的数据合成与增强技术,设计创新的生成策略,突破物理世界数据的长尾限制,填补核心能力缺口; 3、构建可信评估与闭环体系:建立针对合成数据的自动化质量评估体系,结合模型下游任务表现与Scale规律,逆向迭代数据生成策略,实现“数据-模型”双向闭环; 4、打造高并发分布式数据底座:设计并优化高并发、高弹性的数据工程架构,保障海量文本/代码/多模态数据的清洗与去重(MinHash/Semantic De-duplication)效率,提升资源利用率; 5、沉淀高价值数据标签体系与策略:建设端到端的数据质量、多样性度量体系及高精细度标签系统,探索真实数据与合成数据的最优Scaling Law配比。
任职要求
职位要求 1、本科及以上学历,计算机、AI、数学等相关专业,具备扎实的算法与编程功底; 2、深入理解大模型预训练基本原理,对预训练数据特性、分布及Scaling特性有深刻洞察; 3、具备优秀的数据敏感度与指标设计能力,能熟练运用ML算法进行数据筛选与特征工程;具备出色的自驱力与跨团队沟通协作能力。
所属行业:
互联网、人工智能/大模型/算力、计算机软件
职能分类:
大模型算法
工作城市:
上海,招聘3人,详细地址:虹口区
职位要求
学历要求:
本科·统招·985/211
工作年限:
不限
技能/证书:
-
薪资福利
年薪范围:
60-150万*16薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐