JD基本信息
岗位职责
【岗位职责】
参与大模型预训练语料清洗框架研发,建设稳定、高效、可扩展的大规模数据处理平台,建设面向海量数据的离线处理能力,支持复杂数据链路的调度、运行、恢复和监控.
研发核心语料清洗能力,负责 minhash 去重、向量去重等关键环节,与算法、训练、搜索和基座团队协作,快速落地新的数据策略.
维护日常生产流水线,支持每日增量处理、任务调度、数据统计、质量回归、线上问题排查和稳定性保障.
优化大规模数据清洗系统的性能、稳定性和可观测性,完善日志、指标、监控、测试与调试工具.
【岗位职责】
负责大规模多模态数据(图像、视频、图文结合等)的数据结构设计、存储架构规划与全生命周期管理,涵盖数据安全管控、自动化校验与质量治理,保障数据的高可用与合规性.
负责多模态数据清洗与标注链路的工程优化,结合内容理解技术,提升数据去重、结构化、质量筛选、打标分析等流程的效率与质量.
针对pretrain/sft/rl等不同阶段,设计并优化数据存储方案与数据结构使数据组织方式更适配下游模型训练需求,与框架同学、算法同学协同提升训练数据供给效率.
建设数据分析与可视化体系,挖掘数据特征与模型训练效果的关联,搭建易用的数据可视化工具,帮助团队通过更全面易用的数据分析提升模型表现.
【岗位职责】
负责键值数据库、消息队列等核心数据组件的开发、维护与调优,保障从数据采集到模型消费全链路的高性能与高可靠.
面向多模态海量数据,负责数据管理与数据湖方案的设计与落地,对接对象存储、分布式文件系统等底层基建.
设计与开发分布式数据处理框架,支撑 pb 级数据的高效处理.
负责在线与批处理任务的 cpu、内存、网络调优,持续提升吞吐与资源利用率.
与数据采集处理、模型训练等团队紧密协作,设计并提供易用的 api、库与工具,支撑数据的探索、加工与规模化使用.
任职要求
【岗位要求】
计算机或数学相关专业,本科及以上学历.
熟练使用至少一种编程语言,包括但不限于 python/c++/rust.
【加分项】
数学或信息学竞赛中取得优秀成绩.
有大规模数据采集、爬虫或数据 pipeline 系统研发经验.
【岗位要求】
计算机、人工智能相关专业,本科及以上学历.
熟练使用 python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等).
【加分项】
对世界有好奇心,对模型行为有自己独特的理解.
对模型能力边界有敏锐判断,善于发现模型在真实场景中的短板和失效模式.
优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作.
有大规模数据清洗 pipeline 落地经验(tb级别 tokens).
【岗位要求】
计算机基础扎实,熟悉 python,了解 pytorch.
具备系统性能分析与调优能力,能深入 cpu、网络、存储等技术细节,定位并解决大规模数据链路的性能瓶颈.
熟悉常见数据处理与存储格式,了解常见数据结构.
对多模态大模型有一定的认识和了解,清楚其结构和原理,以及所需训练数据的一般形态与需求.
对大规模多模态数据生产与管理有强烈兴趣,愿意深入数据工程全链路,追求高质量、高效率的数据供给.
【加分项】
有大规模分布式数据处理系统的研发与性能优化经验.
具备高并发、异步编程经验,有完整的大规模数据链路开发与调优经历.
了解多模态模型的常见训练与部署框架(如 megatron、vllm 等).
【岗位要求】
计算机相关专业.
扎实 rust/c++/python 编程能力.
扎实的工程能力与系统功底,深刻理解计算机组成、操作系统与计算机网络.
深入理解分析型数据处理引擎的计算和数据存储格式.
能灵活运用文献和开源项目中数据库系统的常见范式和经验.
【加分项】
有大规模存储、分布式 kv、数据库或数据湖、分布式数据处理框架的设计/研发/运维等经验.
在高水平系统会议论文上发表过论文.
所属行业:
互联网、人工智能/大模型/算力、大数据
工作城市:
杭州,招聘1人,详细地址:浙江省杭州市拱墅区,北京市海淀区