职位编号 J20260828160153132294
RL infra
60-100万北京市上海市本科3-5年招聘 2 人预计佣金 129.7K1天前刷新/8月28日 16:07发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:有Agent场景强化学习基建落地经验,做过智能Agent、编码Agent的RL训练优化优先。 2. 有千卡/万卡级大规模GPU集群RL训练调度、性能优化实战经验。 3. 熟悉云原生、K8s容器调度,有AI算力集群资源治理、稳定性优化经验。 4. 熟悉模型后训练全链路,了解SFT、Reward模型训练、沙箱测试联动流程。 5. 有头部大厂大模型平台、AI训练基建核心模块独立负责经验。
优先条件:部大厂履历:字节、美团、百度、阿里、腾讯、AI六小龙(智谱、讯飞、旷视、商汤、依图、云从)、Kimi/月之暗面
目标公司/行业:互联网大厂,私募量化
必问问题:
待发单方补充
JD基本信息
岗位职责
1. RL训练基建搭建:独立设计、开发、落地大模型分布式RL训练系统,打通Actor推理、Reward打分、Learner参数更新的完整闭环训练链路,保障训练流程7×24小时稳定运行。 2. 算力资源优化:负责千卡级GPU集群调度优化,解决分布式训练通信瓶颈、显存OOM、任务排队阻塞问题,最大化GPU利用率,降低训练算力成本。 3. 训练性能迭代:针对GRPO、PPO、DPO、RLHF等主流强化学习算法,做工程层优化,提升Agent试错训练效率、模型迭代速度。 4. 工程问题攻坚:解决大规模RL训练中的数据丢失、节点宕机、权重同步异常、训练梯度不稳定等线上核心问题,搭建训练监控、告警、复盘体系。 5. 跨团队协同落地:联动Agent研发、沙箱测试、模型调度团队,对接Agent真实业务场景,适配复杂任务的强化学习训练需求,持续迭代基建能力。 工作内容 1. 从零搭建适配大模型Agent的分布式RL训练基础设施,完善训练任务编排、资源调度、环境隔离能力。 2. 优化vLLM、SGLang推理加速链路,提升RL场景下Agent Rollout采样效率,缩短模型迭代周期。 3. 基于OpenRLHF、veRL等开源框架做二次开发与适配,适配公司自有大模型与业务场景。 4. 持续优化GPU算力利用率、网络通信效率、显存占用,降低大规模强化学习训练的算力损耗。 5. 输出基建技术文档、运维规范,支撑后续团队扩容、业务规模化落地。
任职要求
1. 本科及以上计算机、软件工程、人工智能、大数据等相关专业,2年及以上一线大厂大模型RL Infra实战经验。 3. 精通大模型后训练、强化学习完整工程链路,熟练掌握GRPO、PPO、DPO、RLHF核心训练流程与工程落地要点。 4. 熟悉分布式训练原理,精通NCCL、显存优化、权重同步、分布式并行策略,能独立解决大规模训练故障。 5. 熟练使用Python、CUDA,熟悉vLLM、veRL、OpenRLHF等主流RL训练框架,有框架二次开发经验。 6. 具备独立扛下整套RL基建搭建的能力,可单人完成模块设计、开发、调优、落地全流程。
所属行业:互联网、人工智能/大模型/算力
职能分类:测试工程师
工作城市:
北京,招聘1人,详细地址:海淀上海,招聘1人,详细地址:上海
职位要求
学历要求:本科·985/211
工作年限:3-5年
薪资福利
年薪范围:60-100万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-