企业招聘
职位
关于禾蛙
合伙人计划
联系客服快速发单
扫码添加企业微信
客服电话
400-7777-5125
猎企入驻
400-777-5125
免费注册
登录
**********************
RL infra
接单
收藏职位
分享职位
60-100万
北京、上...
本科
3-5年
招聘 2 人
预计佣金
129.7K
16:24刷新/16:07发布
72小时新发
JD基本信息
岗位职责
1. RL训练基建搭建:独立设计、开发、落地大模型分布式RL训练系统,打通Actor推理、Reward打分、Learner参数更新的完整闭环训练链路,保障训练流程7×24小时稳定运行。 2. 算力资源优化:负责千卡级GPU集群调度优化,解决分布式训练通信瓶颈、显存OOM、任务排队阻塞问题,最大化GPU利用率,降低训练算力成本。 3. 训练性能迭代:针对GRPO、PPO、DPO、RLHF等主流强化学习算法,做工程层优化,提升Agent试错训练效率、模型迭代速度。 4. 工程问题攻坚:解决大规模RL训练中的数据丢失、节点宕机、权重同步异常、训练梯度不稳定等线上核心问题,搭建训练监控、告警、复盘体系。 5. 跨团队协同落地:联动Agent研发、沙箱测试、模型调度团队,对接Agent真实业务场景,适配复杂任务的强化学习训练需求,持续迭代基建能力。 工作内容 1. 从零搭建适配大模型Agent的分布式RL训练基础设施,完善训练任务编排、资源调度、环境隔离能力。 2. 优化vLLM、SGLang推理加速链路,提升RL场景下Agent Rollout采样效率,缩短模型迭代周期。 3. 基于OpenRLHF、veRL等开源框架做二次开发与适配,适配公司自有大模型与业务场景。 4. 持续优化GPU算力利用率、网络通信效率、显存占用,降低大规模强化学习训练的算力损耗。 5. 输出基建技术文档、运维规范,支撑后续团队扩容、业务规模化落地。
任职要求
1. 本科及以上计算机、软件工程、人工智能、大数据等相关专业,2年及以上一线大厂大模型RL Infra实战经验。 3. 精通大模型后训练、强化学习完整工程链路,熟练掌握GRPO、PPO、DPO、RLHF核心训练流程与工程落地要点。 4. 熟悉分布式训练原理,精通NCCL、显存优化、权重同步、分布式并行策略,能独立解决大规模训练故障。 5. 熟练使用Python、CUDA,熟悉vLLM、veRL、OpenRLHF等主流RL训练框架,有框架二次开发经验。 6. 具备独立扛下整套RL基建搭建的能力,可单人完成模块设计、开发、调优、落地全流程。
所属行业:
互联网、人工智能/大模型/算力
职能分类:
测试工程师
工作城市:
北京,招聘1人,详细地址:海淀
上海,招聘1人,详细地址:上海
职位要求
学历要求:
本科·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
60-100万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
举报
为你推荐
职能类别
IT互联网技术
电子/通信/半导体
销售/客服
制药/医疗器械/医疗护理
高级管理
关于
禾蛙动态
合伙人计划
猎企入驻
帮助中心
禾蛙协议
禾蛙海外版
联系我们
电话:400-777-5125(服务时间:工作日9:00至18:00)
网址:www.hewa.cn
地址:中国(上海)自由贸易试验区滨江大道99弄6号第11层
服务支持
接单方小程序
发单方小程序
微信公众号
©版权所有
上海禾蛙科技有限公司
沪公网安备31011502406070号
备案号:沪ICP备2026021218号-7
|
营业执照
|
服务许可证