职位编号 J20260915121541135820
机器人后训练工程师(VLA/WAM & Real..)
100-200万北京市本科3-5年招聘 1 人预计佣金 217.6K15小时前刷新/9月15日 15:34发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:1. 计算机科学、机器人学或相关专业背景,对 PPO、SAC、TD3 等深度强化学习算法,以及 Diffusion 等生成式动作架构具有扎实理解。 2. 熟悉 StarVLA、π0.5、GR00T、Cosmos 或相关 World Model 架构;具备 VLM / LLM 微调与对齐经验者优先。 3. 必须具备在双足人形机器人、四足机器人、高自由度灵巧手等真实复杂硬件上成功部署端到端策略的实战经验,能够处理电机特性、传感器噪声、摩擦与接触等真实物理问题。 4. 精通 Python / C++,熟悉 Linux / Tmux 开发环境,能够开发高性能算子或自定义 C++ 部署环境。 5. 具备较强的自动化意识,善于使用 Agentic AI 开发工具提升研发效率与实验迭代速度。
优先条件:1. 在真实世界中跑通闭环 ,并取得明确的科研或业务成果。 2. 深入理解飞轮,具备利用真机残差数据优化 Isaac Sim、MuJoCo 等仿真参数的系统辨识经验。
目标公司/行业:机器人专业,AI机器人公司
必问问题:
待发单方补充
JD基本信息
岗位职责
【岗位职责】 1. VLA 与 WAM 后训练:负责 Vision-Language-Action(VLA)及 World/Action Model(WAM)的 SFT、RLHF 与 DPO 流程;面向高维连续动作空间设计高效微调范式,降低多模态输入下的动作幻觉与时序不一致。 2. Real-world RL:在真实人形机器人或复杂硬件系统上设计并部署高样本效率的在线强化学习算法,重点解决安全探索、环境动态适配与真实物理反馈下的奖励建模问题。 3. 真机部署与闭环优化:主导策略模型在 NVIDIA Jetson 等边缘计算节点上的高性能部署与 TensorRT / ONNX 优化,打通高层视觉语言规划与底层 WBC / MPC 控制链路,系统解决时延、频域不匹配与高频抖动问题。 4. 数据驱动的行为对齐:利用 Human-in-the-loop 接管数据与边缘案例构建在线修正飞轮,从失败模式出发持续提升模型在开放场景中的泛化能力与物理常识。
任职要求
2. real-world rl:在真实人形机器人或复杂硬件系统上设计并部署高样本效率的在线强化学习算法,重点解决安全探索、环境动态适配与真实物理反馈下的奖励建模问题. 3. 真机部署与闭环优化: 4. 数据驱动的行为对齐:利用 human-in-the-loop 接管数据与边缘案例构建在线修正飞轮,从失败模式出发持续提升模型在开放场景中的泛化能力与物理常识. 【任职要求】 1. 计算机科学、机器人学或相关专业背景,对 ppo、sac、td3 等深度强化学习算法,以及 diffusion policy、transformer-based control 等生成式动作架构具有扎实理解. 2. 熟悉 starvla、π0. 5、gr00t、cosmos 或相关 world model 架构 具备 vlm / llm 微调与对齐经验者优先. 3. 必须具备在双足人形机器人、四足机器人、高自由度灵巧手等真实复杂硬件上成功部署端到端策略的实战经验,能够处理电机特性、传感器噪声、摩擦与接触等真实物理问题. 4. 精通 python / c++,熟悉 linux / tmux 开发环境,能够开发高性能算子或自定义 c++ 部署环境. 5. 具备较强的自动化意识,善于使用 agentic ai 开发工具提升研发效率与实验迭代速度. 【加分项】 2. 深入理解 sim-to-real-to-sim 飞轮,具备利用真机残差数据优化 isaac sim、mujoco 等仿真参数的系统辨识经验. 3. 在高动态运动控制或精细灵巧操作方向有深厚积累.
所属行业:互联网、人工智能/大模型/算力、云计算、大数据、机器人/具身智能/无人机
职能分类:算法工程师
工作城市:
北京,招聘1人,详细地址:京市海淀区中关村东路 8 号东升大厦
职位要求
学历要求:本科·统招·985/211
工作年限:3-5年
薪资福利
年薪范围:100-200万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-