职位编号 J20260828010657132125
强化学习算法工程师(AI/机器人方向)反馈快
12-24万西安市本科3-5年招聘 2 人预计佣金 25.7K19小时前刷新/8月28日 01:08发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:4 个最重要必备条件(按重要度排序) 1.精通强化学习理论,熟练掌握 PPO 算法,具备 PPO 算法落地调优实战项目经验 2.熟练使用 *+PyTorch,可独立完成强化学习环境搭建、奖励函数设计、模型训练、调参、问题排查 3.有机器人(四足 / 人形优先)场景下强化学习项目实战经历,做过智能体控制、路径规划或任务决策 4.具备算法工程落地能力,能处理训练不收敛、奖励稀疏等工程问题,完成仿真到实物的落地验证
优先条件:特殊硬性要求 不接受外国人; 优先国内院校背景人选; 需要有真实强化学习项目实战,不能只停留在论文、实验阶段,必须具备算法落地调优经验。
目标公司/行业:优必选,宇树科技,小米机器人,大疆创新,大疆,铁大智能,逐际动力,傅里叶智能,智元新创,智元机器人,云迹科技,达闼机器人,优艾智合,极智嘉,新松机器人,埃斯顿,海康机器人,蓝胖子机器人,洛必达,非夕机器人,大象机器人,天智航,博实机器人,程天科技,节卡机器人,越疆科技,镁伽机器人,擎智动力,绿的谐波,猎户星空,拓斯达,遨博智能,阿凡达机器人,智同精密,科沃斯,启智机器人,擎源智能,众擎机器人
必问问题:
  • 1.精通强化学习理论,熟练掌握 PPO 算法,具备 PPO 算法落地调优实战项目经验
  • 2.熟练使用 Python+PyTorch,可独立完成强化学习环境搭建、奖励函数设计、模型训练、调参
  • 3.有机器人(四足 / 人形优先)场景下强化学习项目实战经历,做过智能体控制、路径规划或任务决策
  • 4.具备算法工程落地能力,能处理训练不收敛、奖励稀疏等工程问题,完成仿真到实物的落地验证
JD基本信息
岗位职责
岗位描述 找能拿强化学习算法,做四足 / 人形机器人控制、决策,会 PPO 算法,能把算法从仿真落地到真实机器人上干活的算法工程师。 岗位职责 1.负责强化学习相关算法研究与应用,针对四足机器人、人形机器人控制、路径规划、任务执行等场景,设计并实现有效的强化学习解决方案; 2.参与问题建模与算法选择,包括状态表示、动作空间设计、奖励函数设计、训练环境构建及策略优化流程; 3.负责强化学习模型的训练、调优、实验验证与效果分析,持续提升智能体决策性能和训练稳定性; 4.结合真实业务或仿真场景,推动强化学习算法从实验研究到工程落地; 5.与机器人、算法、软件工程等团队协作,完成从数据采集、环境搭建、模型训练到部署验证的全流程工作;
任职要求
任职要求: 1.具备强化学习相关理论基础,熟悉 MDP、动态规划、价值函数近似、策略梯度、ActorCritic 等核心概念; 2.熟悉 PPO(Proximal Policy Optimization)原理,理解其 clipped objective、优势函数估计、KL 约束、策略更新稳定性等关键设计思想; 3.具备独立开展强化学习项目的能力,能够完成环境搭建、奖励设计、训练流程实现、参数调优和实验结果分析; 4.具备至少一个真实强化学习项目或研究经验,能够独立负责从问题定义到算法实现、模型训练、实验验证的全过程; 5.熟悉 Python 及深度学习框架,如 PyTorch,能够实现并调试 PPO、DQN、TRPO 等常见强化学习算法; 6.具备工程实践能力,能够解决训练过程中的不稳定性、收敛问题、奖励稀疏问题及算法调参问题; 7.对智能体学习、机器人控制、决策优化、强化学习仿真环境等方向有较强兴趣和实践基础; 7.具备良好的科研与工程思维,能够独立分析实验问题,形成结论并持续迭代优化。 优先条件: 1.有强化学习项目经验,尤其是 PPO、SAC、DQN、ActorCritic 相关算法的实现与实践经验; 2.具有机器人、自动驾驶、控制、智能调度、决策优化等方向强化学习应用经验; 熟悉 OpenAI Gym、MuJoCo、Isaac Gym、IsaacLab 等强化学习环境或训练平台; 3.参与过真实智能体训练、仿真平台构建、模型部署或在线学习相关工作者优先; 有算法创新、研究论文、比赛获奖、创新项目或相关科研经历者优先; 4.对强化学习与机器人结合、复杂决策系统、长期任务学习有较深理解者优先。 任职资格 1.计算机、自动化、机器人、控制、数学、人工智能等相关专业优先; 2.具备较强编程能力和工程执行力,能够独立完成研究验证和项目落地; 3.具有较强的学习能力和跨领域协作能力,能与研究、工程团队高效沟通。 基础要求: 性别要求:男女不限 学历要求:统招本科及以上,计算机、自动化、机器人、控制、人工智能、数学等相关专业 年龄要求:结合岗位市场情况: 24-38 岁 薪资范围:年薪 12-24W,12-20K / 月 * 12 薪,年终奖 1-3 个月薪资 + 项目奖金 是否接受外国人:否 收否接受海外工作/留学经历的人选:尽量国内学校
所属行业:人工智能/大模型/算力、自动化设备/工业自动化、机器人/具身智能/无人机
职能分类:算法工程师
工作城市:
西安,招聘2人,详细地址:长安区航天基地
职位要求
学历要求:本科·统招
工作年限:3-5年
薪资福利
年薪范围:12-24万 13薪
薪资福利:薪酬福利 【福利待遇】: 六险一金、带薪年假、节日福利、定期体检、餐补/交通补、商业保险、技术培训、行业交流; 六险一金:社保缴纳比例:薪资的60%,可以缴纳北京,珠海,深圳,西安 公积金比例:个人5%,企业5%;餐补;18元/工作日 【薪酬方案】: 基础薪资:基础薪资:10-20k/月*12薪(12-24W/年)+年终奖(1-3个月薪资)+项目奖金
团队架构
所属部门:研发中心
汇报对象:研发总监
下属人数:1-10人
职级职称:强化学习算法工程师
部门架构:强化学习算法工程师(AI/机器人方向)——研发总监
面试信息
面试轮次:2轮
视频面试:可以接受
面试流程:面试流程: 第一轮:技术部门+HR( 同城线下,不同城线上 ); 第二轮:总经理( 同城线下,不同城线上,尽量线下 )
西安市强化学习算法工程师(AI/机器人方向)招聘-禾蛙,猎头合作交易平台