**********************
大模型对齐算法专家
  • 收藏职位
  • 分享职位
50-100万 北京 本科 3-5年 招聘 3 人 预计佣金 116K 18:14发布
72小时新发
JD基本信息
岗位职责
我们正在建设面向AI Agent的运行时安全和免疫系统,希望通过AI管理AI:理解Agent的长程行为,识别风险,生成或选择控制策略,并通过数据、评测和模型迭代持续提升安全能力。 这个岗位不是单纯调用大模型API、做Prompt工程或内容审核,而是需要围绕行为轨迹、风险识别、攻击生成、安全对齐和策略判断,完成数据、模型、评测与上线闭环。 岗位职责: 1.建设Agent行为轨迹、攻击样本、正常样本和策略反馈的数据体系。 2.设计风险识别、异常检测、长程行为理解、攻击生成或安全策略模型。 3.建立baseline、评测指标、误差分类、消融实验和回归测试体系。 4.探索监督微调、偏好优化、强化学习、Judge/RewardModel等技术在Agent安全中的应用。 5.将模型接入Agent Runtime和产品平台,联合优化准确率、误报率、延迟、成本和可解释性。 6.分析线上bad case、数据分布变化和模型失效原因,持续迭代数据与模型。 7.与安全研究团队共同把攻击经验转化为数据、评测任务和模型能力。
任职要求
任职要求: 1.具备扎实的机器学习、深度学习或大模型后训练能力。 2.至少完整负责过一个从问题定义、数据、baseline、实验到部署或验收的模型项目。 3.能清楚说明本人负责的数据、代码、训练、评测和关键技术决策。 4.理解数据泄漏、标签质量、分布偏移、指标选择、因果归因和过拟合等问题。 5.具备良好的工程意识,愿意把模型接入真实产品,而不是停留在notebook、论文复现或Prompt 调参阶段。 6.对Agent、模型安全或AI行为治理有兴趣,能够主动形成判断并快速学习新方向。 加分项: 1.有大模型对齐、安全评测、强化学习、Judge/RewardModel 或 post-training 经验。 2.有轨迹建模、异常检测、风控、可解释性或多步决策经验。 3.有Agent规划、评测、多模态、长上下文或ML Systems经验。4.有高质量论文、开源代码、可复现实验或模型上线经验。 5.做过内容安全、风控或推荐算法,并能将能力迁移到行为、工具调用和长程轨迹问题。 我们重点关注候选人是否真正理解数据、baseline、实验、误差和上线约束,不以“大模型”强化学习”等关键词数量判断能力。
所属行业:
人工智能/大模型/算力、计算机软件
职能分类:
算法工程师
工作城市:
北京,招聘3人,详细地址:北京西城金融街
职位要求
学历要求:
本科·统招·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
50-100万*12薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐