**********************
AI 评测平台 Leader
  • 收藏职位
  • 分享职位
80-200万 北京、上... 本科 5-8年 招聘 2 人 预计佣金 232K 22:10发布
72小时新发
JD基本信息
岗位职责
核心使命: 面向 C 端 AI Agent 应用建设行业领先的评测平台与评测驱动研发体系,将模型和应用的概率性效果转化为可衡量、可归因、可优化、可持续演进的工程闭环,让评测结论持续驱动模型、Agent 工程、关键 Tool 与产品体验提升。 岗位职责 1、负责评测体系设计,建设覆盖评测集、评测标准、Rubric、参考答案及必过/黄金/挑战分层的评测资产体系,明确业务场景的质量定义与准出口径。 2、建设自动化评测平台,打通数据集管理、任务编排、多模型/多配置运行、机评、人评、结果分析、问题下钻与回归验证,提升评测规模、效率和研发使用体验。 3、完善多层评测能力,建设面向用户最终体验的端到端评测,以及模型、关键 Tool、组件、Trace 过程和多配置消融等专项评测。 4、建立持续校准与资产回流机制,结合线上真实会话、人机一致性、需求迭代和行业变化,持续校准 Judge、评测集和评测标准,使离线评测长期贴近真实用户体感。 5、与产品、算法、工程和 QA 深度协作,将评测前置到需求设计和技术方案阶段,并推动评测结论进入模型后训练、Agent 架构和工程能力迭代。
任职要求
1、具有生产级大模型、Agent 或复杂 AI 应用评测体系的建设经验,能够主导从方法设计、平台研发到业务落地的完整闭环。 2、深入理解 Rubric 设计、LLM-as-a-Judge、机评与人评协同、人机一致性校准、盲评/对比评测及结果可信性分析。 3、熟悉 Agent 应用关键链路,能够理解并评估模型推理、Context/Memory、Tool Calling、RAG、执行编排、Trace 和终端输出之间的相互影响。 4、具备扎实的平台工程和数据工程能力,能够设计高可用、可扩展的评测任务系统、数据处理链路、可观测体系及自动化分析能力,并亲自解决关键技术问题。 5、具备较强的技术判断、产品意识和跨团队推动力,能够从用户体验出发定义质量标准,并在标准不完全确定的场景中持续形成可执行结论。
所属行业:
互联网
职能分类:
测试工程师
工作城市:
上海,招聘1人,详细地址:上海市北京,招聘1人,详细地址:北京市
职位要求
学历要求:
本科·统招·一本
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
80-200万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受
为你推荐