企业招聘
职位
关于禾蛙
合伙人计划
联系客服快速发单
扫码添加企业微信
客服电话
400-7777-5125
猎企入驻
400-777-5125
免费注册
登录
**********************
Agent 评估与进化工程师 - Agent Evaluat
接单
收藏职位
分享职位
80-200万
北京、上...
本科
3-5年
招聘 2 人
预计佣金
232K
22:39发布
72小时新发
JD基本信息
岗位职责
"岗位说明 1.负责公司级Agent平台的 Evaluation、Quality Engineering 与持续进化体系建设,解决 Agent “效果如何定义、问题如何发现、优化是否真正有效,以及如何持续变好”的核心问题 2.面对的是一个行为非确定、结果开放、依赖模型和上下文的智能系统,建立适用于 Agent 的新型质量工程体系:从 Dataset、Evaluator、Trace、LLM-as-Judge,到错误发现、效果归因、回归评测、发布 Gate,再到数据闭环和自动优化 3.目标是让 Evaluation 成为 Agent 开发和发布过程中的基础设施,并最终形成由数据和评测驱动的 Agent 持续进化闭环 核心职责 1. Agent Evaluation 体系建设:设计和建设 Agent 离线与在线评测体系,包括 Dataset、Rubric、Evaluator、LLM-as-Judge、Human Evaluation、Regression Evaluation 等能力,支持不同 Agent 场景建立清晰、可量化的效果标准。 2. Agent 质量定义与评测方法设计:针对 Deep Research、任务型 Agent、Long-Horizon Task、Tool-use Agent 等不同场景,设计任务完成率、正确性、完整性、Groundedness、Tool-use Quality、过程质量等评测方法,解决开放式 Agent 结果难以评价的问题 3. Evaluation Platform 与工程体系建设:建设数据集管理、批量评测、Evaluator 管理、实验对比、回归测试、评测报告、版本管理和 Eval Gate 等平台能力,将 Evaluation 融入 Agent 开发、迭代和发布流程 4. Agent 问题发现与效果归因:结合 Trace、用户反馈、在线指标和自动检测能力建立 Badcase Discovery 与 Error Taxonomy,对问题进行聚类和归因,识别模型、Prompt、Context、Memory、Tool、Agent Architecture 等不同因素对最终效果的影响 5. 数据闭环与 Agent 持续进化:将线上 Trace、用户反馈、Badcase 和评测结果转化为高价值 Dataset 和优化信号,推动 Prompt Optimization、Context Optimization、数据生成、自动调优等能力建设,逐步形成 Evaluation → Data → Optimization → Verification 的进化闭环。 6. 新模型与新架构效果验证:与 Agent Systems、Infrastructure 和业务团队协同,通过统一 Benchmark 和 Evaluation 方法评估新模型、新 Prompt、新 Tool、新 Context Strategy 和新 Agent Architecture 的实际收益,为技术选型提供客观依据 7. Evaluation 方法前沿探索:持续研究 Agent Evaluation、Process Reward、LLM-as-Judge、Trajectory Evaluation、Synthetic Data、Agentic RL、Self-improvement 等方向,探索适合复杂 Agent 的下一代质量与进化机制"
任职要求
"任职资格 1. 具备较强的数据和工程能力:计算机、人工智能、数据科学或相关背景,具有良好的编程能力,能够独立完成数据处理、评测系统和实验平台相关研发工作 2. 有 AI / LLM / Agent 相关实践经验:熟悉 Prompt、RAG、Tool Calling、Agent 等基础技术,对 LLM 输出的不确定性、评估难点和常见问题有实际理解 3. 有较强的指标设计与实验意识:能够将模糊的“效果好不好”拆解为可衡量指标,并设计合理的数据集、实验方法和评测标准;有 A/B Test、实验平台、搜索推荐评估或机器学习评估经验更佳。 4. 具备较强的问题分析和归因能力:能够从复杂 Trace、Badcase 和用户反馈中发现规律,建立合理的问题分类和归因框架,并将问题转化为可执行的优化方向。 5. 对 Evaluation 有深入思考:理解准确率等传统指标无法完全覆盖 Agent 质量,能够针对任务完成、过程质量、开放式输出、复杂轨迹等问题设计新的评测方法。 6. 强业务效果意识:不把评测平台本身作为最终目标,能够理解评测的价值最终体现在业务效果提升、迭代效率提升和生产风险降低 加分项 1.有 LLM Evaluation、LLM-as-Judge、Agent Evaluation 相关经验 2.有搜索、推荐、广告、NLP、机器学习平台的评估体系建设经验 3.有数据飞轮、自动数据生成、Reward Model、RLHF / RLAIF / Agentic RL 相关经验 4.有实验平台、数据平台或 MLOps 平台建设经验 5.对模型能力、Agent 架构与 Evaluation 三者之间的关系有较深入的技术判断"
所属行业:
互联网
职能分类:
技术经理
工作城市:
北京,招聘1人,详细地址:北京
上海,招聘1人,详细地址:上海
职位要求
学历要求:
本科·统招·一本
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
80-200万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受
举报
为你推荐
职能类别
IT互联网技术
电子/通信/半导体
销售/客服
制药/医疗器械/医疗护理
高级管理
关于
禾蛙动态
合伙人计划
猎企入驻
帮助中心
禾蛙协议
禾蛙海外版
联系我们
电话:400-777-5125(服务时间:工作日9:00至18:00)
网址:www.hewa.cn
地址:中国(上海)自由贸易试验区滨江大道99弄6号第11层
服务支持
接单方小程序
发单方小程序
微信公众号
©版权所有
上海禾蛙科技有限公司
沪公网安备31011502406070号
备案号:沪ICP备2026021218号-7
|
营业执照
|
服务许可证