职位编号 J20260911223410135356
Agent 基础设施工程师 - Agent Infrastr
80-200万北京市上海市本科3-5年招聘 2 人预计佣金 232K2天前刷新/9月11日 22:38发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:加微信,进项目群拿手册:130/3315/1253
优先条件:加微信,进项目群拿手册:130/3315/1253
目标公司/行业:加微信,进项目群拿手册:130/3315/1253
必问问题:
待发单方补充
JD基本信息
岗位职责
"岗位说明
1.负责公司级Agent平台的核心基础设施和 Agent 生产运行底座建设,为不同 Agent 架构提供统一、稳定、高性能、可扩展的运行环境
2.工作范围不仅局限于传统 Runtime,而是覆盖 Agent Harness Kernel、Execution Runtime、Durable Execution、模型与工具调用、状态管理、Context Runtime、Sandbox、调度、可靠性、性能和成本等核心基础设施
3.目标是构建一个不绑定特定 Agent Framework 或架构范式的通用 Agent Infrastructure,使 ReAct、Workflow、Deep Research、Multi-Agent、Long-Horizon Task 等不同 Agent 能够低成本接入并稳定运行
核心职责
1. Agent Runtime / Harness Kernel 建设:参与设计和实现 Agent Runtime 核心执行模型,包括 Task、Session、Step、State、Model Call、Tool Call、Agent Loop 等关键运行实体,以及模型调用、工具执行、状态流转、异常处理等核心机制
2. Durable Execution 与任务调度能力建设:建设长生命周期 Agent 所需的 Task Scheduling、Checkpoint / Resume、状态持久化、失败恢复、任务取消、异步执行、事件驱动、Human-in-the-loop 等能力,支撑分钟级到长周期任务稳定运行
3. Agent 执行基础设施建设:建设和演进 Agent 运行过程中依赖的基础设施,包括模型调用、Tool / Skill Execution、Sandbox、Context Runtime、Memory 接入、资源隔离、任务队列以及分布式执行等能力
4. Runtime 稳定性与生产工程建设:负责 Agent 运行时的生产级可靠性,包括 Timeout、Retry、Fallback、Circuit Breaker、Idempotency、Load Shedding、Failure Recovery、Multi-region 等机制,持续提升 Agent 服务 SLO
5. 性能与成本优化:围绕模型调用、Token 消耗、Context 长度、并行执行、缓存、模型路由、Tool Execution 等核心链路持续优化 Agent 延迟、吞吐和成本,建立效果、性能和资源效率之间的合理平衡
6. Runtime 可观测与标准化:建设 Agent Runtime 统一 Trace 和运行数据模型,使 Model、Tool、Memory、Context、Sub-Agent 等执行步骤能够被完整追踪,并支撑问题定位、成本归因、效果归因和 Evaluation
7. 基础能力平台化与标准化输出:将业务 Agent 中重复出现的运行能力提炼为标准 Runtime API、SDK、Protocol 和 Execution Primitive,降低业务接入和维护成本,并保持底层基础设施对上层 Agent 架构的开放性"
任职要求
"任职资格
1. 扎实的计算机基础和工程能力:熟悉操作系统、网络、并发、存储、分布式系统等基础知识,具备良好的代码能力和工程质量意识
2. 有复杂后端或基础设施系统经验:有分布式系统、服务框架、任务调度、Workflow Engine、消息系统、计算平台、云原生基础设施等相关研发经验之一
3. 对生产级系统有深入理解:熟悉高可用、容灾、限流、熔断、超时、重试、幂等、故障恢复、可观测等生产系统关键机制,有线上复杂问题排查经验
4. 对 LLM / Agent 基础设施有兴趣和理解:了解 LLM 调用、Tool Calling、Context、Agent Loop、Streaming 等基本机制,对 Agent Runtime / Harness 有较强兴趣;有相关研发经验更佳
5. 具备良好的系统抽象能力:能够从不同业务 Agent 的具体需求中识别公共问题,并抽象成稳定的基础设施能力,而不是针对单一业务不断增加特例
6. 对性能与效率敏感:有系统性能优化、延迟优化、资源利用率或成本优化经验,能够通过数据分析定位系统瓶颈并持续优化
加分项
1.有 Agent Runtime / Harness / Agent Framework 开发经验
2.有 Workflow Engine、Scheduler、Durable Execution、Serverless Runtime 等研发经验
3.有 Kubernetes、Sandbox、Container Runtime、Service Mesh 等基础设施经验
4.有大模型网关、推理服务、模型路由或 AI Infrastructure 经验
5.有大规模分布式系统、高并发服务核心模块研发经验"
所属行业:互联网
职能分类:技术经理
工作城市:
北京,招聘1人,详细地址:北京上海,招聘1人,详细地址:上海
职位要求
学历要求:本科·统招·一本
工作年限:3-5年
薪资福利
年薪范围:80-200万 15薪
薪资福利:-
面试信息
面试轮次:轮
视频面试:不可以接受
面试流程:-