职位编号 J20260820102726130441
资深AI推理平台研发工程师
40-80万北京市本科5-8年招聘 2 人预计佣金 87.5K19小时前刷新/8月20日 10:59发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:加微信,进项目群拿手册:130/3315/1253
优先条件:加微信,进项目群拿手册:130/3315/1253
目标公司/行业:加微信,进项目群拿手册:130/3315/1253
必问问题:
待发单方补充
JD基本信息
岗位职责
岗位职责
1. 负责面向大语言模型、多模态模型及传统算法模型的统一推理平台设计、研发与持续演进。
2. 建设模型接入、部署、发布、扩缩容、监控、下线及版本管理等全生命周期能力,提升算法模型交付效率。
3. 负责GPU推理资源的统一管理与调度,支持整卡、MIG、vGPU、GPU共享及多机多卡等资源使用模式。
4. 根据在线推理、离线推理和批量推理等不同场景,设计资源分配、优先级、负载均衡及弹性伸缩策略。
5. 对接并管理vLLM、SGLang、TensorRT-LLM、Triton Inference Server等推理引擎,建设统一、标准化的模型服务能力。
6. 负责模型服务网关建设,提供鉴权、限流、熔断、路由、灰度发布、流量切换及多租户隔离等能力。
7. 建设多模型、多版本和多实例的服务编排能力,支持模型路由、模型并行、推理引擎选择及跨集群调度。
8. 优化大模型推理服务的首Token时延、Token生成速度、吞吐量、并发能力、显存利用率及单位推理成本。
9. 建设模型预热、快速加载、权重分发、故障迁移和容灾恢复能力,缩短模型服务启动时间。
10. 负责推理平台可观测性建设,监控请求量、成功率、响应时延、GPU利用率、显存占用、Token吞吐量及服务成本。
11. 研发面向业务流量变化的自动扩缩容和容量管理能力,保障推理服务在流量高峰期间的稳定性。
12. 与模型算法、推理引擎、云原生、基础设施和业务团队协作,推动模型快速、稳定、低成本地上线。
任职要求
任职要求
1. 计算机、人工智能、软件工程或相关专业本科及以上学历,具备5年以上后台系统、AI平台或基础架构研发经验。
2. 精通Go、C++、Java中的至少一种语言,熟悉Python,具备良好的数据结构、算法和系统设计能力。
3. 熟悉Kubernetes核心架构,具备Controller、Operator、CRD、Scheduler或Device Plugin相关开发经验。
4. 熟悉大模型推理基本流程,理解Prefill、Decode、KV Cache、连续批处理、量化和分布式推理等核心概念。
5. 熟悉至少一种主流推理引擎或服务框架,如vLLM、SGLang、TensorRT-LLM、Triton Inference Server、TGI或ONNX Runtime。
6. 熟悉GPU资源管理机制,了解CUDA、GPU显存、MIG、vGPU及多机多卡运行模式。
7. 熟悉在线服务治理,具备限流、熔断、降级、负载均衡、灰度发布、故障恢复及高可用架构设计经验。
8. 熟悉容器、微服务和云原生技术体系,具备大规模Kubernetes生产集群或GPU集群研发经验。
9. 熟悉Prometheus、Grafana、OpenTelemetry等可观测性技术,具备系统性能分析和线上问题排查能力。
10. 熟悉Redis、消息队列、对象存储、模型仓库及分布式缓存等基础组件。
11. 具备高并发、低延迟分布式系统的设计和开发能力,能够平衡系统性能、稳定性和资源成本。
12. 具备良好的产品意识和协作能力,能够理解算法团队及业务团队需求,并转化为通用平台能力。
优先考虑:
- 具有大型AI推理平台、MaaS平台或模型服务平台建设经验。
- 具有千卡级GPU集群或大规模在线推理服务落地经验。
- 具备模型路由、跨集群调度、自动扩缩容或多租户资源治理经验。
- 熟悉KServe、Ray Serve、Kubeflow、Volcano、Kueue等开源项目。
- 具备大模型量化、推理加速、KV Cache管理或Prefill-Decode分离实践经验。
- 具备GPU成本治理、容量规划和资源利用率优化经验。
- 在云原生、推理平台或AI基础设施相关开源项目中有贡献者优先。
所属行业:通信/网络设备
职能分类:Python
工作城市:
北京,招聘2人,详细地址:北京工作地址:金融科技中心
职位要求
学历要求:本科·统招
工作年限:5-8年
薪资福利
年薪范围:40-80万 14薪
薪资福利:-
面试信息
面试轮次:0轮
视频面试:不可以接受
面试流程:-