**********************
资深AI推理平台研发工程师
  • 收藏职位
  • 分享职位
40-80万 北京 本科 5-8年 招聘 2 人 预计佣金 87.5K 10:59发布
72小时新发
JD基本信息
岗位职责
岗位职责 1. 负责面向大语言模型、多模态模型及传统算法模型的统一推理平台设计、研发与持续演进。 2. 建设模型接入、部署、发布、扩缩容、监控、下线及版本管理等全生命周期能力,提升算法模型交付效率。 3. 负责GPU推理资源的统一管理与调度,支持整卡、MIG、vGPU、GPU共享及多机多卡等资源使用模式。 4. 根据在线推理、离线推理和批量推理等不同场景,设计资源分配、优先级、负载均衡及弹性伸缩策略。 5. 对接并管理vLLM、SGLang、TensorRT-LLM、Triton Inference Server等推理引擎,建设统一、标准化的模型服务能力。 6. 负责模型服务网关建设,提供鉴权、限流、熔断、路由、灰度发布、流量切换及多租户隔离等能力。 7. 建设多模型、多版本和多实例的服务编排能力,支持模型路由、模型并行、推理引擎选择及跨集群调度。 8. 优化大模型推理服务的首Token时延、Token生成速度、吞吐量、并发能力、显存利用率及单位推理成本。 9. 建设模型预热、快速加载、权重分发、故障迁移和容灾恢复能力,缩短模型服务启动时间。 10. 负责推理平台可观测性建设,监控请求量、成功率、响应时延、GPU利用率、显存占用、Token吞吐量及服务成本。 11. 研发面向业务流量变化的自动扩缩容和容量管理能力,保障推理服务在流量高峰期间的稳定性。 12. 与模型算法、推理引擎、云原生、基础设施和业务团队协作,推动模型快速、稳定、低成本地上线。
任职要求
任职要求 1. 计算机、人工智能、软件工程或相关专业本科及以上学历,具备5年以上后台系统、AI平台或基础架构研发经验。 2. 精通Go、C++、Java中的至少一种语言,熟悉Python,具备良好的数据结构、算法和系统设计能力。 3. 熟悉Kubernetes核心架构,具备Controller、Operator、CRD、Scheduler或Device Plugin相关开发经验。 4. 熟悉大模型推理基本流程,理解Prefill、Decode、KV Cache、连续批处理、量化和分布式推理等核心概念。 5. 熟悉至少一种主流推理引擎或服务框架,如vLLM、SGLang、TensorRT-LLM、Triton Inference Server、TGI或ONNX Runtime。 6. 熟悉GPU资源管理机制,了解CUDA、GPU显存、MIG、vGPU及多机多卡运行模式。 7. 熟悉在线服务治理,具备限流、熔断、降级、负载均衡、灰度发布、故障恢复及高可用架构设计经验。 8. 熟悉容器、微服务和云原生技术体系,具备大规模Kubernetes生产集群或GPU集群研发经验。 9. 熟悉Prometheus、Grafana、OpenTelemetry等可观测性技术,具备系统性能分析和线上问题排查能力。 10. 熟悉Redis、消息队列、对象存储、模型仓库及分布式缓存等基础组件。 11. 具备高并发、低延迟分布式系统的设计和开发能力,能够平衡系统性能、稳定性和资源成本。 12. 具备良好的产品意识和协作能力,能够理解算法团队及业务团队需求,并转化为通用平台能力。 优先考虑: - 具有大型AI推理平台、MaaS平台或模型服务平台建设经验。 - 具有千卡级GPU集群或大规模在线推理服务落地经验。 - 具备模型路由、跨集群调度、自动扩缩容或多租户资源治理经验。 - 熟悉KServe、Ray Serve、Kubeflow、Volcano、Kueue等开源项目。 - 具备大模型量化、推理加速、KV Cache管理或Prefill-Decode分离实践经验。 - 具备GPU成本治理、容量规划和资源利用率优化经验。 - 在云原生、推理平台或AI基础设施相关开源项目中有贡献者优先。
所属行业:
通信/网络设备
职能分类:
Python
工作城市:
北京,招聘2人,详细地址:北京工作地址:金融科技中心
职位要求
学历要求:
本科·统招
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
40-80万*14薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受