**********************
运维专家(大模型推理云SRE方向)4397
  • 收藏职位
  • 分享职位
60-100万 北京、上... 本科 8-10年 招聘 4 人 预计佣金 129.9K 16:17刷新/2天前发布
反馈快 72小时新发
JD基本信息
岗位职责
1. 负责大模型token推理服务的生产环境运维:vLLM/SGLang/MindIE等推理引擎的部署、升级、扩缩容与7×24小时稳定性保障,参与Oncall值班。 2. 负责推理服务的生产级性能优化:围绕TTFT、TPOT、吞吐(tokens/s)、并发、排队时长等核心指标,开展引擎参数调优、KV Cache与批处理策略优化,配合PD分离架构落地,持续提升单卡产出。 3. 负责推理业务故障的分诊与处置:处理生产环境性能与可用性问题,推动重大故障复盘、问题归因和系统性改进,降低 MTTR 和重复故障率。 4. 建立模型全生命周期运维能力:模型权重的高效分发与快速加载(数百GB级)、模型版本管理、灰度发布与快速回滚、多模型混部与资源隔离。 5. 负责推理服务弹性能力建设:基于流量与队列指标的自动扩缩容、多副本/多集群流量调度、限流降级与过载保护。 6. 建设推理业务监控与自动化运维:搭建GPU层、引擎层、请求层(token粒度)指标体系与告警能力,探索基于大模型 Agent 的运维自动化,包括日志分析、故障诊断、操作建议和变更风险评估。 7. 沉淀runbook与自动化工具,将成熟的运维操作标准化并移交业务运维团队执行。
任职要求
1.本科及以上学历,并取得相应学位,计算机及相关专业优先。 2. 8年以上运维/SRE/基础架构经验,其中3年以上大模型推理服务生产环境运维或支持经验。 3. 理解大模型推理关键性能指标(TTFT/TPOT/吞吐)及其影响因素,有实际的生产性能优化或疑难问题排查案例,熟悉Kubernetes及GPU调度,熟练使用Python/Shell开发自动化工具,熟悉Prometheus/Grafana/OpenTelemetry等可观测技术体系。 4. 熟悉至少一种主流推理引擎(vLLM/SGLang/MindIE)的生产部署与调优,理解continuous batching、paged attention、KV Cache管理、量化等核心机制。 5. 熟悉GPU使用与常见问题(CUDA、显存OOM、NCCL通信、Xid错误等),具备GPU环境问题定位能力;有多机多卡推理(TP/PP并行)运维经验者优先。 6. 有推理网关、流量调度、基于自定义指标的弹性伸缩(KEDA/HPA)、智能运维、异常检测或运维 Agent 项目经验者优先。 7.诚实守信、作风踏实严谨、责任心强;具备良好团队协作能力精神;学习能力强,善于解决复杂问题。
所属行业:
通信/网络设备
职能分类:
运维总监
工作城市:
北京,招聘1人,详细地址:北京研发中心工作地址:北京市海淀区学院路42号中国电信博物馆上海,招聘1人,详细地址:上海研发中心工作地址:上海市浦东新区秀沿西路189号中国电信信息园区25号楼广州,招聘1人,详细地址:广州研发中心工作地址: 广报中心:广州市海珠区阅江西路366号广报中心南塔(1号楼)19楼深圳,招聘1人,详细地址:深圳研发中心工作地址:深圳市福田区信息枢纽大厦3楼
职位要求
学历要求:
本科
工作年限:
8-10年
技能/证书:
-
薪资福利
年薪范围:
60-100万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受
为你推荐