**********************
K8S开发工程师
  • 收藏职位
  • 分享职位
40-80万 北京 本科 5-8年 招聘 2 人 预计佣金 87.5K 11:07发布
72小时新发
JD基本信息
岗位职责
岗位职责 1. 负责面向AI推理及算法任务的Kubernetes容器调度系统设计、开发与持续优化。 2. 基于Kubernetes Scheduler Framework开发调度插件,建设队列管理、优先级、抢占、配额、公平调度及多租户资源隔离等能力。 3. 负责GPU资源调度与管理,支持整卡、MIG、vGPU及GPU共享等资源使用方式,提高GPU集群利用率。 4. 针对分布式训练场景,研发Gang Scheduling、拓扑感知调度、协同调度及故障重调度等核心能力。 5. 建设面向训练和推理任务的异构资源调度能力,支持GPU、CPU、NPU、高性能存储及高速网络资源的统一管理。 6. 优化GPU、NUMA、PCIe、NVLink及RDMA网络拓扑感知策略,降低跨节点通信开销,提升分布式训练性能。 7. 研究并实现Bin Packing、负载均衡、碎片整理、弹性伸缩和资源超卖等调度策略,提升集群吞吐量和资源利用率。 8. 建设调度系统的可观测性体系,持续监控任务排队时长、调度成功率、GPU利用率、资源碎片率和任务完成效率。 9. 跟踪云原生、AI基础设施和异构算力调度领域的前沿技术,参与技术预研、架构演进和开源社区建设。
任职要求
任职要求 1. 计算机、软件工程、自动化或相关专业本科及以上学历,具备5年以上基础架构或云原生研发经验。 2. 精通Go语言,具备良好的数据结构、算法、并发编程及系统设计能力;熟悉Python、C++者优先。 3. 深入理解Kubernetes核心架构和工作机制,熟悉Scheduler、Kubelet、Controller Manager、API Server等核心组件。 4. 熟悉Kubernetes Scheduler Framework,具备调度插件、Controller、Operator或Device Plugin实际开发经验。 5. 熟悉GPU硬件及软件生态,包括CUDA、NVIDIA GPU Operator、Device Plugin、MIG或vGPU等技术。 6. 熟悉AI训练和推理任务特点,理解数据并行、模型并行、流水线并行及分布式通信的基本原理。 7. 熟悉优先级调度、抢占调度、公平调度、Gang Scheduling、Bin Packing和拓扑感知调度等常用算法。 8. 熟悉大规模分布式系统,具备高并发、高可用、故障恢复及性能优化方面的工程经验。 优先考虑: - 有千卡及以上GPU集群或大规模Kubernetes生产集群建设经验。 - 有Kueue、Volcano、YuniKorn、Kubernetes Scheduler等开源项目贡献经验。 - 熟悉NCCL、RDMA、InfiniBand、NVLink及分布式训练通信优化。 - 熟悉PyTorch、TensorFlow、Ray、Kubeflow、Slurm或MPI等AI计算框架。 - 有GPU资源池化、算力虚拟化、训练容错、弹性训练或推理服务调度经验。 - 在云原生、分布式系统或AI基础设施领域拥有专利、论文或技术影响力。
所属行业:
通信/网络设备
职能分类:
Golang
工作城市:
北京,招聘2人,详细地址:北京工作地址:金融科技中心
职位要求
学历要求:
本科·统招
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
40-80万*14薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受