职位编号 J20260701153748119890
机器学习平台SRE工程师
40-80万北京市本科5-8年招聘 1 人预计佣金 87.5K22小时前刷新/7月2日 10:02发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:1、三年以上运维开发项目经验;
2、熟练掌握Linux环境下的Go/Python/Shell等1至2种以上语言;
3、有大型分布式系统的资源管理和任务调度系统运维经验,熟悉Kubernetes生态和架构;
4、有强烈的工作责任心,出色的学习能力、沟通能力和自驱力,良好的团队合作精神;
5、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
加分项:
1、从事过大规模分布式系统的运维;
2、有GPU服务器的运维经验。
优先条件:
1、从事过大规模分布式系统的运维;
2、有GPU服务器的运维经验。
目标公司/行业:暂无
必问问题:
- 目前薪资、期望薪资、推荐语
- 跳槽原因
JD基本信息
岗位职责
1、负责机器学习系统的稳定运转,支持模型开发、训练与部署;
2、负责GPU/NPU/CPU和存储等资源的管理与规划、成本与预算;
3、负责多地域、多机房的系统容灾、服务部署管理和集群机器治理;
4、开发自动化工具或平台,提升资源利用率和运维人效。
任职要求
职位要求
1、硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业;
2、工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先;
3、技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底;
4、素养:具备出色的第一性原理(First-princIPles)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。
所属行业:社交网络与媒体
职能分类:其他后端开发
工作城市:
北京,招聘1人,详细地址:北京
职位要求
学历要求:本科·统招
工作年限:5-8年
薪资福利
年薪范围:40-80万 14薪
薪资福利:-
面试信息
面试轮次:轮
视频面试:不可以接受
面试流程:-