职位编号 J20260701153209119883
AI基础设施架构师/高级AI基础设施研究员-基础设施
70-150万北京市研究生5-8年招聘 1 人预计佣金 164.1K1天前刷新/7月2日 10:03发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:职位要求
1、硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业;
2、工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先;
3、技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底;
4、素养:具备出色的第一性原理(*)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。
优先条件:职位要求
1、硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业;
2、工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先;
3、技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底;
4、素养:具备出色的第一性原理(*)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。
目标公司/行业:暂无
必问问题:
- 目前薪资、期望薪资、推荐语
- 跳槽原因
JD基本信息
岗位职责
1、端到端AI Factory架构设计:负责超大规模、高可用AI Factory的端到端架构设计与演进;主导面向万卡/十万卡级GPU/加速器集群的计算、高性能网络(RDMA/RoCE/1、6T/CPO)及低延迟存储系统的协同设计,支撑百亿/千亿参数大模型(LLM/VLM)的高效Pre-training和超大规模分布式Inference工作负载;
2、下一代分布式调度与资源管理:设计并实现面向服务(SOA/MicROServices)的下一代AI/ML分布式调度系统与集群联邦架构(基于Kubernetes、高性能调度插件或自定义编排框架);利用智能资源流转、工作负载感知放置(Topology-aware placement)与故障自动恢复(Fault-tolerance)机制,极致提升集群算力利用率(MFU/HFU)并降低TCO;
3、全栈性能极致优化与瓶颈分析:全链路剖析并优化AI/ML计算堆栈:涵盖机器学习编译器(XLA/TVM/Triton)、通信库(NCCL/RCCL)、算子优化、大模型训练/推理框架(Megatron-LM,DeepSpeed,vLLM等);主导构建低开销(Low-overhead)的分布式Metrics监控、可观测性系统及微基准测试(Micro-Benchmarking)框架,精准定位并消除超大规模集群的系统级长尾瓶颈;
4、下一代高性能存储与数据管道:针对大模型长周期训练的Checkpointing、多模态海量数据预处理、以及推理场景下的长文本/高并发需求,设计下一代高性能分布式存储、缓存系统及存算一体架构;主导构建高吞吐的分布式ETL与数据摄取管道。
任职要求
职位要求
1、硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业;
2、工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先;
3、技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底;
4、素养:具备出色的第一性原理(First-princIPles)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。
所属行业:社交网络与媒体
职能分类:架构师
工作城市:
北京,招聘1人,详细地址:北京
职位要求
学历要求:研究生·统招
工作年限:5-8年
薪资福利
年薪范围:70-150万 14薪
薪资福利:-
面试信息
面试轮次:轮
视频面试:不可以接受
面试流程:-