职位编号 J20260911153443135186
AI Infra 工程师(训练加速方向
150-200万北京市本科3-5年招聘 1 人预计佣金 250.2K1天前刷新/9月11日 15:38发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:(DeepSpeed/Megatron)
关注方向:侧重大模型训练过程中的全链路加速与底层性能优化,能够针对新型大模型或多模态架构(如自定义 Attention 变体)快速开发并极致调优核心算子,解决多机多卡环境下的通信瓶颈及 OOM 等系统级疑难杂症。
优先条件:【加分项】1.熟悉推理全栈:具备大模型推理加速的实战经验,熟悉 KV Cache 优化、量化等前沿推理加速技术。2.知名开源 AI 系统或算子库(如 PyTorch、DeepSpeed、vLLM、*、Triton 等)的核心代码贡献者。
目标公司/行业:具身智能
必问问题:
待发单方补充
JD基本信息
岗位职责
1.训练加速:基于 PyTorch 深度优化分布式训练框架(如 DeepSpeed/Megatron),针对多机多卡环境进行通信与显存优化,追求极致的算力利用率(MFU)并降低训练成本。2.底层算子自研与调优:针对大模型(及多模态模型)的核心计算逻辑,进行 CUDA/Triton 级别的算子自研、融合与极限性能压榨,打破计算与访存瓶颈。3.系统环境与 I/O 优化:负责 GPU 集群的底层环境配置、网络通信优化(NCCL/RDMA)以及高效的数据预处理/加载管线建设,快速定位并解决底层死锁、OOM 等疑难杂症。
任职要求
【职位要求】1.本科及以上学历,计算机、电子工程或相关专业,具备扎实的操作系统与计算机体系结构功底。2.精通 PyTorch,熟悉至少一种主流分布式训练框架的核心机制(DeepSpeed 等),对张量并行、数据并行、ZeRO 等显存优化策略有实战经验。3.底层开发能力:精通 C++/CUDA/Triton 编程,熟悉 GPU 微架构,能够独立进行核心算子(如 Attention 变体)的编写与性能调优。
所属行业:机器人/具身智能/无人机
职能分类:全栈工程师
工作城市:
北京,招聘1人,详细地址:海淀
职位要求
学历要求:本科·985/211
工作年限:3-5年
薪资福利
年薪范围:150-200万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-