职位编号 J20260827113427131926
AI Infra 算子优化专家平台直营反馈快
100-150万上海市研究生5-8年招聘 1 人预计佣金 170.1K2天前刷新/8月27日 11:50发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:1. 学历与经验:计算机、软件工程、人工智能等相关专业,硕士及以上学历,3-8 年 AI 算子或 CUDA Kernel 开发经验
2. LLM 核心算子实战经验:有 *、RMSNorm、AdamW 等 LLM 关键算子的性能优化或生产级实现经验;熟悉 cuBLAS、TE、* 等主流算子库的区别和适用场景
优先条件:1. 学历与经验:计算机、软件工程、人工智能等相关专业,硕士及以上学历,3-8 年 AI 算子或 CUDA Kernel 开发经验
2. LLM 核心算子实战经验:有 *、RMSNorm、AdamW 等 LLM 关键算子的性能优化或生产级实现经验;熟悉 cuBLAS、TE、* 等主流算子库的区别和适用场景
目标公司/行业:无
必问问题:
待发单方补充
JD基本信息
岗位职责
1. 高性能算子交付。负责生产级高性能算子的开发与持续优化,覆盖 Hopper / Blackwell 等 NVIDIA GPU 架构,充分利用 Tensor Core、TMA、WGMMA 等硬件特性,保障算子在不同代际 GPU 上的性能领先与稳定性。
2. 算法迭代中的算子瓶颈定位与演进式支持。在算法模型结构演进过程中(如 Attention 变体等),快速定位性能瓶颈算子,评估算子融合可能性、收益与代价,输出兼顾性能、精度和可维护性的演进式算子优化路线图,确保算法迭代不被算子性能阻塞
3. 算子 Benchmark 与选型决策。建立核心算子的标准化 Benchmark 流程,系统性对比 cuBLAS、TE、Liger-Kernel 等主流实现,在不同尺寸和精度等条件下给出数据驱动的选型结论,为训推框架的算子使用策略提供依据
任职要求
1. 学历与经验:计算机、软件工程、人工智能等相关专业,硕士及以上学历,3-8 年 AI 算子或 CUDA Kernel 开发经验
2. LLM 核心算子实战经验:有 Flash-Attention、RMSNorm、AdamW 等 LLM 关键算子的性能优化或生产级实现经验;熟悉 cuBLAS、TE、Liger-Kernel 等主流算子库的区别和适用场景
3. CUDA 体系化能力:精通 CUDA 编程模型和执行机制,深入理解不同代际 GPU 架构(Ampere / Hopper / Blackwell)的特性差异;熟练使用 CUTLASS / CuTe / Triton 等算子开发框架;熟练使用 ncu Profiler 工具
4. Pytorch 后端与通信:熟悉 PyTorch 框架的算子调度与后端实现机制,理解 ATen 及 CUDA 后端链路,能够分析 torch 原生算子的性能瓶颈,并做出引入其他算子库替换的工程决策。熟悉 NCCL 集合通信原语和常见问题,能在算子设计中考虑通算 Overlap 可能性,为大规模 scale-up 训练提供支撑
5. 融合算子与精度分析:熟悉计算图优化主流方案(如 torch.compile 或 CUDA graph)和使用限制,具备 GEMM-based 融合算子的开发能力;深入理解常见精度的数值特性、误差来源和适用边界,在算法迭代中能快速定位并解释数值不稳定根因并提出解决方案
6. 编程语言与 Native 工程能力:精通 C/C++,Linux 系统底层基础扎实,熟悉现代 Native 开发体系
7. 软素质:工作细心踏实不浮躁;沟通顺畅,与算法 / Infra 其他角色高效协作;具备 owner 意识,对算子精度,数据参数,性能结果高度敏感
加分项:
1. 有国产 AI 芯片(如沐曦、昇腾、寒武纪等)算子移植、调优和交付经验
2. 熟悉主流 LLM 训练/推理框架(Megatron-LM / vLLM 等),熟悉训练/推理流程,并熟悉内部算子调用路径
3. 向主流算子库开源项目(如 CUTLASS、TE、Flash-Attention 等)提交过被主分支合并的关键 Patch
所属行业:计算机软件
职能分类:算法工程师
工作城市:
上海,招聘1人,详细地址:上海市静安区江宁路 699 号moho
职位要求
学历要求:研究生·统招
工作年限:5-8年
薪资福利
年薪范围:100-150万 15薪
薪资福利:五险一金、当地人力引进政策
团队架构
所属部门:研发部
汇报对象:部门经理
下属人数:-
职级职称:无
部门架构:无
面试信息
面试轮次:4轮
视频面试:可以接受
面试流程:初面(业务部门)- 领导评价 - 高层面试 - HR