**********************
AI Infra 训推优化专家
  • 收藏职位
  • 分享职位
100-150万 上海 研究生 3-5年 招聘 1 人 预计佣金 170.1K 16:14刷新/1天前发布
迅致直营 反馈快 72小时新发
职位亮点
反馈快、回款快
JD基本信息
岗位职责
1. 大模型训练全流程性能分析。负责 LDM 模型(Large Data Model)预训练与后训练场景下的端到端性能分析,定位计算、显存和通信瓶颈,系统性提升 GPU 利用率,降低算法团队整体训练成本 2. 算法迭代的 Infra 演进式支持。针对模型结构演进(如 Attention 变体)、Loss 计算更新、Optimizer 策略变化等日常算法迭代,提供及时的 Infra 性能支持方案与演进计划,确保算法迭代不被性能问题阻塞,缩短模型实验周期 3. 大规模 scale-up 训练支撑。设计并实现大规模分布式训练方案,综合权衡各类并行策略,在模型规模/数据规模持续扩大的情况下,做好计算、显存和通信的整体平衡,支撑百卡至千卡级稳定训练 4. 保障 Infra 代码质量和稳定性。与 Infra QA 团队紧密协作,主导性能回归问题的定位与修复;参与 Benchmark 标准制定和 Gitlab CI 系统落地,确保训推框架在高频迭代中长期健康演进 5. 推理性能优化与方案设计。针对大批量数据 & 有限显存资源场景,设计高效的分布式推理方案,在保障推理精度一致性的前提下,最大化吞吐和资源利用率,为未来推理服务化奠定工程基础
任职要求
1. 学历与经验:计算机、软件工程、人工智能等相关专业,硕士及以上学历,3-8 年 AI 训练/推理框架优化经验 2. 分布式训练基础:深入理解 Transformer 架构和核心逻辑;熟悉主流并行策略原理、变体适用场景;熟悉混合精度训练的收益和限制;熟悉 Megatron-LM 或 Deepspeed 训练框架,并有百卡以上 GPU 集群训练调优经历 3. Pytorch 与训练流程:精通 Pytorch 框架,熟悉训练全流程,能够快速定位并解决训练中的功能性错误、数值不稳定性和性能退化问题 4. 性能分析与高性能计算:熟练掌握复杂环境(多机多卡、CPU+GPU)的性能分析方法,快速根据日志或 Profiler 工具快速定位性能瓶颈;深入理解 CUDA 常见概念及对性能的影响(如 Stream 等);基于算子 Benchmark 数据进行算子选型与替换决策 5. 编程语言:精通 Python,良好设计/封装能力;熟悉 C/C++,能够在 Native 源码基础上 Debug 或轻量扩展 6. 软素质:工作细心踏实不浮躁;沟通顺畅,与算法和其他 Infra 角色高效协作;具备 owner 意识,对训推稳定性和性能结果负责 加分项: 1. 有 CPU 性能优化经验(SIMD、多进程/线程并发、内存布局优化等),在数据生成或预处理阶段落地过优化方案 2. 熟悉主流推理框架(vLLM / SGLang 等),了解 KV cache、PagedAttention、Batching、低比特量化等关键机制 3. 有变长数据训练经验或 FP8 精度的训练优化经验
所属行业:
计算机软件
职能分类:
算法工程师
工作城市:
上海,招聘1人,详细地址:上海市静安区江宁路 699 号moho
职位要求
学历要求:
研究生·统招
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
100-150万*15薪
薪资福利:
五险一金、当地人力引进政策
团队架构
所属部门:
研发部
下属人数:
-
部门架构:
汇报对象:
部门经理
职级职称:
面试信息
面试轮次:
4轮
面试流程:
初面(业务部门)- 领导评价 - 高层面试 - HR
视频面试:
可以接受
为你推荐