职位编号 J20260902093144133011
大模型Infra工程师
100-150万北京市本科不限招聘 1 人预计佣金 139.2K9月23日 09:24刷新/9月2日 09:31发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:3年以上经验即可
优先条件:3年以上经验即可
目标公司/行业:3年以上经验即可
必问问题:
待发单方补充
JD基本信息
岗位职责
1、参与国内领先的实时交互视频生成模型 Vidu S 的研发,进行千卡规模的训练。负责流式视频生成模型大规模分布式训练系统的架构设计与持续优化,涵盖 FSDP2、Context Parallel、Pipeline Parallel 等多维并行策略;
2、设计和优化训练框架核心模块,持续提升训练吞吐与资源利用率;紧密配合算法团队,为新算法范式快速搭建高效训练流水线,降低算法迭代到实验验证的周期;
3、深入 GPU 内核层面进行性能调优,包括算子融合、通信与计算重叠、显存精细化管理等,结合 profiling 工具定位瓶颈并驱动端到端训练效率提升。
任职要求
1、有扎实的工程算法基础,熟悉 GPU 架构、内存层次与分布式计算理论, 熟练掌握各种编译、调试、性能分析工具 (pdb/gdb/nsys/torchprofiler);
2、熟悉Megatron/DeepSpeed/Torch-FSDP 等分布式训练框架,能够设计并协同落地高效并行机制,推动框架持续演进、满足模型架构升级 (多模态、复杂结构,超大参数)带来的各种能力诉求;
3、熟悉Triton, Tilelang, cutlass等GPU算子编程框架;
4、熟悉nvidia最新GPU特性(tma, cluster cta, tcgen05);
5、熟悉主流大模型结构细节及其训练方法或显著开源贡献者优先。
所属行业:人工智能/大模型/算力
职能分类:大模型算法
工作城市:
北京,招聘1人,详细地址:北京市
职位要求
学历要求:本科
工作年限:不限
薪资福利
年薪范围:100-150万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:二轮业务 一轮HR