**********************
AI基础设施系统架构师
  • 收藏职位
  • 分享职位
50-100万 北京 本科 5-8年 招聘 1 人 预计佣金 108.8K 18:30发布
72小时新发
JD基本信息
岗位职责
集群网络架构设计 负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案; 针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。 网络方案规划与交付 主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计; 输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。 网络性能调优与可靠性保障 优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题; 设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。 跨域技术协同 与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路; 支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。 技术标准化与自动化 制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准; 推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。
任职要求
本科及以上学历,计算机、通信、网络工程等相关专业; 5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。 技术能力(硬性要求) 精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议; 高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先; 设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案; 故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。 软性素质 具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案; 具备项目管理能力,能协调厂商、施工队和内部团队按期交付; 对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。
所属行业:
人工智能/大模型/算力
职能分类:
架构师
工作城市:
北京,招聘1人,详细地址:北京市海淀区中关村东路8号东升大厦AB座群楼三层SA301、302、303、304,321,322,323,324,325单元
职位要求
学历要求:
本科·统招
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
50-100万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
-
面试流程:
-
视频面试:
不可以接受
为你推荐