招聘公告 · 职位检索 · 央国企/事业单位/名企

AI算力集群网络工程师(J10591)

单位:摩尔线程类型:社招地点:杭州市更新:2026-09-24

岗位信息

招聘单位摩尔线程
工作地点杭州市
官方更新时间2025-06-24T09:57:46

职位描述

核心职责

1. 网络架构设计与交付

○ 主导AI算力集群(GPU集群)的网络方案设计,重点优化高性能计算及分布式训练场景的网络架构。

■ 负责RoCE网络/IB网络的全栈设计与实现,包括无丢包网络的构建,确保低延迟、高吞吐。

■ 完成交换机选型、拓扑设计、配置部署(重点厂商:NVIDIA/新华三/浪潮/锐捷 等)。

■ 设计并实施网络自动化配置方案(Ansible/Python脚本等),提升大规模集群部署效率。

■ 设计实施ai训练/推理场景网络性能手动/自动测试,作为产品稳定性功能的重要组件。

2. 网络运维与优化

○ 监控集群网络性能(时延、吞吐量、丢包率),针对RoCE网络进行精细化调优(PFC、ECN、DCQCN策略配置)。

○ 定位并解决网络硬件故障(交换机 服务器 光模块 光纤等)

○ 定位并解决网络故障(如RDMA通信中断、拥塞风暴、路由震荡等),保障训练任务连续性。

○ 优化集群通信性能,减少AllReduce等集合操作时延。

○ 推动智能运维(AIOps)工具落地,实现网络异常预测与自动化根因分析。

3. 跨团队协作

○ 与计算/存储团队协同设计端到端性能优化方案(集合通讯库、高性能存储)。

○ 支持业务团队解决分布式训练中的网络瓶颈问题(如通信效率、多集群扩展)。

任职要求

必备技能

● 硬性要求:

○ 精通RoCE协议栈及无损网络技术(PFC、ECN、ETS)。

○ 3年以上超大规模数据中心网络实战经验(≥1000节点)。

○ 精通BGP/OSPF/EVPN/VxLAN等协议,具备跨厂商设备配置能力。

○ 熟练使用网络诊断工具(Wireshark、tcpdump、perf、rdma_perf)。

○ 熟悉Linux网络栈调优(TCP参数、IRQ绑定、NUMA亲和性)。

○ 具备网络自动化开发能力(Python/Go/Ansible)。

● 加分项:

○ 有NVIDIA Quantum/Spectrum交换机或InfiniBand网络运维经验。

○ 熟悉AI训练框架通信原理(NCCL/UCX/MPI)。

○ 持有CCIE/CCNP/JNCIE或同等级别认证。

任职要求

● 本科及以上学历,计算机/通信/电子工程相关专业。

● 具备高强度问题攻关能力,能快速定位复杂网络问题(如Incast拥塞、RDMA CM断开)。

● 良好的技术文档习惯,能输出架构设计、故障分析报告。

● 有AI/HPC/云平台(AWS/Azure/GCP)网络支持经验者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。