招聘公告 · 职位检索 · 央国企/事业单位/名企

GPU集群交付技术经理

单位:无问芯穹类别:互联网 / 电子 / 网游类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位无问芯穹
工作地点北京
官方更新时间2026-08-24 17:45:22

职位描述

岗位概述

负责大模型智算集群项目全流程交付落地,主导千卡 / 万卡级 GPU 集群现场实施、联调、问题闭环,对接客户、算力基础设施、算法团队,保障国产加速卡 / N 卡大规模智算集群顺利上线、稳定投产,统筹项目进度、风险与质量,支撑大模型训练 / 推理业务算力底座交付。

岗位职责

负责千卡 / 万卡级别智算 GPU 集群项目整体交付管理,覆盖硬件上架部署、网络组网、集群软件栈部署调优、集群验证、上线交付全流程;支持 NVIDIA 卡、国产加速卡集群交付实施。

统筹项目计划,识别交付风险,协调硬件、网络、固件、驱动、集群调度、客户侧多方资源,推进问题定位闭环,把控项目进度、成本、交付质量,按期完成集群验收交付。

负责大规模集群环境故障排查,包含硬件、IB/RoCE 网络、驱动固件、容器、调度器、多机通信等集群层问题,支撑大模型训练业务稳定性验证。

和客户对接需求、输出交付方案、测试方案、验收文档,组织现场验收,输出交付报告,沉淀大规模集群交付案例、问题库、交付最佳实践。

对接研发团队,反馈大规模集群下软硬件适配 bug,推动版本迭代优化,提升集群交付效率与稳定性。

管理现场实施资源,协调外包 / 实施工程师,把控现场实施规范,保障交付安全。

任职要求

任职要求

本科及以上学历,计算机、网络、电子信息相关专业,3 年及以上智算 / 超算 / GPU 集群交付实施经验;必须具备千卡及以上规模 GPU 集群完整交付经验,有万卡集群交付经验优先,N 卡、国产加速卡集群经验均可。

熟悉大规模 GPU 智算集群架构,了解 IB/RoCE 高速网络,熟悉 Linux 系统,掌握驱动、固件、容器、K8s、算力调度组件部署调优。

完整参与过大型智算集群从进场部署到验收上线全流程,具备多项目并行管理能力,擅长项目风险识别与跨团队问题推动解决。

较强客户沟通能力,可输出交付方案、测试、验收文档,能够独立对接客户完成需求对齐与项目验收。

能够接受项目现场出差,抗压能力强,面对大规模集群复杂问题具备较强排查思路。

加分项:国产加速卡集群交付经验;大模型训练集群调优经验;熟悉 Slurm 调度;智算中心项目交付背景。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。