联通云智算测试与质量专家(研发方向)(J13256)
岗位信息
| 招聘单位 | 联通数字科技有限公司 |
|---|---|
| 工作地点 | 北京市 |
| 官方更新时间 | 2026-01-21T16:41:22 |
职位描述
1、负责联通云智算平台(训练/推理/异构池化/智算网络)全链路测试体系设计、自动化框架开发与持续集成落地,实现版本缺陷率 ≤ 0.2/KLOC,线上故障漏检率 ≤ 0.1%;
2、主导万卡级智算场景性能、可靠性、稳定性、安全、容灾测试方案制定与执行,覆盖 GPU/ASIC 异构算力、RDMA 网络、并行文件系统、K8s 调度、AI训推框架,输出测试基线与风险评估报告;
3、构建 AI 专项测试框架(训推性能、训推稳定性、CUCCL 性能、显存泄漏、功耗墙、温度墙等),实现千亿参数模型 7×24 小时持续训练/推理无异常;
4、设计并实现智算网络测试平台,支持 800 Gbps 线速流量生成、突发注入、乱序/丢包/延时故障仿真,AllReduce 性能偏差 ≤ 3%;
5、负责混沌工程与故障演练体系,实现 GPU Hang、NVLink 闪断、RDMA 链路降速、交换机重启、Checkpoint 损坏等多种故障场景分钟级自动注入与自愈验证;
6、构建多租户隔离与安全测试用例,覆盖 vGPU逃逸、RDMA越权、显存泄露、模型加密、国密算法、等保三级/密评,确保零安全漏洞上线;
7、主导测试数据集建设工作,支持每日自动测试任务执行与结果比对;
8、配合研发设计质量门禁与灰度发布策略,实现代码覆盖率 ≥ 90%、接口覆盖率 ≥ 95%、性能回归自动拦截、异常自动回滚。
任职要求
1、本科及以上学历,计算机、软件工程、人工智能、通信等相关专业,8 年以上云计算/AI 平台测试或质量保障经验,其中 3 年以上智算方向测试带头人经历;
2、熟悉 PyTorch、TensorFlow、DeepSpeed、Megatron-LM、NCCL、CUDA、RDMA Verbs,具备测试框架二次开发能力;
3、熟悉GPU/ASIC 硬件架构(SM、Tensor Core、NPU、HBM、NVLink、RDMA),熟悉 nvidia-smi、nsight、perf、bpf、valgrind 等调试工具;
4、熟悉云原生测试技术(K8s、RobotFramework、PyTest、TestKube)并有大规模自动化落地经验;
5、具备性能、可靠性、安全、混沌、容灾测试能力,熟悉 AllReduce、AllGather、Checkpoint、RDMA、GPU 池化、vGPU、SR-IOV 测试方法;
6、具备数据科学与统计学基础,能独立设计实验、分析误差、协助研发定位根因、提出优化方案;
7、熟练使用 Jenkins、GitLab-CI、SonarQube、Prometheus、Grafana、ELK 等质量与可观测工具;
8、具备优秀的跨团队沟通与项目推动能力,可在高压环境下同时推进 5+ 版本按期高质量发布;
9、具备良好的英语读写与沟通能力。
优先条件
1、有成功主导单集群 ≥ 1 万卡智算平台全链路测试与上线经验,稳定运行 1 年以上;
2、熟悉国产 AI 芯片(昇腾、寒武纪、昆仑芯等)测试方法及工具,并有大规模商用实践;
3、有电信级高可用、等保三级/密评保障项目经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。