资深算力服务器稳定性专家
岗位信息
| 招聘单位 | 哔哩哔哩 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-08-05 11:56:12 |
职位描述
工作职责:
1. 负责AI算力集群运维体系建设,保障算力集群持续稳定运行。
2. 负责AI算力集群可观测性建设,建立各类故障知识库,提高故障发现覆盖率与准确率
3. 参与AI算力集群建设交付,制定并优化算力交付基线、交付压测与检查,保障交付资源稳定性与性能一致性。
4. 构建自动化运维工具链,提升集群故障自愈率与运维效率,有效降低故障影响。
工作要求:
1. 计算机、电子工程或相关专业本科及以上学历,熟悉PCIe、NVLink、CXL等高速互联协议,了解GPU服务器架,具备6年以上服务器硬件研发经验;
2. 熟悉主流AI服务器的硬件及系统、RDMA网络等相关基础设施,有千卡及以上规模AI算力集群建设、运维经验优先;有互联网大厂或服务器ODM/OEM厂商工作经验者优先;
3. 对AI集群运维有较好的认知和全局意识,具备有较强的分析、解决问题的能力;
4. 具备优秀的故障定位与根因分析能力,能独立驱动跨团队协作解决复杂硬件问题;
5. 良好的沟通协作能力,有良好的团队合作精神;对工作充满热情,责任心强、有一定的抗压能力;
6. 能够熟练运用脚本语言(Python/Shell等)完成日常任务或自动化工具开发
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。