招聘公告 · 职位检索 · 央国企/事业单位/名企

边缘基础设施运维工程师

单位:腾讯类别:技术类型:社招地点:深圳更新:2026-09-24

岗位信息

招聘单位腾讯
部门/事业群CSIG
所属产品音视频PaaS
工作地点深圳
经验要求三年以上工作经验
官方更新时间2026年07月24日

职位描述

1.物理基础设施纳管;

2.负责边缘机房 GPU 服务器(NVIDIA A100/H100/L40S 等)、CPU 服务器、存储节点等物理设备的全生命周期管理,包括上架验收、固件/驱动升级、故障诊断与硬件替换;

3.建立和维护硬件资产台账与自动化纳管流程,保障设备信息准确、可追溯。制定并执行硬件巡检计划,定期输出设备健康度报告,对硬件 EOL/EOS 风险进行预警和替换规划;

4.边缘网络与机房运维;

5.负责边缘机房网络设备(交换机、路由器、防火墙等)的标准化配置、日常监控和故障处理,确保边缘节点到中心管控面的网络连通性与低延迟;

6.维护机房网络拓扑文档,参与带宽规划、链路冗余设计和网络割接;

7.与 IDC/运营商对接,处理机房环境(电力、制冷、机架空间)相关事宜,保障基础设施 SLA;

8.容器化平台与云原生运维;

9.管理和维护基于 Kubernetes 的边缘容器平台,负责集群部署、版本升级、节点扩缩容和资源调度策略优化;

10.实现 GPU 资源的容器化纳管:包括 GPU 驱动兼容性管理、GPU Operator 部署、MIG(多实例 GPU)配置、GPU 共享与隔离策略;

11.建设面向外部客户的算力交付流水线:容器镜像管理、Helm Chart 标准化、命名空间/租户隔离、配额管理、监控告警接入;

12.维护平台核心组件(包括但不限于 GPU Operator、Prometheus/Grafana 监控栈、Loki/ELK 日志系统、分布式存储 CSI 插件、Ingress Controller、Service Mesh 等);

13.服务保障与持续优化;

14.建立并维护 SLO/SLI/SLA 指标体系,保障服务的可用性、性能和容量;

15.编写运维自动化脚本和工具,推动运维操作代码化(Infrastructure as Code),减少人工操作;

16.参与 on-call 轮值,及时响应和处理生产环境故障,输出故障复盘报告;

17.持续关注云原生和边缘计算社区技术动态,推动基础设施架构演进。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。