高级运维工程师-武汉(SRE/云原生方向)
岗位信息
| 招聘单位 | 金山云 |
|---|---|
| 工作地点 | 武汉市 |
| 官方更新时间 | 2025-07-29T15:55:29 |
职位描述
【您将负责】
1. 设计并落地 5000+容器实例的 Kubernetes 高可用集群,并对其SLA负责。
2. 主导 CI/CD、IaC、灰度、蓝绿、A/B 等 DevOps 体系演进,提升测试和迭代效率。
3. 建设全链路监控(Prometheus + Thanos + Loki + Grafana)与AI智能告警能力建设,缩短 MTTR。
4. 设计建设多云或混合云状态下的高可用容灾方案,实现10分内跨region级别的故障转移。
5. 开发运维管理平台后端(非全栈)。
6. 其他基本运维职责,7x24响应、线上版本迭代、处理各种运维需求。
任职要求
【我们希望您具备】
1. 5-10 年互联网/云厂商运维或 SRE 经验,主导过1000台服务器以上生产环境节点管理
2. 精通 Linux 运维技能、网络技能,能独立进行系统和网络故障定位等疑难杂症。
3. 深度掌握 Kubernetes、Docker、Helm、Istio,具备大规模Pods生产集群落地与调优经验。
4. 熟练使用 Terraform/Ansible/Pulumi 等 IaC 工具,实现基础设施自动化。
5. 至少精通 Python 或 Go,能编写高质量运维平台后端
6. 主导建设过 Prometheus/Thanos/Grafana 全链路监控和 PagerDuty/Alertmanager 告警体系,MTTR<5 min。
7. 具备多云架构或混合云灾备设计与演练经验。
8. 与研发、测试、质量共建SRE文化,推动 Chaos Engineering、SLO/SLI 落地的经验
9. 本科及以上学历,计算机相关专业;CKA/CKS、云服务专家认证优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。