云基础设施工程师(可灵AI)
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-09-23T14:24:01.000+08:00 |
职位描述
1、作为云基础设施团队成员,你将参与以下工作。具体职责将根据个人经验、技术特长和团队分工确定,重点承担其中一个或多个方向;
2、基础设施与容器方向:负责计算、容器、网络、存储及负载均衡等基础设施的交付和运维;负责 Kubernetes 集群及基础组件的升级、容量管理、故障排查、变更发布和容灾演练;
3、稳定性与可观测方向:建设和完善指标、日志、链路、告警及 SLO 体系;参与线上故障应急响应,完成影响评估、止损恢复、根因分析和改进项落地;推进风险治理、故障预防、自动恢复和稳定性专项建设;
4、自动化与平台工程方向:使用 Terraform、GitOps 等技术推动基础设施即代码和自动化交付;参与变更平台、自助交付平台及运维工具的设计与开发;优化基础设施交付流程,减少人工操作并提升研发团队的使用体验;
5、资源与架构治理方向:参与资源清单、配置基线、生命周期、容量和成本治理;参与跨地域网络、容灾架构和基础设施标准化建设;与研发、安全、网络及业务团队协作,推动基础设施问题的端到端解决;
6、流量接入方向:负责域名、DNS、CDN、WAF、负载均衡、API 网关及 Kubernetes Gateway/Ingress 等流量接入基础设施的建设和运维;负责流量路由、灰度发布、限流熔断、跨地域调度及故障切流能力建设,保障业务流量接入的稳定性和可扩展性;参与流量链路的性能优化、安全防护、容量规划和故障排查,推动接入标准化与自动化。
任职要求
1、计算机或相关专业本科及以上学历,具备 3 年以上 SRE、云平台运维、DevOps 或运维开发经验;
2、熟悉 Linux 操作系统和计算机网络基础,具备生产环境问题分析和故障排查能力;
3、掌握 Go、Python 或 Shell 中至少一种,能够通过程序或脚本解决重复性运维问题;
4、具备良好的生产风险意识,理解变更、回滚、应急响应和事故复盘等基本方法;
5、具备良好的文档能力、沟通能力和跨团队协作能力。
加分项:
1、熟悉 Kubernetes,具备容器平台建设或生产运维经验;
2、熟悉主流公有云或私有云平台,具备计算、网络、存储或负载均衡等资源的运维经验;
3、具备监控告警、容量管理、故障应急、容灾演练或 SLO 建设经验;
4、熟悉 Prometheus、Grafana、OpenTelemetry 或同类可观测技术;
5、熟悉 Terraform/OpenTofu、GitOps 等自动化技术;
6、有变更平台、自助交付平台、CI/CD 或运维工具开发经验;
7、有多账号、多地域、混合云或多云环境的规划与治理经验;
8、有容量规划、成本优化、配置基线、资源生命周期或跨地域容灾经验;
9、在容器、网络、可观测、运维开发或资源治理中的某一领域具备较强技术深度;
10、有 0-1 公有云搭建和运维经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。