AI平台SRE工程师
岗位信息
| 招聘单位 | 自变量机器人 |
|---|---|
| 工作地点 | 深圳 |
| 官方更新时间 | 2026-08-06 20:22:45 |
职位描述
1. 负责 AICP 在云和 Kubernetes 上的可用性、性能、容量和灾备。
2. 建立 SLI/SLO、错误预算、告警、值班、事故指挥和复盘机制。
3. 负责 PostgreSQL 高可用、备份、PITR、恢复演练、性能和升级。
4. 负责 APISIX、Ingress、魚载均衡、DNS、TLS、路由、限流和流量切换。
5. 维护应用、微服务、外部依赖、日志、指标和追踪体系。
6. 维护 CI/CD、GitOps、生产发布、数据库迁移、配置和密钥变更。
7. 负责云资源运行、成本与容量,并通过IT流程使用RAM、VPC、DNS 和安全能力。
8. 推动研发补齐幂等、超时、降级、对账和可观测性。
任职要求
1. 5年以上 SRE、云平台或后端生产运维经验,3年以上 Kubernetes生产经验。
2. 深入理解 Linux、TCP/P、HTTP、DNS、TLS、热载均衡和微服务故障模式。
3. 熟悉 PostgreSQL 备份恢复、复制、连接、锁、索引、VACUUM 和性能分析。
4. 熟悉 Prometheus/Grafana、SLS/ELK、OpenTelemetry 中至少两类。
5. 熟悉 APISIX、Nginx、Envoy 或云网关中的一类,理解灰度、限流和熔断。
6. 熟悉阿里云 VPC、RAM、ACK、RDS/自建数据库、OSS、SLS、负载均衡和 DNS。
7. 能够使用 Terraform、Ansible、Helm、Kustomize、GitOps 或同类工具进行自动化。
8. 具备生产事故、变更、容量、灾备和跨团队沟通经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。