SRE / 云运维工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-09-24 16:57:50 |
职位描述
岗位职责
- 负责部门云资源(计算、存储、网络、数据库、中间件等)的申请受理、开通、变更、回收的全生命周期管理;
- 制定资源命名、标签、配额、权限等管理规范并推动落地;
- 负责云成本管理:账单分析、资源利用率优化、预算与告警、定期清理闲置资源;
- 负责云上权限与安全:账号体系管理、最小权限原则、密钥管理、安全组基线;
- 搭建并维护资源与集群监控告警(Prometheus / Alertmanager / Grafana),参与值班和故障处理;
- 负责 Kubernetes 集群的日常运维:节点扩缩容、命名空间与资源配额管理、Pod 故障排查;
- 维护团队共用开发容器镜像(构建、发布、多架构版本管理),受理并评审镜像相关需求;
- 编写运维文档,支持业务团队使用云资源,对接云厂商;
- 参与研发流程自动化建设(工单、自助化、AI 工具在内部流程的落地)
任职要求
任职要求
- 本科及以上,计算机相关专业;
- 3 年以上公有云(阿里云 / 腾讯云 / 华为云 / AWS 等)实际使用与运维经验;
- 熟悉容器技术:Dockerfile 编写、多架构镜像构建、镜像仓库使用;熟悉 k8s / helm,能在 AI 工具辅助下完成集群日常运维;
- 熟悉主流云产品:云主机、VPC 网络、负载均衡、云数据库、对象存储,理解网络、存储、权限体系的基本原理;
- 熟练掌握 Python / Shell / Go 中至少一门语言,有自动化意识;
- 熟悉监控告警体系及相关技术栈(Prometheus / Alertmanager / Grafana),有实际配置与维护经验;
- 熟悉 Terraform / Ansible 等自动化工具者优先;
- 有成本优化、权限治理、监控告警建设经验者优先;
- 流程意识与责任心强,沟通和文档能力好,能独立对接业务团队与云厂商。
加分项
- 云厂商认证(如阿里云 ACP / ACE、AWS SA)、多云经验;
- 熟练使用 AI 工具(Claude Code / Codex 等)辅助运维工作,能对 AI 产出的配置与命令做独立验证,有把重复劳动做成工具的习惯;
- 有参与开源项目的经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。