【共创】Kubernetes 运维工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-04-02 10:47:34 |
职位描述
负责公司 Kubernetes 集群的规划、部署、升级、监控与高可用保障,支撑数百节点规模的生产环境;
设计并实施安全、稳定、高效的 CI/CD 流水线,集成 GitOps(如 Argo CD)、Helm、Kustomize 等工具;
优化集群资源利用率,通过 HPA/VPA、Cluster Autoscaler、Cost Allocation 等手段实现成本可控;
构建可观测性体系:基于 Prometheus + Grafana + Loki + Tempo 实现日志、指标、链路追踪一体化监控;
制定并落地 K8s 安全策略:包括 Pod Security Admission、NetworkPolicy、RBAC、镜像扫描、运行时安全(Falco)等;
支持多云/混合云架构(AWS EKS / Azure AKS / 阿里云 ACK / 自建集群),实现跨环境一致性管理;
编写自动化脚本(Python/Go/Bash)和基础设施即代码(IaC)模板(Terraform/Ansible);
响应 P0/P1 级故障,主导根因分析(RCA),推动系统健壮性提升;
沉淀最佳实践,输出技术文档,赋能开发团队自助使用 K8s 平台。
任职要求
3 年以上生产环境 K8s 集群管理经验;
深入理解 Kubernetes 核心组件(etcd, kube-apiserver, scheduler, controller-manager, CNI, CSI);
熟练掌握 Helm、Kustomize、Argo CD 等声明式部署工具;
精通至少一种主流云平台(AWS/Azure/GCP/阿里云)的容器服务;
熟悉 Prometheus 监控体系及告警规则配置;
具备扎实的 Shell/Python 脚本能力,能快速开发运维工具;
熟悉 Docker 容器原理、镜像构建优化及安全扫描;
具备良好的故障排查能力,能熟练使用 kubectl, crictl, tcpdump, perf 等工具。
加分项
有大规模 K8s 集群(500+ 节点)调优经验;
熟悉 Service Mesh(Istio/Linkerd)或 Serverless(Knative);
参与过 CNCF 开源项目或持有 CKA/CKAD/CKS 认证;
了解 eBPF、Cilium、Calico 等高级网络方案;
有 GitOps、FinOps 或混沌工程实践经验;
熟悉 Operator 开发或自定义 Controller。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。