招聘公告 · 职位检索 · 央国企/事业单位/名企

【共创】Kubernetes 运维工程师

单位:智元机器人类别:互联网 / 电子 / 网游类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位智元机器人
工作地点上海
官方更新时间2026-04-02 10:47:34

职位描述

负责公司 Kubernetes 集群的规划、部署、升级、监控与高可用保障,支撑数百节点规模的生产环境;

设计并实施安全、稳定、高效的 CI/CD 流水线,集成 GitOps(如 Argo CD)、Helm、Kustomize 等工具;

优化集群资源利用率,通过 HPA/VPA、Cluster Autoscaler、Cost Allocation 等手段实现成本可控;

构建可观测性体系:基于 Prometheus + Grafana + Loki + Tempo 实现日志、指标、链路追踪一体化监控;

制定并落地 K8s 安全策略:包括 Pod Security Admission、NetworkPolicy、RBAC、镜像扫描、运行时安全(Falco)等;

支持多云/混合云架构(AWS EKS / Azure AKS / 阿里云 ACK / 自建集群),实现跨环境一致性管理;

编写自动化脚本(Python/Go/Bash)和基础设施即代码(IaC)模板(Terraform/Ansible);

响应 P0/P1 级故障,主导根因分析(RCA),推动系统健壮性提升;

沉淀最佳实践,输出技术文档,赋能开发团队自助使用 K8s 平台。

任职要求

3 年以上生产环境 K8s 集群管理经验;

深入理解 Kubernetes 核心组件(etcd, kube-apiserver, scheduler, controller-manager, CNI, CSI);

熟练掌握 Helm、Kustomize、Argo CD 等声明式部署工具;

精通至少一种主流云平台(AWS/Azure/GCP/阿里云)的容器服务;

熟悉 Prometheus 监控体系及告警规则配置;

具备扎实的 Shell/Python 脚本能力,能快速开发运维工具;

熟悉 Docker 容器原理、镜像构建优化及安全扫描;

具备良好的故障排查能力,能熟练使用 kubectl, crictl, tcpdump, perf 等工具。

加分项

有大规模 K8s 集群(500+ 节点)调优经验;

熟悉 Service Mesh(Istio/Linkerd)或 Serverless(Knative);

参与过 CNCF 开源项目或持有 CKA/CKAD/CKS 认证;

了解 eBPF、Cilium、Calico 等高级网络方案;

有 GitOps、FinOps 或混沌工程实践经验;

熟悉 Operator 开发或自定义 Controller。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。