AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合)
岗位信息
| 招聘单位 | 德赛西威 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-06-03 16:10:11 |
职位描述
1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;
2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;
3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。
任职要求
1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;
2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;
3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;
4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;
5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。
加分项
1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;
2.Elasticsearch、Loki、Jaeger 等组件部署调优;
3.智驾 / 大规模 AI 训练基础设施背景。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。