招聘公告 · 职位检索 · 央国企/事业单位/名企

AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合)

单位:德赛西威类型:社招地点:上海更新:2026-09-21

岗位信息

招聘单位德赛西威
工作地点上海
官方更新时间2026-06-03 16:10:11

职位描述

1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;

2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;

3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。

任职要求

1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;

2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;

3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;

4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;

5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。

加分项

1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;

2.Elasticsearch、Loki、Jaeger 等组件部署调优;

3.智驾 / 大规模 AI 训练基础设施背景。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。