SRE与可观测平台工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-09-09 11:44:39 |
职位描述
负责智元具身智能AI云平台的可靠性与可观测建设,覆盖控制面、计算、存储、网络及训练服务。可按可靠性工程或可观测研发方向应聘,任职要求中的方向项满足其一即可,入职后按专长分工。
主要职责
1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。
2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。
3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。
4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。
5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。
6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。
承担主要目标/关键任务
1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。
2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。
3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。
4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。
5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。
6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。
任职要求
任职要求
1. 教育背景:本科及以上学历,计算机、软件工程、网络工程、信息技术等相关专业优先。
2. 工作经验:3年以上SRE、云平台运维或可观测研发经验,具备生产故障处理或平台建设经历;具有5年以上相关经验及可靠性体系建设经验者优先。
3. 熟悉Linux、容器和Kubernetes,能够结合系统指标、日志及网络信息分析常见故障,具备生产问题定位能力。
4. 掌握Python、Go或Shell至少一种语言,能够开发可维护的自动化工具,具备代码管理、测试和技术文档编写习惯。
5. 可靠性方向:熟悉发布、升级和回滚流程,理解SLI、SLO、容量规划及故障复盘,能够推进生产变更与协同排障。
6. 可观测方向:熟悉Prometheus、Grafana或同类工具,具备监控或日志平台建设经验,理解链路追踪与告警治理。
加分项
1. 有GPU集群、训练平台、分布式存储或高性能网络的可靠性保障经验,能定位跨组件故障。
2. 有OpenTelemetry或同类工具实践,具备告警降噪、故障演练或自动化诊断项目经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。