IT-SRE架构师(可观测性方向)
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-08-19 11:30:21 |
职位描述
一块真正的绿地,且架构决策权在你手上。选型论证已完成、预算已批,但所有技术细节——链路怎么串、埋点规范怎么定、采样策略、边缘拓扑——都由你来定义。你不会接手一个别人建了一半的烂摊子;
商业工具的预算是给足的。团队的原则是「商业优先、自研脱水采购平台」,Dynatrace 商业版、快猫星云商业支持、Flashduty 专业版均已列入预算盘点(Flashduty 专业版已定版)。你的精力会花在架构与治理上,而不是省钱造轮子和填开源坑;
三类差异极大的观测对象。标准的信息化业务与云原生微服务、机器人产品的端云一体链路、GPU 算力集群与大模型调用——后两类在业界都没有成熟方案,是能做出独特技术积累的地方;
建能力和用能力在同一个人手里。你不会只交付一个平台然后交给别人去用——SLO 怎么定、告警怎么治、故障怎么复盘,都由你基于自己建的能力来推动,闭环完整;
明确的职责边界与合理的预期。这个岗位覆盖面很宽,所以我们把节奏也讲在前面:首年的重心是链路/APM 与稳定性治理(Dynatrace 落地与主机分档台账、告警治理、OnCall 与复盘机制、1-2 个核心服务的 SLO),广度监控平台是第二阶段并会为它单独补 HC,GPU 与机器人两条线首年只做口径定义与试点。团队规划里对每条线的工作量都有量化估算,不承诺做不到的交付,也不会用「全都要」把人耗干;
具身智能赛道:公司业务处在机器人产业化的一线,可观测性会直接支撑机器人产品的规模化交付。
任职要求
计算机相关专业本科及以上,6 年以上后端 / SRE / 基础架构经验,其中至少 3 年专注可观测性方向;
有从 0 到 1 搭建企业级可观测平台的完整经验(不是「使用过」或「维护过」),能清晰讲出当时的架构选择、被否掉的方案以及踩过的坑;
精通分布式链路追踪:深入理解 OpenTelemetry 规范与生态,有 Jaeger / Tempo / SkyWalking / Zipkin 中至少一套的生产落地经验,能独立设计跨语言跨中间件的埋点与上下文传播方案;
精通 Prometheus 生态与指标体系设计,有 VictoriaMetrics / Thanos / Mimir 等大规模时序存储的生产调优经验;
熟练掌握 Go / Java / Python 中至少一门,能独立编写 exporter、OTel Collector processor、采集插件——本岗位需要动手写代码,不是纯方案岗;
理解 APM 探针的实现原理(字节码注入 / eBPF / 运行时 Hook),能判断商业产品的能力边界与适用场景;
有多云或混合云环境的监控落地经验;
有 SLI/SLO 体系与故障应急机制的落地经验:主导过 SLO 口径与研发团队的共识过程、建设过 OnCall 排班与升级策略、组织过 P1 故障复盘并推动改进项闭环。只有理论认知、没有真正推动过研发接受 SLO 目标的候选人不符合要求;
具备成本意识:能把技术方案换算成账单,并主动在方案里设计成本控制点。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。