招聘公告 · 职位检索 · 央国企/事业单位/名企

AI 可观测系统研发工程师

单位:MiniMax类别:基础架构类型:社招地点:北京、上海更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点北京、上海
官方更新时间2024-07-17 11:20:50

职位描述

一、一句话定位

面向大模型训练、大模型推理与 Agent 运行时建设新一代可观测平台,连接硬件、网络、存储、模型框架、推理引擎和 Agent 执行轨迹,让复杂 AI 系统的异常看得见、定得准、恢复快、价值可衡量。

二、为什么这个岗位重要

大模型系统的问题往往横跨 GPU、网络、存储、容器、框架、推理引擎、模型行为和外部工具。我们希望建设统一的数据与诊断能力,回答三类核心问题:

训练为什么中断、变慢或损失有效算力;

推理为什么首 Token 变慢、吞吐下降、成本升高或质量退化;

Agent 为什么任务失败、循环调用、链路异常或 Token 消耗失控。

三、你将负责什么

1. 建设统一的 AI 可观测平台

建设指标、日志、Trace、事件的采集、处理、存储、查询与可视化能力;

建立作业、请求、Agent 任务与节点、GPU、Pod、进程、Rank、模型、版本之间的关联;

治理高基数、高频事件和大规模时序数据,探索异常检测、告警降噪与根因分析能力。

2. 支撑大模型训练可观测

建设覆盖基础设施、通信与运行时、训练框架、模型与数据的分层观测体系;

关联 job → pod/process → rank → node → GPU UUID,诊断训练 Hang、慢 Rank、硬件、网络、存储和 Checkpoint 异常;

量化训练进度、有效算力及重试、等待损耗,推动问题处置和效果验证闭环。

3. 支撑大模型推理可观测

建设覆盖网关、路由、批处理、推理引擎、模型实例和 GPU 的请求级观测;

观测 TTFT、TPOT、排队、吞吐、KV Cache、Token 等指标,定位 Prefill、Decode、调度与资源争用问题;

关联模型版本、参数、上下文、输出质量和成本,支持性能与质量回归分析。

4. 支撑 Agent 运行时可观测

建设 Agent 任务到模型、工具、子 Agent、记忆和知识库访问的完整执行轨迹;

支持顺序、并行、循环和分支结构,量化任务成功率、工具成功率、重试及 Token 成本;

结合规则、模型评估、人工反馈和业务结果,诊断依赖故障、工作流异常及质量回归。

任职要求

四、我们期望你具备

基本要求

1. 计算机或相关专业本科及以上学历,或具备同等工程能力;

2. 具备 3 年以上可观测、基础架构、分布式系统、云原生平台或后端平台研发经验;资深候选人需有大型生产系统的设计与落地经历;

3. 熟练掌握 Go、Java、C++、Rust、Python 中至少一门语言,具备扎实的并发编程和系统设计能力;

4. 熟悉 Metrics、Logs、Traces、Events 中至少两类数据的完整工程链路;

5. 熟悉 Linux、网络、容器、Kubernetes 和分布式系统,能够开展跨层问题分析;

6. 具备良好的抽象、落地和协作能力,愿意深入理解 AI 工作负载。

加分项

1. 有 Prometheus/Mimir、VictoriaMetrics、Thanos、OpenTelemetry、Jaeger/Tempo、Loki/ELK、ClickHouse、Grafana 等系统经验;

2. 有 GPU、RDMA、NCCL、分布式训练、Checkpoint 或训练稳定性经验;

3. 有 vLLM、TensorRT-LLM、SGLang、TGI、模型网关或容量管理经验;

4. 有 Agent Runtime、工作流引擎、LLM Trace 或评测平台经验;

5. 有 eBPF、AIOps、开源贡献或从 0 到 1 建设平台的经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。