招聘公告 · 职位检索 · 央国企/事业单位/名企

MaaS 架构师

单位:MiniMax类别:研发类型:社招地点:上海、北京更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点上海、北京
官方更新时间2026-06-22 17:35:11

职位描述

作为 MaaS 架构师,你将全面负责大模型线上服务的全链路架构设计与质量保障,构建高性能、高可用、可弹性伸缩的模型服务平台,确保模型在生产环境中的 SLA、延迟、吞吐量达到业界领先水平。工作包括不限于:

-负责 MaaS 平台架构设计,明确模型从产出到上线的全链路环节,对模型服务的 SLA、延迟、吞吐量等核心指标负责

-主导大模型推理网关的设计与建设,包括多模型路由、流量调度、优先级队列、多租户隔离与 Token 级计量能力

-设计 GPU 资源弹性伸缩策略,结合模型特征与负载信号实现智能调度与资源高效利用

-推动 KV Cache 感知调度的方案设计与落地,包括 Prefix Caching、Paged Attention 等技术在生产环境的应用,提升显存利用率与系统吞吐

-参与单机推理框架的选型、适配与性能调优,跟进 vLLM / TensorRT-LLM / SGLang 等主流引擎的演进,推动 Continuous Batching、Speculative Decoding、量化部署等优化落地

-构建推理负载的统一抽象与服务化封装,支持 LLM / 多模态 / Embedding 等多种负载类型的标准化部署与可观测性建设

任职要求

本科及以上学历,计算机科学或相关专业,5 年以上后端架构或 AI 基础设施相关经验

精通 C++ / Python / Go 中至少两门语言,具备扎实的系统编程能力

深刻理解LLM原理(Attention 机制、KV Cache、Batching 策略等)

具备大规模 GPU 集群的架构设计与调度经验,熟悉 Kubernetes 及 GPU 相关调度机制

熟悉至少一种主流推理框架(vLLM / TensorRT-LLM / SGLang),有源码级理解或定制开发经验

具备良好的跨团队协作与技术方案推动能力

加分项:

有千卡以上规模 GPU 推理平台的建设经验

有自研或深度定制推理引擎的经历

在 LLM Serving 相关开源项目中有贡献(vLLM / SGLang / Ray Serve 等)

了解 MoE 模型推理、长上下文推理(128K+)的工程优化实践

熟悉 CUDA / NCCL / Triton 等 GPU 编程与通信框架

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。