招聘公告 · 职位检索 · 央国企/事业单位/名企

智算云MaaS平台架构师(J18842)

单位:新华三类型:社招地点:北京市、杭州市、郑州市、成都市更新:2026-09-24

岗位信息

招聘单位新华三
工作地点北京市、杭州市、郑州市、成都市
官方更新时间2026-08-10T15:14:56

职位描述

1. 负责 MaaS 平台产品与技术架构及演进路线设计,构建覆盖模型开发、训练、微调、强化学习、评测、部署、推理及模型服务的全生命周期平台。

2. 负责大模型后训练服务规划,主导大模型分布式训练故障感知恢复,持续跟踪强化学习及 Agentic AI 等方向的技术发展,并推动形成平台产品能力。

3. 负责大模型推理Token工厂服务设计,持续优化推理服务性能,降低Token生产成本。

4. 负责大规模异构算力调度架构设计,实现训练、微调、推理等工作负载的统一算力管理,结合训练与推理业务特点设计算力调度策略,提高 GPU 利用率、集群吞吐和整体算力投入产出比。

5. 支持重大客户、重点项目的技术交流、方案设计及架构咨询,能够完成从客户需求到平台产品能力的抽象和沉淀,推动产品从规划、研发到规模化商业落地。

任职要求

1. 计算机、人工智能等相关专业,具备8年以上云计算、AI平台相关工作经验;具备云原生架构能力,深入理解 Kubernetes、Volcano、Service Mesh等技术体系,具有3年以上AI Infra相关经验。

2. 熟悉大模型训练技术体系,对DeepSpeed、Megatron-LM 等技术框架有实际经验或深入理解,熟悉大模型微调技术、强化学习及 Post-training 技术体系,熟悉 RLHF、RLAIF、Reward Model、PPO、DPO、GRPO 等相关方法,理解其训练流程、算力特点及平台工程需求。

3. 深入理解大模型推理服务架构,理解KVCache、Continuous Batching、Paged Attention、量化、Speculative Decoding 等关键优化技术,能够从计算、显存、网络和存储等维度分析大模型推理性能瓶颈,并提出性能优化思路。

4. 具备较强算力平台及调度框架架构能力,理解大模型算力集群、GPU 资源池化、vGPU 调度、分布式训练调度及推理服务调度,熟悉 Ray、Kubeflow、Volcano、Kueue、Slurm 等 AI 计算与调度框架。

具备以下一项或多项经验者优先:

1. 有大型智算云或企业级 AI 平台产品/架构经验优先;

2. 有万卡级算力集群、智算中心或大规模异构算力平台相关经验优先;

3. 有大模型预训练、SFT、RLHF/DPO/GRPO 、Agentic-RL等真实项目经验优先;

4. 有大规模在线 LLM 推理平台建设及性能优化经验优先;

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。