招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型MaaS平台系统工程师

单位:快手类型:社招更新:2026-09-30

岗位信息

招聘单位快手
官方更新时间2026-09-24T19:50:24.000+08:00

职位描述

1、负责大模型 MaaS 平台核心后端能力建设,支撑公司内外部大模型推理、部署、调用与运维场景;

2、负责大模型推理服务的稳定性体系建设,包括高可用架构、限流降级、熔断容灾、故障自愈、容量治理、SLA 保障等;

3、负责大模型推理流量调度能力建设,包括多模型、多集群、多地域、多租户场景下的流量路由、负载均衡、灰度发布、弹性调度与成本优化;

4、负责模型服务编排与部署系统建设,支持模型实例生命周期管理、自动化部署、版本管理、滚动升级、弹性伸缩、资源隔离与异构资源调度;

5、深入优化推理链路的性能与资源利用率,包括请求排队、批处理、缓存、并发控制、GPU/CPU 资源利用、延迟与吞吐优化等;

6、建设平台可观测能力,包括指标、日志、链路追踪、告警、故障诊断工具和稳定性运营看板,提升问题发现、定位和恢复效率;

7、与算法、基础架构、业务团队协作,抽象通用平台能力,推动大模型能力标准化、产品化和规模化落地;

8、参与平台架构设计与技术演进,保障系统在高并发、高可用、多租户和复杂业务场景下的稳定运行。

任职要求

1、本科及以上学历,计算机、软件工程、人工智能等相关专业;

2、具备扎实的计算机基础,熟悉操作系统、网络、分布式系统、数据结构与算法;

3、熟悉 Java / Go / Python / C++ 至少一种后端开发语言,具备良好的工程实践能力和代码质量意识;

4、熟悉微服务架构,具备高并发、高可用系统设计经验,理解限流、熔断、降级、重试、超时控制、负载均衡等稳定性治理手段;

5、熟悉 Kubernetes、容器化、服务编排、服务发现、弹性伸缩、资源调度等云原生技术;

6、熟悉监控告警、日志分析、链路追踪等可观测体系,有线上问题排查和稳定性治理经验;

7、具备良好的系统抽象能力和问题拆解能力,能够在复杂业务和技术约束下设计可落地、可演进的平台方案;

8、具备良好的沟通协作能力,能够与算法、业务、基础架构等多角色团队高效协作。

加分项:

1、有大模型推理平台、MaaS 平台、AI Infra、模型部署平台、在线推理服务相关经验;

2、熟悉 vLLM、Triton Inference Server、TensorRT-LLM、Ray Serve、KServe、Seldon、TorchServe 等推理或模型服务框架;

3、熟悉大模型推理优化技术,如动态 batching、KV Cache、Prefix Cache、Speculative Decoding、PagedAttention、多卡并行、量化等;

4、有 GPU 集群调度、异构资源管理、弹性伸缩、成本优化相关经验;

5、有多租户平台、企业级 PaaS / SaaS 平台、API Gateway、服务网格或流量治理系统建设经验;

6、有大规模在线系统稳定性建设经验,参与过核心链路 SLA 保障、故障治理、容量规划或应急体系建设;

7、对大模型工程化落地有深入理解,关注模型服务性能、稳定性、成本和体验之间的平衡。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。