招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型云端推理架构与部署工程师

单位:千寻智能类别:机器学习类型:社招地点:北京、杭州更新:2026-09-24

岗位信息

招聘单位千寻智能
工作地点北京、杭州
官方更新时间2026-04-14 10:03:46

职位描述

1、负责多模态大模型(VLM)在云端的高性能分布式推理系统设计、开发与全链路端到端部署。

2、负责将前沿的推理加速机制(如PD分离、全局KV池化、长文本上下文处理等)快速工程化,构建高可用、高吞吐的推理服务。

3、跟进解决大规模服务调用中遇到的性能瓶颈与长尾问题,持续优化集群吞吐量(Throughput)、首字延迟(TTFT)与推理显存占用。

任职要求

1、计算机、软件工程、人工智能等相关专业;具备分布式系统架构、后端开发或AI基建(AI Infra)相关工作经验。

2、精通 Python/C++,熟悉 PyTorch 等深度学习框架;深入理解大模型底层网络结构(如 Transformer、MoE),并熟练掌握至少一种主流开源推理引擎(如 vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo等)的底层机制与源码魔改。

3、熟悉主流的大模型分布式推理与云原生工程化技术,包括但不限于模型/流水线并行(TP/PP)、Continuous Batching、PagedAttention、K8s/Docker容器编排、API网关及系统可观测性建设。

4、持续跟踪大模型推理与系统优化领域的前沿进展,能够快速评估并引入适配公司业务(如极速对话、高吞吐批处理、多模态并发)的技术方案。

加分项:

1、具备异构算力(Nvidia GPU/国产算力)底层调度调优经验,熟练掌握 CUDA/Triton 算子编程及性能剖析(Profiling)者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。