招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型Infra工程师 (VLM推理)

单位:生数科技类别:研发类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位生数科技
工作地点北京
官方更新时间2026-08-20 15:52:13

职位描述

负责 VLM(视觉-语言模型)大规模推理服务的基础设施设计与优化。以极致吞吐与极致成本为核心目标,从服务架构到底层 Kernel 进行全栈压榨,在既定算力预算下支撑尽可能大的业务流量。

1. 推理服务架构设计与优化:主导 VLM 在线推理服务的架构设计与持续演进,深度定制 SGLang 推理框架,针对 VLM 特点(长视觉序列、Prefill/Decode 异构计算)进行系统级适配与优化。持续提升服务吞吐上限,降低单 Token 推理成本。

2. 显存管理与 KV Cache 极致压榨:针对 VLM 多图/长视频场景下 KV Cache 巨大的问题,设计高效的显存管理方案。深入理解并优化 SGLang 的 RadixAttention(前缀缓存)机制,结合 PagedAttention 等分页管理策略,最大化 Batch Size 与缓存命中率,提升单卡吞吐容量。

3. 推理成本极致优化:围绕单卡吞吐量与推理成本两大核心指标,落地并优化量化方案(FP8/INT4/AWQ/GPTQ)、投机采样(Speculative Decoding)等降本增效手段。在保证生成质量的前提下,持续提升每 GPU 的服务吞吐,降低单位 Token 的算力成本。

4. 全链路性能 Profiling 与调优:建立系统级性能看护体系,从请求接入、多模态数据预处理、Prefill 计算到 Decode 自回归生成,进行全链路吞吐拆解与瓶颈定位。优化 CPU 预处理与 GPU 推理之间的数据管道,最大化 GPU 有效计算占比。

任职要求

1. 推理框架深度掌握:精读过 SGLang 核心源码,对其调度器(Scheduler)、RadixAttention 缓存机制、CUDA Graph 加速、Overlap 调度等核心模块有系统性理解与实战优化经验。熟悉 vLLM 并有对比认知者更佳。

2. VLM 推理认知:深刻理解 VLM 推理与纯文本 LLM 推理的差异(长视觉序列带来的 Prefill 压力、多图并行处理、视频抽帧与特征压缩等),并有针对性的架构优化经验。

3. 降本增效工具箱:熟悉主流量化推理方案(FP8/INT4/AWQ/GPTQ)的原理与落地代价,有投机采样(Speculative Decoding)的实战经验,能够在质量与吞吐之间做出精准的工程权衡。

4. 系统级性能调优能力:具备端到端的吞吐拆解能力,能够精准定位 CPU 预处理、数据传输、GPU 计算等各环节的吞吐瓶颈,并有系统化的方法论驱动持续优化。

5. 加分项:

- 有 VLM(含视频输入)大规模推理服务落地经验,并有显著的吞吐/成本优化成果

- 熟悉多模态输入的预处理/后处理优化(如图像 Resize/归一化与 GPU 之间的零拷贝流水线)

- 有 Triton Inference Server / TensorRT-LLM 等其他推理框架的深度使用经验

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。