推理优化工程师,高性能C++
岗位信息
| 招聘单位 | 商汤科技 |
|---|---|
| 工作地点 | 上海、杭州、北京 |
| 官方更新时间 | 2026-06-29 11:31:08 |
职位描述
我们正在构建面向前沿大模型的高性能 AI 推理引擎。不止追求单 GPU 的计算效率,更关注大规模部署中计算、通信、存储与调度的协同,面向 NVIDIA 先进 GPU 与国产 GPU / NPU 持续提升吞吐,降低首 Token 延迟、逐 Token 延迟与服务成本。
你将结合技术专长,负责以下一个或多个核心方向的方案设计、关键模块开发和生产落地:
1. 投机解码与算法–系统协同优化:设计与实现 MTP、EAGLE 等投机解码方案,优化草稿生成、并行验证、KV Cache 管理与执行调度;结合模型结构、请求长度和并发负载,分析接受率、额外计算开销与端到端加速收益,推动方案在真实业务中稳定落地。
2. 分布式 KV Cache 与多级存储:设计 GPU 显存、主机内存及 SSD 上的多级 KV Cache 系统,优化前缀复用、缓存索引、淘汰、预取和跨节点共享;结合 RDMA、异步 I/O 与计算传输重叠,解决长上下文、多轮对话及 Agent 场景中的容量、带宽和尾延迟问题。
3. 分布式推理架构与请求调度:设计与优化 Prefill/Decode 分离、TP / PP / EP / DP 并行及多副本服务架构,建设缓存感知路由、Continuous Batching、负载均衡和过载控制机制;围绕延迟目标协调吞吐、排队与资源利用率,解决 MoE 专家负载不均和跨节点通信瓶颈。
4. 高性能算子与通信优化:开发与优化 Attention、MoE、GEMM 等核心算子,开展 CUDA / Triton / AscendC 或国产芯片算子开发,优化算子融合、访存、低精度计算及计算通信重叠;通过性能剖析定位并消除关键路径瓶颈。
5. 低精度推理与量化落地:推进 FP8、INT8、INT4 等权重、激活或 KV Cache 低精度方案,协同优化量化策略、数据布局与计算内核;建立精度和性能验证,评估不同模型、硬件和负载下的收益,控制精度损失与转换开销。
6. 推理运行时与执行调度:建设高性能 C++ 运行时,优化 CPU 调度、内存管理、异步执行、CUDA Graph 与动态形状处理;减少算子启动、同步和 Host 侧开销,解决小批量低延迟与高并发场景下的执行效率问题。
7. 先进 GPU 与异构平台优化:深入优化 vLLM、SGLang、TensorRT-LLM、MindIE 等框架,面向 NVIDIA 先进 GPU 与国产 GPU / NPU(沐曦、昇腾等)开展架构级性能优化;围绕硬件的低精度计算能力、显存带宽和高速互联特性,协同设计算子、并行策略与执行流程;建设可复现的 Benchmark 与性能回归体系,以真实业务负载验证正确性、稳定性、延迟、吞吐和成本。
我们提供
1. 深度参与前沿大模型在 NVIDIA 先进 GPU 及国产 GPU / NPU 上的推理优化,探索新硬件架构的性能潜力,负责有明确性能目标的核心模块。
2. 与算法、芯片及 AI Infra 团队协作,解决真实业务中的大规模部署问题。
3. 接触从 Kernel、推理运行时到分布式调度与 KV 存储的完整技术链路,参与架构决策与开源贡献。
4. 有竞争力的薪酬和成长空间。
任职要求
1. 计算机科学、电子工程、人工智能等相关专业,硕士及以上学历;具有 2 年以上 AI Infra、推理优化或高性能计算相关工作经验。
2. 熟练使用 C++ 进行系统级开发,掌握 Python;具备扎实的计算机体系结构、操作系统、并发编程和内存管理基础,能够定位性能与稳定性问题。
3. 熟悉 Transformer 的主要计算过程,理解 Prefill / Decode 的计算与访存特征,以及 Attention、KV Cache、MoE、量化等机制对推理性能的影响。
4. 深入使用并阅读或修改过 vLLM、SGLang、TensorRT-LLM、MindIE 等至少一种推理框架,能够说明关键模块的实现、性能瓶颈与设计取舍。
5. 在投机解码、分布式 KV Cache / 存储、分布式推理与调度、GPU 算子与通信、低精度推理、推理运行时等至少一个方向有深入研发经验,能够独立完成问题分析、方案设计、实现与验证,不要求覆盖所有方向。
6. 有 GPU 性能分析或调优经验,能够结合 Profiler、日志与对照实验区分计算、访存、通信、CPU 调度及排队瓶颈,并以可复现的数据说明优化收益和适用边界。
7. 具备工程交付与跨团队协作能力,重视正确性、可观测性和性能回归,能够推动优化方案从实验走向稳定运行。
加分项
1. 有 MTP、EAGLE 等投机解码的框架实现或生产优化经验,解决过动态批处理、验证开销、KV 管理或执行图配合中的实际问题。
2. 有多级 KV Cache、分布式缓存或高性能存储研发经验,熟悉 RDMA、libibverbs、GPUDirect RDMA、异步 I/O 等技术,并对缓存一致性、故障恢复或尾延迟有实践经验。
3. 有大规模 LLM Serving 生产调优经验,处理过 PD 分离、缓存感知路由、混合长短请求、热点副本或过载问题,能提供明确的业务负载和收益数据。
4. 有 CUDA / Triton / AscendC 算子开发经验,熟悉 Tensor Core、tiling、warp-level primitive、异步 copy;或熟悉 NCCL / HCCL、集合通信与 MoE All-to-All 优化。
5. 有 FP8 / INT8 / INT4 量化、低精度 Kernel、CUDA Graph、编译优化或高性能 C++ 推理运行时开发经验。
6. 有 NVIDIA 先进 GPU 性能优化经验,熟悉 Tensor Core、NVLink / NVSwitch 等计算与互联特性的应用;或有国产 GPU / NPU 适配和优化经验,能够从硬件特性出发调整算子、并行策略与执行流程。
7. 向 vLLM、SGLang、PyTorch、FlashAttention、Mooncake、CUTLASS、Triton 等项目提交过有实质内容的贡献,或有体现技术深度的论文、技术文章与性能工具。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。