大模型推理优化工程师(上海/深圳)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | IEG |
| 所属产品 | 部门公共-其他(IEG)-二方赋能(生态发展) |
| 工作地点 | 上海 |
| 经验要求 | 两年以上工作经验 |
| 官方更新时间 | 2026年09月08日 |
职位描述
1.背景:我们正在寻找专注于大模型推理优化的工程师,负责游戏业务中线上大模型服务的性能优化。您将参与从推理引擎优化到异构硬件落地的全流程,在低延迟、高吞吐的场景中支撑游戏大模型的在线推理服务,作为核心技术中台支持不同游戏项目的落地需求;
2.推理性能优化:围绕首 Token 延迟(TTFT)、生成吞吐、显存与算力利用率进行极致调优;应用量化(FP8、INT4/AWQ、MXFP4 等)、稀疏化等压缩技术,在维持模型推理效果的前提下降低推理成本;
3.推理引擎与算子优化:基于 vLLM、SGLang、TensorRT-LLM 等主流框架进行二次开发与深度优化,涉及连续批处理、PagedAttention、前缀缓存、KV Cache 量化与分级存储等关键能力;结合 CUDA/Triton 进行算子融合与计算图编译优化;
4.推理架构演进:探索 PD 分离、投机解码、MoE 专家并行等前沿架构,优化长上下文、长思维链与高并发场景下的推理效率;
5.算力适配:负责推理服务在算力上的部署、适配与调优,开展算子适配、显存管理与通信优化,构建跨硬件、可复用的推理加速方案;
6.性能分析与持续优化:建立推理服务的分析与监控体系,使用 Nsight 等工具进行 profiling 与瓶颈定位,监控推理服务的算力资源使用效率;与模型、agent、游戏引擎等多团队协作,结合游戏研发与运营的实际需求,持续优化推理成本。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。