大模型推理优化工程师
岗位信息
| 招聘单位 | 哔哩哔哩 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-05-22 14:25:40 |
职位描述
工作职责:
1.负责大语言模型及多模态模型的推理性能优化,包括但不限于首字延迟(TTFT)、吞吐量(Throughput)和显存占用的优化,确保模型在线上生产环境的高效稳定运行。
2.深入研究和落地主流推理加速框架(如 vLLM, TensorRT-LLM, TGI, SGLang, LightLLM 等),针对特定业务场景进行定制化开发与适配。
3.负责高性能算子开发与优化,熟练使用 CUDA、Triton、FlashAttention 等技术,针对 Transformer 结构进行底层计算加速。
4.探索并实现先进的推理优化算法,如 KV Cache 优化(PagedAttention, RadixAttention)、量化(INT8/INT4/FP8)、模型剪枝、投机采样(Speculative Decoding)、连续批处理(Continuous Batching)等
5.参与推理服务系统的架构设计与开发,优化分布式推理策略(如张量并行 TP、流水线并行 PP),提升大规模集群下的推理扩展性。
6.与算法团队紧密配合,打通从模型训练到推理部署的全链路,推动模型压缩与端侧/边缘侧部署的落地。
工作要求:
1.计算机科学、电子工程、数学或相关专业本科及以上学历,3年以上高性能计算或AI系统开发经验。
2.精通 C++ / Python 编程,具备优秀的代码实现能力和工程素养,熟悉 Linux 开发环境。
3.深刻理解 Transformer 模型架构及 LLM 推理原理,对自回归解码过程中的计算瓶颈有清晰的认知。
4.熟练掌握至少一种主流深度学习框架(PyTorch, TensorFlow)的底层机制,有 PyTorch 算子开发或模型导出(ONNX/TorchScript)经验者优先。
5.具备扎实的 GPU 编程基础,熟悉 CUDA 编程模型
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。