招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infra 研发工程师(GPU 推理方向)

单位:携程集团类别:AI & BI类型:社招地点:上海更新:2026-09-19

岗位信息

招聘单位携程集团
部门/事业群Accommodation
工作地点上海
官方更新时间2026-08-31

任职要求

<p><strong>职位描述</strong></p><ol><li>参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。</li><li>参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core 使用、显存与访存优化等方向,持续提升单卡吞吐与推理延迟表现。</li><li>参与推理图优化工作,基于 TensorRT / ONNX Runtime / TVM / Triton 等主流框架完成模型的图变换、算子替换、kernel 调优,协助推动模型高效上线。</li><li>针对推荐模型的特点(稀疏 Embedding、变长序列、多塔结构等),协助完成定制化推理方案的开发与调优,解决 Host-Device 传输、KV Cache 管理等性能瓶颈。</li><li>参与性能 profiling 与调优工作,熟练使用 Nsight、CUPTI 等工具完成性能分析,配合算法团队完成模型结构的性能评估。</li><li>关注 GPU 推理、LLM Serving、推荐系统 Infra 的业界前沿进展(vLLM、SGLang、FlashAttention 等),积极学习并参与新技术在团队内的落地。</li></ol><p><br></p><p><strong>任职资格</strong></p><ol><li>计算机及相关专业本科及以上学历,1 年以上 GPU / 高性能计算 / 深度学习推理相关研发经验。</li><li>熟悉 CUDA 编程基础,了解 GPU 体系架构(SM、Warp、Memory Hierarchy、Tensor Core),具备编写和优化 CUDA kernel 的实践经验。</li><li>熟悉至少一种主流深度学习推理框架(TensorRT / ONNX Runtime / TVM / Triton Inference Server),了解图优化、算子融合、量化等基本原理。</li><li>了解主流推荐模型(DLRM、DIN、生成式推荐等)或 Transformer 类模型的结构与推理特点,对模型性能瓶颈有一定认识。</li><li>熟练使用 c++/python/java等至少一种语言,熟悉 Linux 开发环境,代码规范、工程意识良好。</li><li>有一定的问题定位与性能分析能力,能使用 Nsight Systems / Nsight Compute / perf 等工具完成基本的性能调优。</li><li>学习能力强,具备良好的团队协作与沟通意识,能够与算法、业务、运维团队协作推进项目。</li></ol><p><br></p><p><strong>加分项</strong></p><ol><li>有推荐 / 搜索 / 广告系统 GPU 推理相关实习或项目经验者优先。</li><li>有 LLM 推理加速相关经验(PagedAttention、Continuous Batching、量化推理等)者优先。</li><li>有开源社区贡献经验(TensorRT-LLM、vLLM、FlashAttention、Triton、TVM 等)或在 MLSys 相关领域有论文 / 竞赛 / 技术博客产出者优先。</li><li>有良好的英文技术文档阅读能力,有海外学习或工作经验者优先。</li></ol>

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。