招聘公告 · 职位检索 · 央国企/事业单位/名企

AI infra研发工程师(推理系统)

单位:蔚来类型:社招地点:上海、杭州、深圳、合肥更新:2026-09-24

岗位信息

招聘单位蔚来
工作地点上海、杭州、深圳、合肥
经验要求4
官方更新时间2026-09-18 16:10:31

职位描述

负责大模型及 AI 芯片的高性能推理系统与编译栈建设,打通从深度学习算法到芯片硬件的极致加速通路:

1. 推理系统与框架演进:参与大模型推理引擎(如 vLLM / TensorRT-LLM / SGLang 或自研引擎)的核心组件研发,优化高并发、高吞吐场景下的请求调度与缓存管理(KV Cache);

2. 计算图与编译优化:负责 AI 模型的计算图优化、算子融合(Operator Fusion)、内存复用及代码生成(Tiling/Lowering),释放硬件计算潜能;

3. 前沿技术工程落地:结合业务场景(大模型/多模态等),探索并落地投机解码、长上下文、PD 分离或模型量化压缩(FP8/INT8)等前沿优化技术;

4. 系统性能剖析与工具链:分析系统端到端瓶颈,完善性能分析(Profiling/Tracing)工具与验证体系,保障线上服务与底层工具链的高可用交付。

任职要求

1. 计算机、人工智能、软件工程、电子通信等相关专业本科及以上学历;

2. 熟练掌握 C/C++ 或 Python,具备良好的系统编程素养与数据结构基础;

3. 理解主流深度学习模型的计算原理(如 Transformer、CNN 等),熟悉模型推理的基本计算流程与内存瓶颈;

4. 具备扎实的工程实现与性能分析能力,对软硬件协同优化有浓厚兴趣。

满足以下条件优先

1. 熟悉至少一种主流推理框架(如 vLLM、TensorRT-LLM、SGLang、Triton Server 等),对其底层调度、PagedAttention、PD 分离等机制有实践经验;

2. 熟悉 TVM、MLIR、TensorRT、Torch-Inductor、IREE、XLA 等深度学习编译器,有图优化 Pass、算子融合或 Tiling 优化实战经验;

3. 具备 GPU/NPU 异构加速实战经验,熟悉 CUDA/Triton 编程,或有 AWQ、GPTQ、SmoothQuant 等低比特量化(INT8/FP8/INT4)加速落地经验;

4. 有智能辅助驾驶、具身智能、音视频图像等领域的模型工程化落地与部署经验;

5. 在相关开源社区(如 vLLM、TensorRT-LLM、TVM 等)有代码贡献,或在体系结构、系统优化相关顶会发表过论文。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。