AI infra研发工程师(推理系统)
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海、杭州、深圳、合肥 |
| 经验要求 | 4 |
| 官方更新时间 | 2026-09-18 16:10:31 |
职位描述
负责大模型及 AI 芯片的高性能推理系统与编译栈建设,打通从深度学习算法到芯片硬件的极致加速通路:
1. 推理系统与框架演进:参与大模型推理引擎(如 vLLM / TensorRT-LLM / SGLang 或自研引擎)的核心组件研发,优化高并发、高吞吐场景下的请求调度与缓存管理(KV Cache);
2. 计算图与编译优化:负责 AI 模型的计算图优化、算子融合(Operator Fusion)、内存复用及代码生成(Tiling/Lowering),释放硬件计算潜能;
3. 前沿技术工程落地:结合业务场景(大模型/多模态等),探索并落地投机解码、长上下文、PD 分离或模型量化压缩(FP8/INT8)等前沿优化技术;
4. 系统性能剖析与工具链:分析系统端到端瓶颈,完善性能分析(Profiling/Tracing)工具与验证体系,保障线上服务与底层工具链的高可用交付。
任职要求
1. 计算机、人工智能、软件工程、电子通信等相关专业本科及以上学历;
2. 熟练掌握 C/C++ 或 Python,具备良好的系统编程素养与数据结构基础;
3. 理解主流深度学习模型的计算原理(如 Transformer、CNN 等),熟悉模型推理的基本计算流程与内存瓶颈;
4. 具备扎实的工程实现与性能分析能力,对软硬件协同优化有浓厚兴趣。
满足以下条件优先
1. 熟悉至少一种主流推理框架(如 vLLM、TensorRT-LLM、SGLang、Triton Server 等),对其底层调度、PagedAttention、PD 分离等机制有实践经验;
2. 熟悉 TVM、MLIR、TensorRT、Torch-Inductor、IREE、XLA 等深度学习编译器,有图优化 Pass、算子融合或 Tiling 优化实战经验;
3. 具备 GPU/NPU 异构加速实战经验,熟悉 CUDA/Triton 编程,或有 AWQ、GPTQ、SmoothQuant 等低比特量化(INT8/FP8/INT4)加速落地经验;
4. 有智能辅助驾驶、具身智能、音视频图像等领域的模型工程化落地与部署经验;
5. 在相关开源社区(如 vLLM、TensorRT-LLM、TVM 等)有代码贡献,或在体系结构、系统优化相关顶会发表过论文。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。