招聘公告 · 职位检索 · 央国企/事业单位/名企

高性能计算/算子开发工程师

单位:蔚来类型:社招地点:上海、合肥、深圳、杭州更新:2026-09-24

岗位信息

招聘单位蔚来
工作地点上海、合肥、深圳、杭州
经验要求4
官方更新时间2026-09-18 15:54:53

职位描述

负责面向异构计算芯片(GPU / AI 芯片)的高性能核心算子库开发与极致性能调优,为大模型及各类 AI 业务提供高效的底层算力支撑:

1. 高性能 Kernel 研发:负责核心算子(如 GEMM/矩阵乘、Attention 机制、Normalization 等)的算法设计、实现与极致性能调优;

2. 算子库工程化交付:参与标准算子库的设计与开发,构建高效的自测基准(Benchmark)与自动化回归测试体系;

3. 软硬件协同调优:深入理解硬件架构瓶颈,结合计算图模式,探索算子融合(Fusion)与软硬件协同优化方案,最大化芯片硬件利用率(MFU);

4. 前沿技术跟踪与工具开发:探索 Triton、Cutlass 等前沿算子开发范式,开发性能分析工具以提高算子研发与调优效率。

任职要求

1. 计算机、数学、微电子、通信等相关专业本科及以上学历;

2. 熟练掌握 C/C++ 与 Python,具备良好的数据结构基础与工程开发习惯;

3. 理解并行计算基础概念,对计算机体系结构(如 CPU/GPU 内存层级、Cache、线程并发等)有基本认识;

4. 具备良好的动手能力,对代码极致性能调优、底层算法加速有浓厚兴趣。

满足以下条件优先

1. GPU 编程经验:熟悉 CUDA / OpenCL / ROCm 编程,了解 Thread/Block 调度、Shared Memory、Memory Coalescing 等调优机制;

2. 现代算子开发经验:熟悉 Triton、Cutlass、cuBLAS、cuDNN 等工具库,或有大模型核心算子(FlashAttention、GEMM、RMSNorm 等)调优经验;

3. 传统高性能/并行加速经验:有 CPU SIMD 指令集优化(如 AVX-512、ARM NEON)、DSP 优化、或音视频/图像算法底层加速经验;

4. HPC 与科学计算经验:有数值计算、线性代数库开发、MPI/OpenMP 并行计算、或高性能计算相关竞赛(如 ASC、CPC、IPCC)经历;

5. 深入理解体系结构:对芯片微架构有深入研究,或有针对特定硬件瓶颈进行 Roofline 建模、耗时热点分析的经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。