高性能计算/算子开发工程师
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海、合肥、深圳、杭州 |
| 经验要求 | 4 |
| 官方更新时间 | 2026-09-18 15:54:53 |
职位描述
负责面向异构计算芯片(GPU / AI 芯片)的高性能核心算子库开发与极致性能调优,为大模型及各类 AI 业务提供高效的底层算力支撑:
1. 高性能 Kernel 研发:负责核心算子(如 GEMM/矩阵乘、Attention 机制、Normalization 等)的算法设计、实现与极致性能调优;
2. 算子库工程化交付:参与标准算子库的设计与开发,构建高效的自测基准(Benchmark)与自动化回归测试体系;
3. 软硬件协同调优:深入理解硬件架构瓶颈,结合计算图模式,探索算子融合(Fusion)与软硬件协同优化方案,最大化芯片硬件利用率(MFU);
4. 前沿技术跟踪与工具开发:探索 Triton、Cutlass 等前沿算子开发范式,开发性能分析工具以提高算子研发与调优效率。
任职要求
1. 计算机、数学、微电子、通信等相关专业本科及以上学历;
2. 熟练掌握 C/C++ 与 Python,具备良好的数据结构基础与工程开发习惯;
3. 理解并行计算基础概念,对计算机体系结构(如 CPU/GPU 内存层级、Cache、线程并发等)有基本认识;
4. 具备良好的动手能力,对代码极致性能调优、底层算法加速有浓厚兴趣。
满足以下条件优先
1. GPU 编程经验:熟悉 CUDA / OpenCL / ROCm 编程,了解 Thread/Block 调度、Shared Memory、Memory Coalescing 等调优机制;
2. 现代算子开发经验:熟悉 Triton、Cutlass、cuBLAS、cuDNN 等工具库,或有大模型核心算子(FlashAttention、GEMM、RMSNorm 等)调优经验;
3. 传统高性能/并行加速经验:有 CPU SIMD 指令集优化(如 AVX-512、ARM NEON)、DSP 优化、或音视频/图像算法底层加速经验;
4. HPC 与科学计算经验:有数值计算、线性代数库开发、MPI/OpenMP 并行计算、或高性能计算相关竞赛(如 ASC、CPC、IPCC)经历;
5. 深入理解体系结构:对芯片微架构有深入研究,或有针对特定硬件瓶颈进行 Roofline 建模、耗时热点分析的经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。