招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型算子开发优化工程师/专家(J10825)

单位:云天励飞类型:社招地点:深圳市、成都市、北京市、上海市、西安市、南京市更新:2026-09-24

岗位信息

招聘单位云天励飞
工作地点深圳市、成都市、北京市、上海市、西安市、南京市
官方更新时间2026-08-12T18:45:37.9536051

职位描述

GPU 高性能算子专家

岗位职责

负责自研 GPGPU 上 AI 核心算子及高性能 Kernel 的设计与优化,覆盖 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化及算子融合等场景。

基于 CUDA、Triton、CUTLASS 等技术,建立关键算子的性能基线、Benchmark 和优化方法。

开展算子融合及通算融合优化,包括计算与 Collective/P2P 通信的融合、流水和异步重叠。

从算法、Tiling、数据布局、Kernel 实现、编译器生成代码及硬件资源等层面分析性能瓶颈。

与编译器和芯片架构团队协作,推动寄存器使用、occupancy、访存、Tensor/Matrix 指令及异步流水等性能优化。

建立算子性能回归和问题归因体系,支持重点 AI 模型的算子适配与性能交付。

任职要求

任职要求

通常具备 5 年以上 GPU 高性能计算、CUDA 算子或 AI 芯片性能优化经验。

精通 CUDA C++,熟悉 CUTLASS、Triton、FlashAttention、FlashInfer 或同类高性能 Kernel 技术。

实际优化过 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化等核心算子中的一种或多种。

深入理解 GPU 性能模型,包括 warp/CTA、occupancy、寄存器压力、spill、shared memory、访存合并、bank conflict、cache 和 latency hiding。

能够阅读和分析 PTX、GPU 汇编或目标 ISA,并结合 Profiling、性能计数器和 Benchmark 定位性能问题。

熟悉 C++ 和 Python,具备良好的工程实现、性能分析和跨团队协作能力。

加分项

有 cuBLAS、cuDNN、CUTLASS、FlashAttention、FlashInfer 或类似高性能算子库研发经验。

有大模型推理、低精度计算或多模态核心算子优化经验。

有 AllGather-GEMM、GEMM-ReduceScatter、MoE Dispatch/Combine 等通算融合经验。

有自研 GPU 或 AI 芯片的预硅验证、A0 Bring-up 或性能调优经验。

有算子、编译器和硬件协同优化经验,能够区分性能问题来自 Kernel、编译器还是硬件。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。