招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型算法开发高级工程师-异构计算

单位:联宝类型:社招地点:合肥市更新:2026-09-24

岗位信息

招聘单位联宝
工作地点合肥市
官方更新时间2026-07-20T11:46:19

职位描述

1. 基于厂商授权源码,深入修改DNPU模型编译器后端(图优化、算子选择、指令生成),解决VLA等前沿模型算子不支持或性能不佳问题。

2. 在编译器和算子库中同步实现量化/反量化算子Kernel,与框架侧量化算法保持一致;独立开发高性能自定义算子并集成到编译框架。

3. 设计Runtime嵌入式集成方案(内存共享、线程模型、异常处理),实现多DNPU卡间通信与协同推理底层支撑。

4. 开发Runtime外围扩展模块(自定义KV Cache管理器、在线采样逻辑等),补充静态模型不支持的动态能力。

为上层推理框架设计统一后端调用范式,屏蔽DNPU(模型级执行)与未来GPU(算子级执行)的差异。

5. 储备CUDA/HIP/OpenCL及NCCL编程能力,为未来GPU平台算子重写与通信计算Overlap优化做准备。

任职要求

1. . 本科及以上学历,硕士/博士优先;计算机、软件工程、人工智能、自动化、电子信息等相关专业优先;

2. 3年以上相关工作经验,精通C/C++,Python熟练。深入过至少一种AI芯片(NPU/GPU)底层软件栈,在AI编译器后端或算子层面(计算/访存密集型算子、Attention等)有源码级开发和调试经验。

3. 有量化/反量化算子开发与优化经验,理解其与上层量化算法的协同关系。

熟悉至少一种AI编译器框架(如TVM/MLIR)内部原理,或有专用编译器开发经历。

4. 深刻理解至少一种AI加速硬件体系结构,掌握其配套Profiling工具。

5. 了解多加速卡间通信拓扑与数据传输机制(PCIe、NVLink、片间互联等)。

6. 有NCCL或类似通信库多卡协同开发或调优经验。

7. 具备可验证的CUDA/HIP/OpenCL算子开发能力。

8. 能独立分析、定位并解决从编译错误到精度异常的各类棘手问题,具备软硬件全栈系统思维。

加分项

有国产GPU/NPU(后摩、海光、砺算、天数等)芯片开发直接经验。

有国产GPU/NPU集群分布式推理底层支撑实战经验。

在MLSys、ASPLOS等系统领域顶级会议发表过相关论文,或有TVM等主流AI编译器活跃贡献记录。

熟悉ARM NEON等端侧CPU SIMD指令集优化。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。