大模型算法开发高级工程师-异构计算
岗位信息
| 招聘单位 | 联宝 |
|---|---|
| 工作地点 | 合肥市 |
| 官方更新时间 | 2026-07-20T11:46:19 |
职位描述
1. 基于厂商授权源码,深入修改DNPU模型编译器后端(图优化、算子选择、指令生成),解决VLA等前沿模型算子不支持或性能不佳问题。
2. 在编译器和算子库中同步实现量化/反量化算子Kernel,与框架侧量化算法保持一致;独立开发高性能自定义算子并集成到编译框架。
3. 设计Runtime嵌入式集成方案(内存共享、线程模型、异常处理),实现多DNPU卡间通信与协同推理底层支撑。
4. 开发Runtime外围扩展模块(自定义KV Cache管理器、在线采样逻辑等),补充静态模型不支持的动态能力。
为上层推理框架设计统一后端调用范式,屏蔽DNPU(模型级执行)与未来GPU(算子级执行)的差异。
5. 储备CUDA/HIP/OpenCL及NCCL编程能力,为未来GPU平台算子重写与通信计算Overlap优化做准备。
任职要求
1. . 本科及以上学历,硕士/博士优先;计算机、软件工程、人工智能、自动化、电子信息等相关专业优先;
2. 3年以上相关工作经验,精通C/C++,Python熟练。深入过至少一种AI芯片(NPU/GPU)底层软件栈,在AI编译器后端或算子层面(计算/访存密集型算子、Attention等)有源码级开发和调试经验。
3. 有量化/反量化算子开发与优化经验,理解其与上层量化算法的协同关系。
熟悉至少一种AI编译器框架(如TVM/MLIR)内部原理,或有专用编译器开发经历。
4. 深刻理解至少一种AI加速硬件体系结构,掌握其配套Profiling工具。
5. 了解多加速卡间通信拓扑与数据传输机制(PCIe、NVLink、片间互联等)。
6. 有NCCL或类似通信库多卡协同开发或调优经验。
7. 具备可验证的CUDA/HIP/OpenCL算子开发能力。
8. 能独立分析、定位并解决从编译错误到精度异常的各类棘手问题,具备软硬件全栈系统思维。
加分项
有国产GPU/NPU(后摩、海光、砺算、天数等)芯片开发直接经验。
有国产GPU/NPU集群分布式推理底层支撑实战经验。
在MLSys、ASPLOS等系统领域顶级会议发表过相关论文,或有TVM等主流AI编译器活跃贡献记录。
熟悉ARM NEON等端侧CPU SIMD指令集优化。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。