高性能算子专家/高级工程师
岗位信息
| 招聘单位 | 知存科技 |
|---|---|
| 工作地点 | 北京、杭州、上海、西安 |
| 经验要求 | 7 |
| 官方更新时间 | 2026-07-14 15:37:03 |
职位描述
1. 面向自研异构计算平台,负责CPU、GPU、DSP、NPU 等各类硬件后端的算子开发,其中NPU基于自研编程模型,适配专用指令集与片上存储。
2. 分析硬件架构和算子计算特征,围绕并行划分、数据重用、向量化、访存合并、流水调度等方向优化性能。
3. 参与算子库的接口与元数据设计,包括算子语义、输入输出约束、数据类型、Tensor Layout、Shape 推导、资源占用、执行延迟及硬件适配信息,为图编译器做算子切分调度的性能代价模型提供输入。
4. 协同编译器和大模型框架等团队,支持主流算法和大模型端到端运行和性能优化。
5. 从并行计算角度参与软硬件协同设计,为指令集、存储层次、同步机制以及NPU微架构提供软件侧需求和评估。
6. 参与算子开发工具链、调试工具、性能分析工具和自动化测试体系建设,沉淀可复用的算子模板与优化方法。
任职要求
1. 计算机、算法、电子工程、自动化、微电子或相关专业,本科及以上学历,2年以上 C++ 开发经验。
2. 熟悉卷积、矩阵乘、归一化、激活、Attention 等常见深度学习算子的计算原理,理解算子在不同 Shape、数据类型和 Layout 下的性能特征。深入理解Roofline分析模型。
3. 具有 CUDA、OpenCL、DSP 或其他异构计算平台中的至少一种开发经验,理解线程组织、共享存储、同步机制及访存优化。
4. 具备良好的工程实践能力,熟悉 Linux、Git、CMake及常用调试工具,能够独立完成算子的开发、测试、集成和性能验证。
5. 具备良好的跨团队沟通能力,能够与芯片架构、编译器、Runtime、框架和模型团队紧密协作。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。