招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型框架专家/高级工程师

单位:知存科技类别:电子 / 半导体类型:社招地点:北京、上海、杭州、西安更新:2026-09-23

岗位信息

招聘单位知存科技
工作地点北京、上海、杭州、西安
经验要求7
官方更新时间2025-03-14 11:25:54

职位描述

1. 围绕存算一体芯片架构,负责云侧大模型训练与推理框架的架构定制、模块开发和性能优化。

2. 开发和优化分布式训练能力,包括数据并行、张量并行、流水线并行、上下文并行、混合精度、存储管理及通信计算重叠。

3. 开发和优化大模型推理引擎,支持 Paged Attention、Prefix Cache、Prefill-Decode 分离、投机解码及长上下文推理。

4. 优化 MoE 模型的训练与推理效率,解决专家并行、路由负载均衡、跨卡通信、显存占用和推理部署等问题。

5. 从框架执行效率、分布式扩展性和资源利用率角度参与软硬件协同设计,为计算单元、存储层次、高速互联、集合通信、同步机制等系统方案提供软件侧需求与评估。

6. 对接 AI 编译器、算子库和Runtime,定位计算、通信、I/O 等瓶颈,协同算法、编译器、算子及硬件团队完成端到端精度校准和性能优化。

7. 建设精度、性能、压力测试及回归体系,推动训练和推理框架产品化及规模化部署。

任职要求

1. 计算机、算法、电子工程或相关专业本科及以上学历,具有 3 年以上 C++ / Python开发经验,以及 AI 框架、训练系统、推理引擎或异构计算相关经验。熟悉多线程、异步编程、内存管理和网络通信,具备大型软件系统设计能力。

2. 熟悉 PyTorch、JAX 等深度学习框架,理解计算图、自动微分、自定义算子、设备后端和分布式执行机制。熟悉 Transformer、Attention、MoE 及大模型训练和生成流程,理解模型并行、Prefill、Decode 和 KV Cache。

3. 在分布式训练、推理引擎、分布式推理或异构 Runtime 中至少一个方向具有深入经验,熟悉 Megatron-LM、DeepSpeed、PyTorch FSDP、vLLM、SGLang、TensorRT-LLM 等至少一种框架。具有多机多卡训练、高并发在线推理或 GPU/NPU 集群优化经验。具有 FP8、INT8、INT4、AWQ、GPTQ 等低精度训练或量化推理经验。

4. 具有 CUDA、ROCm 或自研 NPU 开发经验,理解 Stream、Event、设备内存、数据传输及异步 Kernel Launch。熟悉 NCCL/RCCL、RDMA 等分布式通信机制,理解通信能力对训练与推理框架的影响。

5. 具备计算、显存、通信、调度和 I/O 性能分析能力,能够推动框架、Runtime 与硬件协同优化。参与过 GPU/NPU、服务器或高速互联系统的软硬件协同设计,能够从典型模型负载出发评估硬件架构。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。