招聘公告 · 职位检索 · 央国企/事业单位/名企

端侧AI Storage研究员/专家(J14572)

单位:长江存储类型:社招地点:上海市、武汉市更新:2026-09-24

岗位信息

招聘单位长江存储
工作地点上海市、武汉市
官方更新时间2026-06-30T14:56:02

职位描述

【岗位职责】

• LLM推理存储架构优化:主导端侧大模型的存储子系统研发,解决Flash/NVMe在推理过程中的带宽与延迟瓶颈,重点优化KV Cache的内存/磁盘分页交换(Offloading)机制。

• 推理引擎深度适配:基于MNN等端侧框架,定制量化模型(INT4/INT8)的内存映射(mmap)与按需加载策略,实现“零拷贝”启动与低显存占用。

• 新架构存储调度:针对MOE(混合专家)等稀疏架构,设计动态专家路由的存储调度算法,优化随机读写性能,降低首字延迟(TTFT)。

• 软硬协同与功耗控制:构建端侧存储性能基准,通过预取、缓存替换算法及F2FS深度调优,最大化UFS/NVMe性能,同时降低推理功耗与Flash写入损耗。

任职要求

【任职要求】

• 学历背景:计算机、电子或相关专业硕士及以上,3年以上C/C++开发经验,深入理解Linux/Android内核及IO栈。

• 核心技能:

o LLM推理精通:深刻理解Transformer及MOE架构,熟悉vLLM、llama.cpp、MNN等框架的底层内存管理机制(如PagedAttention原理)。

o 存储系统专家:精通计算机体系结构中的存储层级(Cache/DRAM/Flash),熟悉F2FS/EXT4文件系统及UFS/NVMe协议。

o 全栈优化能力:具备量化、算子融合、显存/内存优化实战经验,能独立完成从模型加载到推理生成的全链路存储优化。

• 项目经验:有端侧大模型(手机/IoT/车机)落地经验,或主导过存储系统(文件系统/数据库/Flash控制器)研发项目。

【加分项】

• 有llama.cpp (GGUF/mmap)、vLLM源码贡献或MNN深度定制经验。

• 熟悉CUDA编程、GPU架构,或了解CXL、存算一体(PIM)技术。

• 在顶级会议发表过LLM系统优化相关论文,或拥有相关发明专利。

• 具备英语前沿论文追踪能力,能快速复现最新存储优化算法。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。