招聘公告 · 职位检索 · 央国企/事业单位/名企

高性能存储研发工程师

单位:MiniMax类别:互联网 / 电子 / 网游类型:社招地点:上海、北京更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点上海、北京
官方更新时间2026-06-26 20:04:01

职位描述

一、岗位定位

面向大模型训练与推理场景,研发高吞吐、低延迟、高可靠的全闪分布式存储系统,为 Checkpoint、海量训练数据和 KV Cache 提供稳定高效的数据基础设施。

二、你将负责

1. 面向大模型训练与推理场景,设计和研发全闪分布式存储系统。

2. 支撑大规模训练 Checkpoint 的并行保存与快速恢复、Dataloader 海量样本读取,以及 G3/G3.5 专属 KV Cache 的高性能存储与访问。

3. 根据个人技术方向,负责客户端、元数据服务、存储引擎或数据保护等核心模块的设计与研发。

4. 优化 RDMA、NVMe、用户态 IO、零拷贝、异步流水线和 NUMA 感知等关键数据路径。

5. 设计和实现分片、副本、纠删码、缓存一致性、故障接管、数据修复与垃圾回收等核心机制。

6. 建设性能测试、故障注入和全链路观测体系,持续优化系统吞吐、IOPS、尾延迟、CPU 开销和 GPU 利用率。

7. 参与复杂存储问题的性能分析、故障定位与工程优化,推动系统从设计、开发到上线运行的完整交付。

任职要求

三、我们期望你具备

1. 计算机或相关专业本科及以上学历。

2. 熟练掌握 C/C++,熟悉 Linux 系统编程、多线程并发、内存管理、网络和文件IO。

3. 具备分布式文件系统、对象存储、块存储、数据库或分布式 KV 系统研发经验。

4. 理解分片、复制、纠删码、共识、事务、幂等和故障恢复等分布式系统机制。

5. 具备复杂系统的性能分析和问题定位能力,能够独立完成方案设计、编码、测试与优化。

6. 具备良好的工程意识,关注系统的性能、可靠性、可观测性和长期演进。

四、加分项

- 熟悉 RDMA、RoCE / InfiniBand、NVMe、SPDK、io_uring、DPDK 或 GPU Direct Storage。

- 熟悉 POSIX、VFS、用户态文件系统、元数据一致性或高可用架构。

- 有 Ceph、3FS、RocksDB 等分布式存储系统或存储引擎的研发、性能优化及生产实践经验。

- 熟悉 PyTorch、Megatron-LM、DeepSpeed、vLLM、SGLang 等大模型训练与推理框架。

- 有大模型训练、推理或 AI 基础设施相关存储项目经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。