高性能存储研发工程师
岗位信息
| 招聘单位 | MiniMax |
|---|---|
| 工作地点 | 上海、北京 |
| 官方更新时间 | 2026-06-26 20:04:01 |
职位描述
一、岗位定位
面向大模型训练与推理场景,研发高吞吐、低延迟、高可靠的全闪分布式存储系统,为 Checkpoint、海量训练数据和 KV Cache 提供稳定高效的数据基础设施。
二、你将负责
1. 面向大模型训练与推理场景,设计和研发全闪分布式存储系统。
2. 支撑大规模训练 Checkpoint 的并行保存与快速恢复、Dataloader 海量样本读取,以及 G3/G3.5 专属 KV Cache 的高性能存储与访问。
3. 根据个人技术方向,负责客户端、元数据服务、存储引擎或数据保护等核心模块的设计与研发。
4. 优化 RDMA、NVMe、用户态 IO、零拷贝、异步流水线和 NUMA 感知等关键数据路径。
5. 设计和实现分片、副本、纠删码、缓存一致性、故障接管、数据修复与垃圾回收等核心机制。
6. 建设性能测试、故障注入和全链路观测体系,持续优化系统吞吐、IOPS、尾延迟、CPU 开销和 GPU 利用率。
7. 参与复杂存储问题的性能分析、故障定位与工程优化,推动系统从设计、开发到上线运行的完整交付。
任职要求
三、我们期望你具备
1. 计算机或相关专业本科及以上学历。
2. 熟练掌握 C/C++,熟悉 Linux 系统编程、多线程并发、内存管理、网络和文件IO。
3. 具备分布式文件系统、对象存储、块存储、数据库或分布式 KV 系统研发经验。
4. 理解分片、复制、纠删码、共识、事务、幂等和故障恢复等分布式系统机制。
5. 具备复杂系统的性能分析和问题定位能力,能够独立完成方案设计、编码、测试与优化。
6. 具备良好的工程意识,关注系统的性能、可靠性、可观测性和长期演进。
四、加分项
- 熟悉 RDMA、RoCE / InfiniBand、NVMe、SPDK、io_uring、DPDK 或 GPU Direct Storage。
- 熟悉 POSIX、VFS、用户态文件系统、元数据一致性或高可用架构。
- 有 Ceph、3FS、RocksDB 等分布式存储系统或存储引擎的研发、性能优化及生产实践经验。
- 熟悉 PyTorch、Megatron-LM、DeepSpeed、vLLM、SGLang 等大模型训练与推理框架。
- 有大模型训练、推理或 AI 基础设施相关存储项目经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。