机器学习平台存储研发工程师-Data AML
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-04-28 18:33:07 |
职位描述
1、负责机器学习系统存储相关组件的设计和开发,服务于各方向场景(NLP/CV/Speech等)的模型训练、模型评估和模型推理;
2、设计和实现面向训练/推理场景的多层级存储系统,综合利用显存、本地内存、分布式内存/磁盘、远端大容量存储系统(HDFS/对象存储)等多种介质进行数据的存储和迁移管理,实现「近计算缓存+远端大容量存储」的一体化分级系统,高效数据流动;
3、负责Kubernetes场景下多级存储系统的接入、管理、运维、监控,确保稳定性;
4、负责多机房、多地域、多云场景的系统搭建和容灾,优化跨集群的数据摆放。
任职要求
1、熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言;
2、熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验;
3、掌握分布式系统原理,参与过分布式系统的设计、开发和维护;
4、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应并采取行动;
6、有良好的工作文档习惯,按要求及时撰写、更新工作流程及技术文档。
加分项
1、熟悉至少一种主流的机器学习框架/推理引擎(例如vLLM/SGLang/PyTorch);
2、有大模型推理/训练相关的技术落地经验;
3、熟悉分布式缓存系统(例如Alluxio、JuiceFS、GooseFS、JindoFS)等;
4、熟悉NVLink、RDMA、NCCL、GPU Direct等技术。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。