招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型训练存储系统专家 - Seed Model

单位:字节跳动类别:机器学习类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2024-12-09 12:18:44

职位描述

团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。

Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。

1、负责机器学习系统存储相关组件的设计和开发,服务于各方向场景(LLM/CV/Speech等)的数据加载模块和模型状态持久化,从而优化任务IO性能,提升有效训练时间;

2、负责设计和实现面向机器学习场景的文件系统,使用内存、SSD、HDD以及云端对象存储等介质进行数据的持久化存储和管理,均衡的优化存储性能与成本;

3、负责Kubernetes场景下各类存储系统的接入、管理、治理、监控;

4、负责多机房、多地域、多云场景的在任务数据联合调度,优化跨区域数据传输,实现负载的合理化分布。

任职要求

1、熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言;

2、熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验;

3、掌握分布式系统原理,参与过分布式系统的设计、开发和维护;

4、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;

5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;

6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。

加分项:

1、熟悉至少一种主流的机器学习框架(如PyTorch/Megatron-LM);

2、熟悉Fuse用户态文件系统,分布式缓存系统(如Alluxio),云原生存储编排系统(如Fluid)等;

3、熟悉操作系统内核,高性能RDMA网络通信等;

4、在计算机系统存储顶会(包括但不限于OSDI/SOSP/FAST)上有文章发表经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。