招聘公告 · 职位检索 · 央国企/事业单位/名企

公有云机器学习系统工程师-调度方向

单位:字节跳动类别:后端类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2024-06-29 00:42:14

职位描述

1、负责机器学习系统资源调度的设计和开发,支持火山方舟大模型平台和机器学习平台的产品业务;

2、负责多机房、多集群环境下的,各种异构计算(GPU、CPU、其他异构硬件)、存储(各种云存储)、网络(VPC、RDMA)等资源的最优化编排调度,在严格的多租隔离环境下,支持各种离线训练、在线推理等负载场景的调度需求,并实现整体资源的合理化、最大化利用。

任职要求

1、熟练掌握Linux环境下的Go/Java/Python等1-2种语言;

2、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;

3、熟悉至少一种主流的机器学习框架(TensorFlow / PyTorch 或其他自研框架);

4、熟悉 Kubernetes 架构和生态,熟悉 Docker/Containerd/Kata 等容器技术,有丰富的云原生机器学习系统实践和开发经验;

5、掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护;

6、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;

7、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;

8、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。

加分项:

1、有大规模集群在离线资源调度相关工作的实践经验,对K8S/Volcano/Yarn/Mesos等一到多个开源项目的调度实现有源码级的理解,熟悉容器化、轻量级虚拟机等相关技术;

2、熟悉常见调度算法,对多租户Quota治理、抢占、弹性、碎片、潮汐、混部、QoS等一到多个调度问题有深入理解和实践经验,具备较强的解决复杂问题的分析和建模能力,有GPU相关调度经验;

3、有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture (GPU, Accelerators, Networking),ML for System,Distributed Storage。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。