机器学习平台SRE工程师-AML
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2024-12-06 10:57:10 |
职位描述
1、负责机器学习系统的稳定运转,支持模型开发、训练与部署;
2、负责GPU/NPU/CPU和存储等资源的管理与规划、成本与预算;
3、负责多地域、多机房的系统容灾、服务部署管理和集群机器治理;
4、开发自动化工具或平台,提升资源利用率和运维人效。
任职要求
1、三年以上运维开发项目经验;
2、熟练掌握Linux环境下的Go/Python/Shell等1至2种以上语言;
3、有大型分布式系统的资源管理和任务调度系统运维经验,熟悉Kubernetes生态和架构;
4、有强烈的工作责任心,出色的学习能力、沟通能力和自驱力,良好的团队合作精神;
5、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
加分项:
1、从事过大规模分布式系统的运维;
2、有GPU服务器的运维经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。