AML机器学习系统SRE工程师-火山引擎
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2025-04-25 17:35:50 |
职位描述
1、负责维护机器学习系统的稳定运转,支持模型开发、训练与部署的多个环节;
2、负责集群、业务服务的稳定性治理,资源利用率提升和运维人效提升;
3、负责性能优化与架构升级,持续提升数据预处理/训练/推理性能;
4、与算法工程师深度合作,为重点项目进行算法与系统的联合优化。
任职要求
1、一年以上运维开发项目经验;
2、熟练掌握Linux环境下的C++/Python/Shell等1至2种以上语言;
3、有大型分布式系统的资源管理和任务调度系统运维经验,熟悉Kubernetes生态和架构,具备1年以上相关的运维经验;
4、熟悉Docker等容器化技术,具备1年以上运维经验;
5、对PyTorch/TensorFlow框架有了解,了解常见的机器学习算法;
6、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,良好的团队合作精神;有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。