大模型技术支持工程师-火山方舟(北京/杭州/成都)
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-04-30 18:42:36 |
职位描述
1、负责大模型训练、推理及平台服务的监控告警接收与处理,按SOP完成故障定位、响应与跟踪;
2、作为一线业务OnCall接口人,响应内外部客户的技术支持与问题排查,负责OnCall记录、交接班及问题升级;
3、支撑大规模批量推理任务的日常运维,包括实例管理、扩缩容、流量调配及异常恢复;
4、编写并维护运维SOP、OnCall手册、监控告警及应急预案,参与自动化工具建设,提升运维效率。
任职要求
1、2年以上运维或技术支持经验;
2、熟悉Kubernetes及云原生体系,具备集群运维和故障排查能力;
3、熟悉至少一种公有云平台(AWS/GCP/火山引擎等),了解GPU及异构计算基础,能进行GPU节点健康检查与问题排查;
4、熟悉Prometheus、Grafana等监控体系,具备扎实的Linux基础和网络知识;
5、熟练使用Python/Shell进行脚本开发与自动化相关工作;
6、能适应轮班及OnCall值班(含夜班及节假日)。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。