招聘公告 · 职位检索 · 央国企/事业单位/名企

Infra平台开发工程师-Data AML

单位:字节跳动类别:后端类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2024-06-14 11:11:18

职位描述

1、AI基础设施平台研发:参与/负责面向大规模GPU集群、分布式存储与高性能网络的资源管理、调度、配额、隔离等平台能力建设,支持万卡级训练与大规模推理场景;

2、资源效率与成本优化:围绕GPU利用率、显存/算力/存储/带宽等关键指标,构建可观测体系并推动调度策略、混部、弹性伸缩、潮汐复用等优化方案落地;

3、稳定性体系建设:建立覆盖容量、变更、故障、应急的稳定性体系,主导/参与SLO定义、容量规划、故障演练、应急预案、Postmortem等工作,持续降低MTTR与故障影响面;

4、研发体系标准化:沉淀AI训练/推理/数据流水线的研发规范、模板与工具链(CI/CD、版本管理、环境管理、镜像管理、配置管理等),推动跨团队研发流程的统一与提效;

5、AIOps智能运维:基于平台大盘指标、日志、Trace、事件等数据,建设异常检测、告警降噪、根因定位、容量预测、自动化处置等智能运维能力;探索大模型/Agent在AI Infra运维场景的落地。

任职要求

1、本科及以上学历,计算机、软件工程、人工智能等相关专业;3年以上后端研发工作经验;

2、扎实的编程功底,熟悉Go/Python/Java中至少一门,具备良好的工程架构与代码质量意识;熟悉Python Flask、Celery、DjanGo、Tornado、NumPy等框架和库使用或熟悉Golang BeeGo、Gin、Gorm、Sarama,gRPC-Go等常见开源框架;

3、熟悉分布式系统、微服务架构,了解可观测性体系(OpenTSDB、Prometheus、Grafana、ELK、OpenTelemetry等),OLAP数据库ClickHouse使用;

4、具备以下任一方向经验者优先:

1)时序异常检测、告警降噪、根因分析等AIOps算法落地经验;

2)大模型/RAG/Agent应用开发经验;

3)监控、日志、Trace数据处理与平台建设经验;

5、良好的问题分析与解决能力,较强的沟通协作能力和主动性,能在复杂系统中快速定位与解决问题。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。