后端开发工程师(监控平台) - DCS
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-09-09 23:06:50 |
职位描述
团队介绍:字节跳动基础设施DCS【Data Center/Cloud Service/System Service】团队,负责字节跳动全球数据中心全生命周期的运营管理,职责涵盖数据中心运维、服务器管理、资产管理、AI运维平台研发、系统服务、云服务等。致力于为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供高可用、高稳定、高性能、低成本的算力资源。
1、统一监控架构:负责系统监控平台架构设计与研发,构建覆盖物理机、云主机、GPU、IaaS等系统资源的统一监控与观测体系,支撑上层业务对系统级监控的依赖;
2、数据链路与告警:负责【采集-传输-存储-查询】全链路及时序存储、告警引擎等模块的架构设计与研发,支撑海量指标写入与秒级查询,建设告警降噪、关联分析机制,打造【监控-告警-处置-验证】闭环;
3、容灾与高可用:负责容灾与高可用体系设计,保障机房级故障等极端场景下系统稳定对外服务;
4、智能化探索:推动监控从被动发现走向主动预防,探索主机异常诊断、智能告警、事件与日志等方向,结合LLM提升故障预测与根因定位能力。
任职要求
1、本科及以上学历,计算机相关专业优先,3年以上监控方向或运维平台后端开发经验;
2、至少掌握一门编程语言,包括但不限于:Golang、C、C++等,深刻理解计算机原理,具备良好的数据结构和算法基础,具备优秀的编码能力;
3、对监控、可观测领域有深入理解,熟悉指标采集、时序存储、告警引擎、日志等方向并有落地经验,熟悉开源监控体系(如Prometheus、VictoriaMetrics等)源码或有深度使用与二次开发经验;
4、具备解决系统问题的能力,有海量数据处理、高吞吐低延迟链路优化、性能调优实战经验,系统化思考与架构意识强,能独立完成复杂系统的设计与落地;
5、具备良好的自驱力与学习能力,优秀的沟通能力、组织协调与项目推动能力;英语可作为工作语言者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。