智能视频SRE工程师 - 音视频技术
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京、上海 |
| 官方更新时间 | 2026-09-14 18:01:42 |
职位描述
团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节跳动全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。
1、调度服务全生命周期运维:负责域名/VIP/网关/STUN等核心调度链路的日常运维与架构保障;主导鉴权、容器化调度、接入验收、数据门户、镜像管理、OpenAPI等调度平台能力的稳定性建设,并完成配套RDS/Redis/TLB等中间件的日常维护与优化;
2、容量管理与弹性伸缩:建立核心调度服务(网关、调度、接入、缓存等)的容量监测体系,及时发现容量风险,完成物理机、连接(socket)、缓存等多维度的扩缩容,保障资源供给与业务量级精准匹配;
3、监控告警与应急响应:主导监控大盘与可观测性体系建设,承担Oncall值班、SLA告警与P0故障的应急处理,持续沉淀与完善SOP手册,缩短故障发现与恢复时长;
4、容灾演练与稳定性预案:主导机房级容灾演练与常态化演练机制,推动研发侧完善容灾能力,牵头应急预案(如流量切换、限流降级等)的制定与落地,挖掘出高风险场景,提出并推进改进方案落地;
5、边缘节点资源运维与统筹:负责海量边缘节点的异常监控(网络质量、连通性、硬件配置、安全风险等)与厂商协同处理;统筹资源募集、月度交付、上下架与厂商替换;完成节点核验、录入部署、流量迁移与集群配置优化,确保节点信息与带宽资源准确匹配;
6、稳定性系统化建设:以稳定性第一视角推动节点管理、故障自愈、变更管控等平台系统的建设,将容灾、限流、容错等应急手段高度平台化、自动化、Agent智能化,持续提升整体运维效能。
任职要求
1、计算机、软件工程或相关专业本科及以上学历,具备5年以上分布式系统研发或SRE/基础架构工作经验;
2、扎实的底层功底:深入理解分布式系统架构和Linux系统技术,具备硬核的分布式系统级排障与性能调优、架构优化能力;
3、工程与编码能力:熟悉Go/Python中至少一门语言(Go优先),具备良好的后端/平台化系统设计能力,能独立交付自动化运维工具与平台级软件系统;
4、云原生与分布式调度技术栈:熟悉Kubernetes容器生态与微服务架构,掌握主流监控可观测体系(如Prometheus、Grafana),对分布式调度系统的运行机制有清晰认知;
5、稳定性建设经验:在容量管理、容灾、限流、容错、变更管控等稳定性方向具备丰富的实战经验与落地实践;
6、系统化思维与自驱力:能以“系统化思维”拆解并解决复杂技术难题,具备推进力与跨团队沟通协作能力,对数据与线上稳定性充满敬畏。
加分项:
1、PCDN行业经验:具备PCDN相关行业经验,或CDN/边缘计算/音视频分发领域的运维与研发经验者优先;
2、调度系统运维:具备分布式调度系统的运维经验,在节点/流量调度场景下有成功的稳定性建设与落地实践者优先;
3、稳定性平台建设:主导过容量管理、容灾演练、混沌工程、变更管控或故障自愈等稳定性平台/系统建设者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。