Kubernetes调度研发工程师 - 计算
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 上海、北京、杭州 |
| 官方更新时间 | 2022-03-29 15:54:24 |
职位描述
团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。
从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。
如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。
1、负责Kubernetes调度系统的设计与研发,持续优化大规模集群下的调度性能、资源分配效率和系统稳定性;
2、负责批处理与AI作业的编排调度链路,打通工作流编排、队列准入与集群调度,建设多租户队列、弹性配额、优先级、抢占、任务依赖和故障恢复能力;
3、负责在线/离线混部与资源优化,基于云原生资源管理框架建设CPU/内存QoS、资源超卖、负载感知、弹性限额、驱逐和重调度能力,在保障在线业务SLO的前提下提升资源利用率;
4、面向自动驾驶、AI训练、仿真和数据处理等场景,支撑大规模集群批任务,解决高并发工作流、异构资源、多资源池和高密部署下的调度与资源碎片问题。
任职要求
1、本科及以上学历,计算机相关专业,5年以上后端或基础设施研发经验;熟练使用Go,具备系统源码阅读、设计和开发能力;
2、深入理解Kubernetes Scheduler,至少在集群调度、批处理调度、队列准入或资源管理系统中一个方向具备源码级研发或大规模生产实践;
3、熟悉队列、配额、公平共享、优先级、抢占、Gang、弹性伸缩、重调度和拓扑感知等调度机制,能够分析资源碎片、饥饿、死锁和账本不一致问题;
4、熟悉Kubernetes资源模型及节点执行链路,理解requests/limits、cgroup、CPU/内存QoS、NUMA和异构设备资源;具备云原生资源管理、混部或QoS系统经验;
5、具备高性能、高并发系统研发经验,能够使用pprof、Tracing、指标和压测工具定位热点锁、缓存、队列、算法复杂度和状态新鲜度问题;
6、具备复杂系统问题的分析与工程闭环能力,能够基于源码、指标、日志和压测建立证据,并推动调度、运行时、内核、网络、存储及业务平台等跨团队项目落地。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。