AI调度架构工程师-【算法引擎部】
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-08-13T14:12:05.000+08:00 |
职位描述
1. 基于云原生打造快手下一代训推调度平台,构建万卡规模的GPU调度能力,支撑包括大模型、生成式推荐等核心模型的训练与推理调度;
2. 支撑数据、训练、推理等全场景AI负载生命周期管理,构建训推一体的统一调度架构,落地统一的配额和算力管理机制,实现负载高效协同与资源精准管控;
3. 深耕 GPU 调度与性能优化,落地 GPU 拓扑感知、优先级、抢占、QoS 感知等调度能力,支撑万卡级大规模 AI 任务高效运行;
4. 聚焦大模型云原生基础设施建设,负责高性能网络与存储加速、多云部署与调度能力,解决大模型训推理在通信、调度上的关键挑战,持续推动云原生与 AI 技术深度融合与架构创新。
任职要求
1. 本科及以上学历,3年及以上机器学习平台、云原生调度、AI基础设施相关研发经验;
2. 熟悉Golang/Java/Python至少一种编程语言,具备扎实的代码功底,能独立负责核心模块的设计与开发;
3. 深入理解Kubernetes核心原理,熟悉调度器、资源扩展机制、容器运行时,有Kubernetes开发和维护经验;
4. 有机器学习平台,GPU调度、弹性调度、训推一体相关项目落地经验者优先;
5. 具备极强的问题排查能力与攻坚意识,具备良好的沟通协作能力与项目推动能力;
6. 对AI技术有浓厚兴趣,具备持续学习能力与创新思维,有强烈的ownership和责任心。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。