AI Infra平台研发工程师(大模型开发机方向) - Seed Model
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-06-09 21:13:49 |
职位描述
团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。
1、负责大模型平台开发机的后端系统设计与研发,包括开发机生命周期管理、用户权限与资源隔离等能力;
2、设计和优化基于Kubernetes的资源编排与调度体系,支持CPU/GPU、共享存储、网络、镜像等复杂资源管理场景;
3、建设面向算法研发的云端开发体验,包括VS Code Server、SSH、Web IDE、任务环境复用、镜像管理、数据挂载等能力;
4、负责平台核心架构设计,提升系统的稳定性、可扩展性、可观测性和运维效率;
5、与算法、训练平台、基础架构、运维等团队协作,持续提升大模型研发效率和资源利用率;
6、参与平台工程化建设,包括服务治理、监控告警、日志链路、故障诊断、灰度发布、容量规划和成本优化,跟进云原生、AI Infra、GPU调度、分布式训练、AI Agent等方向的技术演进,并推动在平台中的落地。
任职要求
1、本科及以上学历,计算机、软件工程或相关专业优先;
2、具备扎实的软件工程能力,熟悉至少一种主流后端开发语言,如Go、Java、Python、C++等,有较强的系统设计和代码实现能力;熟悉应用开发和平台开发,有复杂业务系统、基础平台、研发平台、云平台或机器学习平台建设经验;
3、具备扎实的架构基础,理解分布式系统、高可用设计、服务治理、异步任务、缓存、消息队列、数据库设计等常见后端架构模式;熟悉容器化和Kubernetes生态,理解Pod、Deployment、StatefulSet、CRD、Operator、Scheduler、Volume、NetworkPolicy等核心机制;
4、理解资源编排与调度相关技术,有CPU/GPU调度、队列、配额、多租户隔离、弹性伸缩、资源回收等经验者优先;
5、具备良好的问题分析和故障排查能力,能独立定位复杂线上问题;
6、具备良好的沟通协作能力,能够和算法、平台、SRE、基础设施团队高效配合。
加分析:
1、有机器学习平台、训练平台、开发机平台、AI Infra、MLOps平台建设经验;
2、熟悉Kubeflow、JupyterHub、Ray、Volcano、Kueue、Argo Workflows、KServe、MLflow等相关技术;
3、有GPU集群、异构资源调度、分布式训练、模型开发环境建设经验;
4、熟悉Linux、容器运行时、网络、存储、镜像构建、远程开发协议等底层技术;
5、有云厂商、AI平台或基础架构团队经验;
6、对研发效率、平台产品体验、稳定性和成本优化有深入理解,了解AI Agent相关技术,有Agent IDE、AI Coding、自动化研发助手、数据/训练Agent等产品或平台建设经验者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。