具身智能数据挖掘工程师(Seed) - Seed Model
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-09-22 16:53:48 |
职位描述
团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。
1、设计并实现机器人多模态数据挖掘策略与算法,从海量采集数据中自动识别高价值样本、难例与长尾场景,构建数据价值评分体系;
2、基于统计分析与机器学习方法,开展数据多样性分析、分布偏移检测与数据质量评估,为训练数据配比和采样策略提供决策依据;
3、搭建主动学习与数据筛选闭环,结合模型反馈自动挖掘模型薄弱环节对应的关键数据,驱动模型能力定向提升;
4、参与模型评估体系建设,通过数据挖掘手段定位模型失败案例的共性模式,为模型优化提供可追溯的数据洞察。
任职要求
1、对机器人系统、人工智能训练、数据平台等方向有浓厚兴趣,愿意深入理解机器人“大脑”的构建逻辑;
2、精通Python或Golang至少一种编程语言,能够开发高效、可扩展的数据处理工具;
3、具备图像/视频/多模态数据处理经验,熟悉数据处理、格式转换、时间同步等处理流程;
4、具备自动标注、数据质检、数据多样性分析或评测集构建经验者优先;
5、熟悉分布式计算或大数据处理框架(如Ray、Daft等)或AI数据湖者优先;
6、有海量数据处理平台、数据调度系统、数据流/批一体框架使用或开发经验者优先。
加分项
1、你对“数据驱动智能”的理念有认同感,能够从机器人任务的角度理解数据挖掘的价值;
2、有参与过机器人系统、仿真环境或大模型训练任务的项目经验;
3、有VLM/VLA训练调优经验者优先;
4、有主动学习、难例挖掘、数据价值评估相关研究或实践经验者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。