招聘公告 · 职位检索 · 央国企/事业单位/名企

具身智能VLA模型数据算法工程师-AI数据与安全

单位:字节跳动类别:研发类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2026-05-29 16:04:10

职位描述

1、负责具身智能VLA(视觉-语言-动作)模型预训练数据全流程研发,聚焦数据合成、自动化打标、质量分析与优化,支撑模型实现“感知-理解-执行”一体化能力提升,适配人形机器人、智能交互终端等具身场景需求;

2、研发高效的自动化打标算法,整合多模态感知、理解等能力,实现动作轨迹、3D位姿、物体交互关系、语言指令对齐等关键信息的自动标注,优化标注精度与效率,降低人工标注成本;搭建VLA预训练数据质量分析体系,设计多维度质量评估指标(如动作执行准确率、跨域迁移稳定性、数据对齐精度等),开发异常数据检测、噪声过滤算法,剔除模糊、错位、语义不一致等低质量样本,保障预训练数据的可靠性与鲁棒性,支撑模型训练效果达标;设计并实现VLA模型预训练数据合成算法,基于仿真引擎/AIGC模型等能力,构建虚拟仿真场景,结合域随机化技术生成大规模、多样化的视觉-语言-动作配对样本,覆盖家居、服务等多类真实场景任务,满足模型预训练的数据规模与多样性要求;

3、参与VLA模型预训练、微调及验证全流程,结合数据特性优化训练策略,分析数据质量对模型性能的影响,迭代优化数据方案,提升模型在真实物理场景中的泛化能力与动作执行可靠性;

4、跟进具身智能、VLA模型、多模态数据处理领域的前沿技术(如Sim-to-Real迁移、多模态对齐、自动标注框架等),开展技术调研与方案验证,将先进技术落地到数据研发流程中,推动数据算法的创新与优化;

5、与模型研发、机器人硬件、仿真测试等团队紧密协作,明确数据需求,交付符合模型训练标准的高质量预训练数据集,配合完成算法集成、测试与迭代,支撑具身智能产品的落地应用。

任职要求

1、本科及以上学历,计算机、人工智能、软件工程等相关专业;

2、深入理解VLA模型的核心原理与预训练机制,熟悉视觉-语言-动作三模态数据的特性,掌握多模态数据对齐、特征提取等关键技术,了解主流VLA模型的架构与训练逻辑;

3、精通Python编程语言,熟练使用PyTorch/TensorFlow等深度学习框架,掌握numpy、h5py、OpenCV等数据处理工具,具备扎实的算法编程与工程实现能力;

4、具备数据合成、自动化打标相关算法研发经验,熟悉物理仿真平台,能够独立设计虚拟场景与数据生成方案,或有第一人称视频自动标注、3D位姿轨迹提取相关经验者优先;

5、掌握数据质量分析方法,能够设计合理的质量评估指标,开发异常数据检测与过滤算法,有预训练数据集处理、优化经验者优先;

6、了解具身智能相关技术(如强化学习、模仿学习、机器人运动控制等),熟悉机器人感知-决策-控制一体化流程,有机器人数据采集、处理相关经验者优先。

加分项:

1、有VLA模型预训练数据全流程研发经验,曾主导或参与具身智能预训练数据集构建者;

2、在顶会(CVPR、ICCV、ECCV、NeurIPS、ICML等)发表过VLA、多模态数据处理、具身智能相关论文者;

3、熟悉遥操作数据采集技术、域随机化方法,或有机器人灵巧手操作、人形机器人数据处理相关经验者;

4、参与过开源具身智能数据集构建或VLA模型相关项目者。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。