招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型基础设施工程师(数据方向)(J10635)

单位:越疆机器人类型:社招地点:上海市、深圳市更新:2026-09-24

岗位信息

招聘单位越疆机器人
工作地点上海市、深圳市
官方更新时间2026-03-25T15:14:46

职位描述

1、负责具身智能 / VLA(Vision-Language-Action)训练数据的全流程管理,包括数据接入、存储、清洗、质检、版本管理、发布与归档。

2、负责多模态机器人数据的治理与标准化,覆盖但不限于:

RGB / 深度图 / 点云 / 视频

关节状态 / 力矩 / IMU / 末端状态

文本指令 / 任务标签 / 动作标签 / 轨迹数据

遥操作数据 / 示教数据 / 仿真数据 / 实机回传数据

3、设计并实现数据清洗流程,识别并处理丢帧、错帧、时间戳漂移、模态不同步、异常值、坏样本、重复数据、标注错误等问题。

4、负责建设 VLA 数据质量评估体系,制定数据完整性、一致性、有效性、分布均衡性、任务覆盖度、成功率等核心指标。

5、负责数据集 schema、命名规范、元数据规范、采集协议、版本规则等标准制定,推动跨团队数据格式统一。

6、负责训练前数据预处理与样本构建,包括轨迹切片、动作对齐、任务分段、指令映射、成功失败样本筛选与重采样。

7、负责数据流水线开发与维护,提升大规模数据处理效率,支撑模型训练、评测、回放分析与问题追踪。

8、与算法、遥操作、标注、仿真、本体、平台团队协作,推动“采集—清洗—训练—评测—回流”的数据闭环建设。

9、参与具身数据平台建设,支持数据检索、回放、可视化分析、质量监控、血缘追踪与权限管理。

10、支持 VLA / 模仿学习 / 行为克隆 / 世界模型等任务的数据组织与样本优化,提升训练数据可用性与模型泛化效果。

任职要求

1、本科及以上学历,计算机、自动化、机器人、人工智能、软件工程、数据工程等相关专业。

2、具备数据工程、数据治理、机器学习数据处理或机器人数据处理相关经验。

3、熟悉 Python,具备良好的工程开发能力,能够独立完成数据处理脚本、清洗流水线和质量分析工具开发。

4、熟悉常见数据处理工具与框架,如 NumPy、Pandas、PyArrow、OpenCV、PyTorch Dataset、Spark / Ray / Dask 等。

5、熟悉多模态数据特性,理解图像、视频、传感器、轨迹、文本数据在时间同步、空间对齐和标签一致性上的关键问题。

5、熟悉数据清洗和质量控制常见方法,能够定位大规模数据中的系统性问题与长尾异常。

6、熟悉机器学习 / 深度学习训练数据组织形式,理解训练集、验证集、测试集切分与数据泄漏风险。

7、具备较强的问题分析能力和细节把控能力,能够把“能采到的数据”变成“模型真的能吃的数据”。

加分项

有以下经验者优先:

1、机器人遥操作 / 示教 / 模仿学习数据处理经验

2、VLA / VLM / 机器人操作数据集构建经验

3、HDF5、Parquet、Zarr、ROS Bag、MCAP、LeRobot 等数据格式经验

4、多传感器时间同步、标定、轨迹对齐经验

5、数据平台、标注平台、回放平台建设经验

6、熟悉机器人学习相关任务,如抓取、操作、移动、双臂协同、灵巧手控制等。

7、有大规模数据流水线、分布式数据处理、对象存储、数据版本管理经验。

8、有数据可视化分析、异常检测、自动质检规则引擎经验。

9、有真实机器人项目、仿真数据生成、Sim2Real 数据闭环经验。

我们希望你具备的能力特质

1、对具身智能、机器人学习和多模态数据有浓厚兴趣。

2、有很强的“数据洁癖”和责任心,能够发现那些表面看不出来、训练时却会狠狠干扰模型的问题。

3、具备较强的工程落地意识,能把数据清洗从“手工排雷”做成“系统化流水线”。

4、具备良好的跨团队协作能力,能与算法、采集、仿真、硬件团队高效对齐。

5、对数据质量有结果导向意识,能从模型效果反推数据问题,而不是只会数文件个数。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。