数据语料工程师
岗位信息
| 招聘单位 | 上海西井科技股份有限公司 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2025-09-28 14:52:35 |
职位描述
- 构建多模态 AI 数据语料 pipeline,处理 LiDAR / Video / Sensor / 结构化数据,支撑模型训练、仿真与算法评估。
- 基于 NiFi / Dagster 设计数据工作流与数据生产系统,实现数据采集、清洗、转换与 dataset 构建自动化。
- 基于 Daft / Arrow / Parquet / Lakehouse 构建高性能数据处理 pipeline,支持 PB 级数据处理与大规模 dataset workflow。
- 实现多模态数据对齐与融合,包括 LiDAR / Camera / Sensor 时间同步、空间对齐与数据整合。
- 建设 AI 数据资产管理体系,包括 dataset versioning、data lineage、数据质量监控与数据标准化。
- 支撑训练与仿真团队的数据需求,持续优化 dataset 质量、数据分布与数据覆盖度。
- 探索 AI 在数据工程中的应用,如 自动化数据清洗、数据质量检测与 AI-assisted data workflow(Dify / LLM)。
任职要求
- 具备 3 年以上数据工程、AI 数据工程或大规模数据处理经验。
- 熟悉 Python,具备扎实的数据处理与工程能力。
- 熟悉分布式数据处理框架,如 Spark / Flink / Beam 等。
- 熟悉数据 pipeline 架构与数据工作流编排。
- 理解数据建模、数据质量与 dataset lifecycle 管理。
- 具备复杂数据问题分析能力,能够定位数据质量、数据处理性能或数据一致性问题。
- 认同用工程化方式构建高质量 AI 数据资产。
---
加分项
- 有 LiDAR / Video / Sensor 等多模态数据处理经验。
- 有 AI dataset 构建或自动驾驶数据 pipeline 经验。
- 熟悉 Daft / Arrow / Parquet / Lakehouse(Iceberg / Delta / Hudi)。
- 有数据质量监控、dataset versioning 或数据治理经验。
- 有 Dify / LLM / AI agent 在数据处理或数据工作流中的应用经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。