招聘公告 · 职位检索 · 央国企/事业单位/名企

数据生产平台研发工程师(大模型训练数据方向)-【可灵AI】

单位:快手类型:社招更新:2026-09-24

岗位信息

招聘单位快手
官方更新时间2026-08-31T12:29:28.000+08:00

职位描述

1、参与数据资产与数据生产平台的架构设计和核心模块研发,建设工作流、元数据、数据集、算子、任务和发布等领域能力;

2、建设统一的数据加工工作流,支持 DAG、批量并行、长任务、优先级、重试、断点续跑、幂等、补数和失败回滚;

3、建设文本、图片、视频、音频等多模态数据处理框架,支持解析、转码、抽帧、切片、格式转换、特征提取和批量推理;

4、将清洗、过滤、去重、质量检测、采样、标注、审核等能力沉淀为标准算子、SDK、模板和可组合工作流;

5、建设数据集管理能力,包括 Dataset、Manifest、Schema、分片、快照、版本、血缘、标签、训练/验证/评测集划分和发布审批;

6、建立数据生产质量体系,支持规则校验、统计分析、分布检测、异常发现、抽样审核、质量评分和问题回溯;

7、建设数据生产任务的可观测体系,持续跟踪吞吐、延迟、失败率、有效数据产出率、资源利用率和单位数据成本;

8、优化海量文件、对象存储、缓存、索引、并行计算和数据布局,提升数据加工及训练读取效率;

9、建设身份权限、敏感信息处理、授权范围、审计、保留和删除传播能力,保证数据被合规使用;

10、对接训练和评测系统,通过 API、SDK 或数据清单稳定交付不可变的数据集版本,并保证结果可复现;

11、参与技术规范、代码评审、自动化测试、发布、值班、故障处理和复盘,持续提升平台工程质量;

12、深入理解算法和数据运营团队的生产流程,推动复杂人工流程标准化、自动化和产品化。

任职要求

1. 通常具有 3 年以上后端研发、数据工程、机器学习平台或分布式系统经验;

2. 熟练使用 Python、Java、Go、Scala 或 C++ 中至少一种语言,具备扎实的数据结构、算法和工程能力;

3. 熟悉 Linux、网络、存储、数据库、消息队列、并发编程和分布式系统基本原理;

4. 熟悉 SQL 和大规模数据处理,使用过 Spark、Flink、Ray 或同类分布式计算框架中的至少一种;

5. 理解工作流系统常见问题,包括状态管理、任务依赖、幂等、重试、超时、补数、资源隔离和故障恢复;

6. 具备生产系统研发和运维经验,能够对性能、稳定性、数据正确性和成本负责;

7. 能够把不确定的数据加工需求抽象为清晰的领域模型、接口、算子和平台能力;

8. 具备良好的文档、沟通和跨团队协作能力,能与算法、训练、产品及数据治理团队共同推进交付。

【可深耕方向】

候选人不需要同时精通全部方向,但应在至少一个方向具备可验证的生产深度

方向一:平台后端与工作流

1、熟悉任务调度、工作流编排、分布式任务执行、资源配额和多租户设计;

2、能设计高可用 API、元数据服务、状态机、事件机制和插件/算子框架;

3、有复杂平台从需求抽象、核心开发到生产运维的完整经验。

方向二:大规模数据加工

1、熟悉 Spark、Ray、Flink 或其他并行计算框架的执行与调优;

2、熟悉对象存储、列式存储、文件布局、缓存、索引和海量小文件治理;

3、能处理数据倾斜、重复计算、Shuffle、热点、吞吐和资源利用率问题。

方向三:多模态数据与质量

1、熟悉文本、图片、视频或音频中至少一类数据的解析和加工链路;

2、了解去重、质量打分、内容过滤、数据泄漏检测、样本均衡或模型辅助数据处理;

3、能将算法原型转化为稳定、高吞吐、可复现的生产任务。

方向四:数据资产与平台产品

1、熟悉数据目录、Dataset/Manifest、Schema、版本、血缘、质量和生命周期管理;

2、能设计面向算法和数据运营人员的 API、SDK、工作流或平台产品;

3、理解训练数据发布、审批、复现和问题追溯的完整流程。

【加分项】

1、有大模型、推荐搜索、计算机视觉、语音或多模态训练数据平台经验;

2、有 PB 级数据、十亿级样本、海量小文件或大规模视频处理经验;

3、有数据去重、相似度检索、Embedding、OCR、ASR、内容理解或质量评估经验;

4、有人工标注、模型辅助标注、主动学习、数据闭环或合成数据生产经验;

5、有 Kubernetes、批任务调度、GPU 资源调度、容器化或弹性任务平台经验;

6、有数据版本、实验复现、数据污染检测、评测集保护或训练数据治理经验;

7、有面向内部用户的平台产品研发经验,关注易用性、可维护性和自助化;

8、有开源项目贡献、技术文章、专利或高质量系统设计文档。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。