招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型预训练工程师-AI Data

单位:字节跳动类别:研发类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2025-08-27 15:44:44

职位描述

1、主导大模型数据生产的Pipeline建设,涵盖寻源、采集、解析、处理、实验与分析等环节,为各基础模型提供稳定、大规模且高质量的预训练数据;

2、负责前沿数据合成研究,探索基于LLM的数据合成与增强技术(如Self-Instruct、Agent交互模拟等),设计高效生成策略以补充数据缺口;

3、建立针对合成数据的自动化评估体系(如Reward Model、LLM-as-a-Judge),并结合模型评测与数据分析反馈,反向迭代生产线与数据生成策略;

4、搭建并优化大模型预训练的数据工程底座,开发自动化框架与平台,支持海量数据的清洗、去重与格式化处理,提升底层资源调度与数据策略迭代效率;

5、沉淀全网高质量预训练数据,建设端到端的数据质量、多样性体系及场景化标签,与算法及基建团队高效协同,探索真实与合成数据的最优配比。

任职要求

1、本科及以上学历,计算机、人工智能、数学或相关专业,具备扎实的编程基础,精通Python,并掌握至少一种编程语言(Java/Go/C++);

2、具备AI数据开发经验,掌握大模型预训练基本原理,熟悉至少一类核心场景(代码生成或通用NLP)的数据特性;

3、在数据合成或基础工程方面,需具备以下任一方向的专业能力;研究方向:深入理解主流大模型架构及训练机制,熟悉各类Prompt技巧及数据增强机制,对大模型对齐(RLHF/DPO等)背后的数据构建逻辑有深入研究;工程方向:熟悉Spark、Flink、Ray等分布式计算框架,具备海量数据全流程清洗与处理经验,熟悉vLLM等推理加速框架者优先;

4、具备数据质量指标设计能力,能够熟练使用机器学习算法优化数据筛选与评估效率,沟通高效,能精准对接需求并协调资源。

加分项

1、参与过大模型数据准备,或有合成数据训练大模型成功落地经验者优先;

2、在自然语言处理或大模型相关领域(ACL、EMNLP、NeurIPS等)发表过高水平论文,或在GitHub开源项目(特别涉及合成数据、数据处理)有活跃贡献者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。