招聘公告 · 职位检索 · 央国企/事业单位/名企

机器学习数据工程师 - Data AML

单位:字节跳动类别:大数据类型:社招地点:北京、杭州、上海更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京、杭州、上海
官方更新时间2025-08-05 22:51:09

职位描述

团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。

1、负责字节跳动推荐/广告/搜索类业务中多模态数据生产链路的搭建与ETL流程设计开发,构建一套标准的、面向广义推荐系统场景的多模态特征数据的生产、清洗和存储链路,并针对未来模型演进方向构建高效的样本生产、存储和访问链路;设计与开发高效、高可用的数据管道;

2、基于Spark构建百亿规模、PB级别数据的清洗框架,优化数据预处理效率;完成多模态结合搜推特征的生产,包括数据去重、过滤、spam数据处理、数据均衡等操作,并将生产链路平台化;

3、针对多模态特征特点,构建多模态特征缓存体系与存储体系,显著提高数据访问吞吐,降低延迟;

4、参与构建多模态模型的上线链路,将历史数据批量写回链路以及实时数据生产链路平台化,支持模型上线;与算法团队深度协同,推进算法与系统的联合优化,持续提升系统对业务的支撑能力。

任职要求

1、熟悉数据仓库实施方法论、深入了解数据仓库体系,并支撑过实际业务场景,有PB级集群实战调优经验者优先;

2、熟练使用Spark和Hive等,熟悉Java、Python等编程语言,有PyTorch/TensorFlow数据处理经验者优先;

3、熟悉数据标注体系,了解大模型训练数据特性;

4、善于沟通,对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力;

5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;

6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。

加分项(符合其中任意一项者优先):

1、熟悉至少一种主流的机器学习框架(PyTorch/TensorFlow);

2、在大模型或推荐模型领域,参与过大影响力的项目或论文。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。