招聘公告 · 职位检索 · 央国企/事业单位/名企

大数据架构资深工程师

单位:哔哩哔哩类别:全职类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位哔哩哔哩
工作地点上海
官方更新时间2026-06-17 16:06:24

职位描述

工作职责:

1、大数据基础设施研发

(1)跟踪开源社区前沿(Hadoop、Spark、Flink、Iceberg、ES、Trino、Paimon、ClickHouse、Velox、Gluten 等),结合公司业务实际需求做选型评估

(2)对开源方案做二次开发与整合,包括但不限于性能优化、稳定性加固、与公司基础设施打通、定制化功能开发

(3)在开源方案不能满足时,主导自研组件的设计和实现,能够做到系统设计,方案讨论,代码实现,发布上线,版本迭代,线上运维等。

(4)负责的方向覆盖以下一个或多个领域:

○批处理系统(Spark、MR 生态、向量化执行引擎如 Gluten/Velox)

○流处理系统(Flink、Flink CDC、流批一体)

○OLAP 引擎(ClickHouse、Trino)

○实时数仓(Lambda/Kappa 架构、湖仓一体、Iceberg/Paimon/Hudi)

○数据集成/清洗/治理(Data Schema、AutoETL、Atalas、Ranger)

○存储底座(HDFS、对象存储、EC、分层存储、冷热分离)

2、AI 赋能基础设施研发

(1)熟练使用 Claude Code、Cursor、Copilot 等 AI 编程工具,将 AI 深度嵌入日常工作流

(2)主导 AI 流程自动化建设,为团队赋能:

○开发阶段:基于 AI 的代码生成、Code Review、单测生成、性能 profiling 自动化

○发布阶段:AI 辅助的变更影响分析、灰度策略推荐、回滚决策

○运维阶段:AI 驱动的告警归并、根因分析、故障自愈

○答疑阶段:基于内部知识库的 RAG 答疑机器人、SQL 助手、调优建议生成

(3)沉淀 AI 工具链最佳实践,推广到全组并向外辐射

工作要求:

【硬性条件】

●985 / 211 及以上院校全日制本科及以上学历

●5 年以上大数据相关工作经验

●在 Hadoop 生态(HDFS / Spark / Flink / Hive / HBase 之一)有深度的源码级理解和调优经验

●至少深度参与过 1 个大型大数据基础设施项目(EB 级存储 / PB 级日处理 / 千节点以上集群 任一)

●Java / Scala / Go / Rust / C++ 中至少两门掌握扎实

●对 OLAP / 流处理 / 批处理 / 存储 中至少一个方向有体系化认知,在对应领域里面有深入了解、开发、应用。

【能力素质】

满足以下一项或者多项要求:

●对开源生态高度熟悉,能快速判断"该自研、该用开源、该改开源"的边界

●具备从 0 到 1 设计大型分布式系统的能力,能独立 owner 某个技术方向

●良好的工程品味:代码质量、测试覆盖、可观测性、稳定性

●熟练使用 AI 编程工具完成日常开发,对 LLM 能力边界有清晰认知

●良好的中英文技术阅读和书面表达能力(社区 issue / PR / 设计文档)

【加分项(满足任一即可加分,多项叠加)】

●Apache 顶级项目 Committer / PMC,或活跃的 Contributor(有合入主线的非 trivial PR)

●主导过将 AI 能力工程化落地到基础设施场景的真实案例(不只是用 ChatGPT 写代码,而是构建了系统)

●有湖仓一体(Iceberg / Paimon / Hudi)大规模落地经验

●有向量化执行引擎(Velox / Gluten / Photon / DuckDB)的开发或深度调优经验

●有跨机房 / 多活 / 容灾的大数据基础设施建设经验

●有 EB 级存储成本优化经验(EC 编码、冷热分层、磁带归档、对象存储)

●在 GitHub 有持续的开源项目贡献

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。