大数据基础平台工程师(基础设施与数据架构方向) -【可灵AI】
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-08-31T12:29:17.000+08:00 |
职位描述
1、参与公司级大数据平台的整体架构设计,明确数据接入、批流计算、湖仓存储、研发治理、权限和运维边界;
2、建设多环境基础设施与平台工程体系,包括组织与账号、统一身份与访问控制、虚拟网络、跨环境网络互联、专线、密钥管理、审计、日志和成本基线;
3、建设以对象存储、开放表格式、开放 Catalog 和批计算引擎为核心的湖仓,解决分区、并发写、小文件、Compaction、Schema 演进和数据恢复问题;
4、建设 Kafka + Flink 实时数据平台,支持 CDC、事件时间、状态管理、回放、Savepoint 升级、故障恢复和端到端数据一致性;
5、建设统一的数据研发与调度体系,推动 Git、代码评审、自动测试、CI/CD、环境隔离、补数和发布回退标准化;
6、根据真实负载评估数据仓库、OLAP、训练平台、高性能文件存储和缓存等能力,避免不必要的产品叠加和技术锁定;
7、与模型训练团队共同建设训练数据链路,实现原始视频/图片管理、样本清洗、数据集版本、血缘、质量、合规和高吞吐读取;
8、建设平台可观测、SLO、容量、容灾、值班和故障演练体系,持续提升稳定性和可恢复性;
9、建设成本标签、预算、单位成本和容量模型,优化计算、存储、网络及训练数据读取成本;
10、沉淀平台规范、模板、SDK、自动化工具和 Runbook,支持数据研发团队自助接入。
任职要求
1、计算机或相关领域基础扎实,通常具有 3 年以上基础架构、大数据平台或分布式系统经验;
2、熟悉 Linux、网络、存储、身份权限和分布式系统基本原理,能够分析真实生产问题,而不只停留在产品配置层面;
3、熟练使用 Java、Scala、Python 或 Go 中至少一种语言,具备良好的 SQL、脚本和工程化能力;
4、参与过大规模数据基础设施或平台建设,理解统一身份与访问控制、网络、对象存储、日志、监控和基础设施即代码;
5、具备生产系统上线和运维经验,能够说明容量评估、灰度、回退、告警、故障定位和复盘方法;
6、具备清晰的文档和跨团队沟通能力,能够把架构方案转化为任务、接口、验收指标和运行规范。
【可深耕方向】
候选人不需要同时精通所有方向,但应在至少一个方向具备可验证的生产深度
方向一:基础设施与平台工程
1、熟悉多环境管理、统一身份与访问控制、虚拟网络、网络互联、密钥管理、审计和安全基线;
2、熟悉 Terraform/OpenTofu、GitOps、CI/CD、容器和制品管理;
3、有数据平台或 AI 平台基础设施标准化、SRE、FinOps 建设经验。
方向二:湖仓与离线计算
1、熟悉 Spark、Iceberg/Hudi/Paimon、对象存储和分布式 SQL;
2、理解 Catalog、事务、快照、分区、文件布局、Compaction 和性能调优;
3、有 Spark、分布式 SQL、数据仓库或数据研发调度平台的生产经验。
方向三:实时计算与数据平台
1、熟悉 Kafka、Flink、CDC、Schema 演进和流式状态;
2、理解 Exactly-once 的适用边界、Checkpoint/Savepoint、乱序、回放和数据对账;
3、有大规模实时任务稳定性、容量或平台化建设经验。
【加分项】
1、有大规模数据湖、流计算、分析型数据库或 AI 训练平台实战经验;
2、有同时面向国内与海外部署环境的经验;
3、有 PB 级数据、日增 TB 级链路、数百个作业或百人级数据研发平台经验;
4、有 AI/多模态训练数据、海量小文件、数据集缓存或高吞吐存储优化经验;
5、参与过数据平台从 0 到 1、异构基础设施迁移、机房迁移或平台容器化;
6、熟悉数据分类分级、个人信息保护、重要数据、等保、审计或数据出境相关要求;
7、有开源项目贡献、技术分享、专利或高质量技术文档。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。