招聘公告 · 职位检索 · 央国企/事业单位/名企

数仓工程师(J59451)

单位:可庭科技类型:社招地点:江苏省更新:2026-09-24

岗位信息

招聘单位可庭科技
工作地点江苏省
官方更新时间2026-04-09T14:56:38

职位描述

1. 数据湖架构设计与建设

负责企业级数据湖的规划与建设,构建覆盖车端、研发端、生产端、营销端的一站式数据汇聚平台,实现结构化、半结构化(如车辆日志)和非结构化数据的统一存储与管理。

设计数据湖分层架构(如Bronze银/原始层、Silver银/清洗层、Gold金/应用层),制定数据入湖规范,确保数据的可追溯性和不可变性。

基于 湖仓一体(Lakehouse) 理念,构建高性能数据底座,平衡数据湖的灵活性与数据仓库的ACID(原子性、一致性、隔离性、持久性)事务需求。

2. 车联网数据处理

重点负责车联网(IoV)数据的接入与处理:设计和开发实时/准实时数据管道,处理来自车载传感器(T-Box,即车载远程通信终端)的海量时序数据(如车速、电机转速、电池电压温度、GPS轨迹)。

针对新能源三电系统(电池、电机、电控)数据特点,建立高效的数据压缩、清洗和聚合策略,降低存储成本并提升查询分析性能。

处理智能座舱相关的用户行为日志数据(如APP使用、语音交互),为座舱体验优化提供数据支持。

3. 数据仓库建模与ETL开发

承担数据仓库模型设计工作,在数据湖的Gold层建设主题式数据模型(如车辆主题、用户主题、零部件主题、充电行为主题),支撑BI(商业智能)报表和业务分析。

开发并维护高效、稳定的数据ETL(抽取、转换、加载) pipeline,负责数据从采集、清洗、转换到分发的全流程编码与调度。

负责数据质量和数据治理在工程侧的落地,设计数据质量监控规则,确保数据湖中数据的准确性、完整性和一致性。

4. 数据服务与性能优化

为内部数据消费者(算法工程师、数据分析师、业务运营)提供高效的数据服务接口或视图,简化数据获取流程。

持续优化数据计算和存储性能,解决数据倾斜、任务长尾等问题,控制数据湖运维成本(特别是云上存储与计算成本)。

任职要求

1. 基本条件

全日制本科及以上学历,计算机科学、软件工程、数学、大数据或相关专业。

5 年以上数据仓库或大数据开发经验,其中至少 2 年新能源主机厂或大型车联网平台工作经验。

2. 专业技能

数据湖架构: 深入理解数据湖理念,有基于 Delta Lake / Apache Hudi / Apache Iceberg 等湖格式构建数据湖的实际项目经验,熟悉其ACID、时间旅行、upsert(更新插入)等特性。

大数据技术栈: 精通 Spark(Structured Streaming 和 Spark SQL)进行大规模数据处理;熟练掌握 Flink 进行实时数据处理;熟悉 Hadoop 生态(HDFS、Hive)或云原生对象存储(S3/OSS)。

计算与调度: 熟练掌握 Spark 的内核调优;熟悉至少一种调度平台,如 Airflow、DolphinScheduler。

编程语言: 精通 SQL,具备扎实的 Scala 或 Python 开发能力,能够编写复杂、高效的数据处理逻辑。

数据建模: 掌握数据仓库建模理论(如维度建模),能够根据业务场景设计星型/雪花模型。

3. 行业理解

车联网数据经验: 熟悉车联网数据的采集协议(如MQTT)和常见数据类型,有处理高频时序数据的实战经验,了解新能源三电系统的基本数据含义。

业务理解: 对新能源主机厂的业务场景有认知,理解诸如车辆故障诊断、电池健康度评估(SOH,即健康状态)、用户画像、智慧生产等场景对数据的具体要求。

4. 综合素质

架构思维: 具备良好的技术视野,能根据业务发展预判数据规模的增长,并进行合理的分层和技术选型。

数据敏感度: 对数据质量有执念,能从数据波动中发现问题,并追查至底层链路。

沟通协作: 能够与算法、后端、嵌入式及业务部门有效沟通,理解数据产生的业务背景,并将其转化为工程实现。

【加分项】

云平台经验: 熟悉主流云厂商的大数据服务(如 AWS EMR/Redshift, 阿里云 E-MapReduce/MaxCompute, 腾讯云 EMR),有云成本优化经验。

实时计算: 有基于 Flink SQL + Kafka 构建实时数据湖的实战经验。

DevOps 能力: 了解 Docker/Kubernetes,能够将数据处理任务容器化部署。

数据治理: 参与过数据治理项目,有元数据管理(如Atlas)和数据血缘分析经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。