AI模型数据架构师(生命科学 / 工业大数据)
岗位信息
| 招聘单位 | 镁伽科技 |
|---|---|
| 工作地点 | 苏州市、上海市、北京市 |
| 官方更新时间 | 2026-05-13T18:18:31 |
职位描述
1. 数据架构搭建:设计大模型全链路数据架构,包含数据采集、清洗、脱敏、标注、分层存储、版本管理,搭建适配生命科学与智能制造的镁伽行业数据中台。
2. 行业语料库建设:统筹科研文献、实验记录、试剂数据、工艺参数、设备日志、运维工单、工业图像等多源异构数据,构建高质量、结构化、可迭代的专属行业语料库,支撑镁伽大模型训练与微调。
3. 数据治理优化:制定数据质量规范、标注标准、脱敏安全规范,解决脏数据、异构数据、低质量科研 / 工业数据问题,提升模型训练与微调的数据纯度。
4. 多模态数据体系:搭建文本、显微图像、工业视觉、传感器时序数据、设备控制指令等多模态数据关联架构,支撑多模态大模型研发。
5. 数据工具与平台优化:选型优化向量数据库、标注平台、数据存储引擎,对接 GPU 训练集群,打通数据 - 训练 - 评测 - 上线的数据流转链路;保障企业数据安全、权限管控、合规使用。
任职要求
1. 硕士及以上学历,计算机、数据科学、大数据、生物信息、自动化等相关专业,3 年以上大模型数据架构、大数据治理经验。
2. 精通大模型数据全流程技术,熟悉语料清洗、去重、过滤、脱敏、采样、质量评估,有千亿级模型训练数据搭建经验优先。
3. 熟练使用 Milvus、FAISS、Chroma 等向量数据库,精通 Hadoop、Spark、数据湖、数据仓库架构,熟练掌握 SQL、Python 数据处理。
4. 了解工业设备数据、生物实验数据特性,能够针对非标行业数据设计结构化、标准化治理方案。
5. 具备数据安全、数据合规设计经验,有 AI 训练数据平台、行业知识库搭建经验,熟悉镁伽业务数据来源者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。