具身智能MLOps平台工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-09-09 11:37:52 |
职位描述
职位概述
负责智元具身智能MLOps平台研发,建设训练任务、实验管理、流水线及模型注册能力,支持数据挂载、Checkpoint管理与故障恢复,为算法团队提供可追踪、可复现的模型研发环境。
主要职责
1. 建设训练任务管理能力,支持环境配置、提交、状态查询、日志查看、重试与终止,对接计算团队提供的资源队列和调度服务。
2. 接入PyTorch及分布式训练框架,提供单机多卡、多机多卡训练模板和启动机制,沉淀环境验证与常见故障诊断能力。
3. 建设MLflow类实验管理能力,记录代码版本、运行环境、参数、指标和训练产物,支持实验查询、对比与结果追溯。
4. 对接数据与存储服务,管理数据版本关联和挂载配置,与算法团队约定Checkpoint接口,完善保留策略与任务恢复流程。
5. 建设训练Pipeline和模型注册能力,接入算法团队的训练与评估程序,编排数据准备、训练、评估和产物登记流程。
6. 协同算法与基础设施团队定位任务启动、通信、数据读取及恢复异常,完善平台API、自动化测试、使用文档和训练基准。
承担主要目标/关键任务
1. 建设训练任务管理能力,支持环境配置、提交、状态查询、日志查看、重试与终止,对接计算团队提供的资源队列和调度服务。
2. 接入PyTorch及分布式训练框架,提供单机多卡、多机多卡训练模板和启动机制,沉淀环境验证与常见故障诊断能力。
3. 建设MLflow类实验管理能力,记录代码版本、运行环境、参数、指标和训练产物,支持实验查询、对比与结果追溯。
4. 对接数据与存储服务,管理数据版本关联和挂载配置,与算法团队约定Checkpoint接口,完善保留策略与任务恢复流程。
5. 建设训练Pipeline和模型注册能力,接入算法团队的训练与评估程序,编排数据准备、训练、评估和产物登记流程。
6. 协同算法与基础设施团队定位任务启动、通信、数据读取及恢复异常,完善平台API、自动化测试、使用文档和训练基准。
任职要求
任职要求
1. 教育背景:本科及以上学历,计算机、人工智能、软件工程、自动化、机器人等相关专业优先。
2. 工作经验:3年以上机器学习平台、训练基础设施或后端研发经验,参与过训练平台或分布式训练工程交付;具有5年以上相关经验及核心模块设计经验者优先。
3. 熟练掌握Python,具备服务端开发、API设计及数据存储基础,能够独立完成平台模块开发、测试和问题定位。
4. 熟悉Linux、容器和Kubernetes作业机制,理解训练任务与资源队列的关系,能够对接底层调度和存储服务。
5. 熟悉PyTorch训练流程,了解分布式训练启动、数据加载、模型保存和恢复,能够分析常见训练环境与运行问题。
6. 在任务编排、实验追踪、Checkpoint或模型版本管理中至少一个领域有实践,能将算法研发流程转化为平台功能。
加分项
1. 有MLflow、Kubeflow或同类平台二次开发经验,熟悉训练流水线和模型产物管理。
2. 有具身智能、多模态或强化学习训练工程实践,或具备主流分布式训练框架接入与排障经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。