招聘公告 · 职位检索 · 央国企/事业单位/名企

具身智能后训练系统工程师(J11052)

单位:摩尔线程类型:社招地点:杭州市更新:2026-09-24

岗位信息

招聘单位摩尔线程
工作地点杭州市
官方更新时间2026-09-16T15:31:44

职位描述

岗位介绍

面向具身智能模型的后训练场景,负责策略推理、环境采样与模型训练之间的系统集成、性能优化和稳定性建设,推动相关任务在摩尔线程 GPU 平台上高效运行。

本岗位优先考察推理引擎、分布式训练及系统性能优化能力。具身智能或强化学习经验为加分项,团队提供相关算法与任务支持。

工作职责

1. 深入开源后训练框架,梳理进程、设备、数据和模型权重的执行与流转链路,完成任务适配和系统集成。

2. 建立端到端性能基线,分析策略推理、环境采样、模型训练、数据传输及权重同步等阶段的耗时与资源利用。

3. 优化批处理、资源分配、并行执行、同步机制及显存使用,减少组件等待,提高整体训练效率。

4. 对接模型推理后端,解决模型执行、权重加载与更新、吞吐及显存相关问题。

5. 通过源码分析、profiling、对照实验和最小复现定位瓶颈,协同算子、通信、驱动及 AI 框架团队完成联调与优化。

6. 与算法和仿真人员合作,验证系统改动对训练正确性、任务效果及稳定性的影响。

7. 沉淀可复用的系统组件、适配代码、性能测试和自动回归能力,支持重点客户交付。

任职要求

任职要求

1. 具备扎实的编程和工程能力,熟练使用 Python,能够独立阅读、修改和调试复杂开源项目。

2. 在推理引擎、分布式训练或机器学习系统中,至少一个方向有深入开发经验,参与过核心模块修改、性能优化或复杂故障定位。

3. 理解多进程、异步执行、资源调度、数据传输及同步机制,能够分析跨组件的执行行为和性能问题。

4. 熟悉 GPU 计算基本原理,理解计算、访存、通信和主机调度对性能的影响,能够使用性能分析工具定位瓶颈。

5. 熟悉 PyTorch 或同类深度学习框架,具备模型训练或推理的实际工程经验。

6. 能通过基准测试和对照实验验证优化收益,重视正确性、稳定性和可复现性。

7. 具备独立推进问题闭环及跨团队协作能力,能够有效使用 AI 工具辅助研发,并验证生成代码与分析结论。

加分项

- 有推理引擎的模型接入、批处理、显存管理或权重更新开发经验。

- 有分布式训练、任务调度、计算通信重叠或异构资源管理经验。

- 有强化学习采样系统、机器人仿真或多模态模型相关经验。

- 有国产 GPU 适配、编译器、运行时或 GPU 算子开发经验。

- 有开源项目贡献,或能够展示有实测收益的系统优化案例。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。