招聘公告 · 职位检索 · 央国企/事业单位/名企

【大模型北斗实习】Operator 智能体方向算法研究

单位:美团类别:算法,硬件,软件类型:实习地点:北京市、上海市更新:2026-09-24

岗位信息

招聘单位美团
工作地点北京市、上海市
官方更新时间1747963942000

职位描述

随着大模型与生成式 AI 技术的快速发展,在多模态和复杂场景下让 Agent 具备更强大的决策和执行能力成为未来的重要趋势。OpenAI Operator 通过结合强化学习的多步决策机制与大模型的理解、推理优势,可在多种任务场景(如 Computer Use、网页浏览等)中实现高效且灵活的自动化决策和任务执行。本课题将聚焦多样化业务场景和复杂环境下的自适应策略设计、规划与推理,进一步提升 Agent 在真实应用中的表现。

主要研究内容包括但不限于:

1) 多模态与多步决策:设计并构建包含多模态信息、计算机交互、网络搜索、函数调用等多维度的复杂环境,研究如何利用端到端强化学习来进行多步决策,从而完成更具挑战的任务。

2) 策略学习与优化:在多种强化学习算法(如 PPO、GRPO 等)的框架下,探索高效的策略优化方法,为 Operator Agent 提供强大的决策和执行能力。

3) 规划与推理:借助大模型的知识与推理能力,设计可解释的多步规划算法;研究如何与外部工具或知识库交互,以扩展 Agent 的能力边界并提升其在真实环境中的自动化决策表现。

任职要求

1)熟悉强化学习领域常用算法及理论基础(如 DQN、Policy Gradient、PPO、GRPO 等。

2)熟练掌握至少一门编程语言(如 Python、Java),熟悉 Linux 环境。

3)具备深度学习框架(如 PyTorch、TensorFlow)实际项目经验;了解大模型或分布式训练框架(Megatron、DeepSpeed 等)者优先。

4)对大模型在 Agent 规划、推理中的作用有浓厚兴趣,对 LLM + RL 的前沿研究有基本认识。

5)具备良好的问题分析和解决能力,对新技术保持学习和探索的热情。

加分项:

1)在 NeurIPS、ICLR、ICML、ACL、EMNLP 等相关领域高水平期刊/会议发表论文或在有影响力的开源项目中做出核心贡献。

2)在多 Agent、层级强化学习或多模态融合等领域有深入研究或项目经验者优先。

3)具备 General Agent 使用经验(如 OpenAI Operator、Manus AI 等)者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。