大模型算法专家(强化学习方向)
岗位信息
| 招聘单位 | 金山云 |
|---|---|
| 工作地点 | 北京市、武汉市 |
| 官方更新时间 | 2025-08-04T15:23:26 |
职位描述
岗位职责:
- 研发大模型与强化学习(RLHF/RLAIF等)理论算法和应用,提升模型推理、对齐与泛化能力
- 探索RL与LLM结合的应用场景(如:Reason、行业强化学习、智能体),推动 RL应用落地
- 跟踪学术前沿(如:PPO/DPO/GRPO、多模态对齐),帮助大模型后训练取得效果突破
任职要求
职位要求:
- 熟悉Transformer、LLaMA、MoE 系列大模型结构,具备RLHF全流程实战经验
- 熟悉强化学习算法(DQN、PPO、GRPO )和项目经验(大模型/个性化推荐/游戏AI等)
- 熟练掌握PyTorch/TensorFlow,具备分布式训练(Megatron/DeepSpeed)调优能力
- 在AI领域顶级会议上发表过关于搜索推荐算法、强化学习、大模型、多模态的论文者优先
- 硕士及以上学历,计算机/数学相关专业,3年以上RL或大模型研发经验
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。