国家智能语音创新中心-大模型算法工程师-合肥(J14403)
岗位信息
| 招聘单位 | 科大讯飞 |
|---|---|
| 工作地点 | 合肥市 |
| 官方更新时间 | 2026-09-11T18:06:46 |
职位描述
1.负责文本、图像、视频和音频的多模态表征学习、特征融合及联合建模。
2.研究跨模态语义对齐算法,解决视觉、语音、文本及终端状态信息之间的表示差异。
3.研究基于交叉注意力、对比学习和共享表征空间的多模态特征融合方法。
4.负责视觉语言模型、音视频语言模型及全模态模型的算法设计、训练和效果优化。
5.研究图像及视频中的视觉指代、目标定位、区域语义理解和细粒度视觉问答算法。
6.研究视频时序建模算法,识别操作前后页面状态变化、界面跳转和动态响应过程。
7.研究音视频联合建模算法,提升模型对提示音、语音反馈、界面变化和设备状态的综合理解能力。
8.建设多模态结果断言模型,将测试意图、操作过程、状态变化和最终结果纳入统一模型进行判断。
9.研究多模态因果推理和状态转移建模,判断终端状态变化是否由指定操作触发。
10.研究复杂场景下的多模态异常识别算法,区分无响应、错误响应、状态异常和识别不确定等情况。
11.基于视觉检测、OCR和UI识别结果,研究界面结构编码、控件关系建模和页面语义图构建算法。
12.研究GUI Agent的状态表示、动作空间建模、策略生成和操作轨迹预测算法。
13.跟踪多模态大模型、GUI Agent、VLA、世界模型、模仿学习和强化学习等前沿方向,并完成算法复现与改进。
任职要求
1.硕士及以上学历,计算机、人工智能、模式识别、计算机视觉或相关专业。
2.具备3年以上多模态、计算机视觉、视频理解或大模型算法研发经验。
3.熟练使用Py thon和PyTorch,能够独立完成模型结构开发、训练、调试和实验分析。
4.熟悉Transformer、注意力机制、视觉编码器、语言模型和跨模态交互模块。
5.熟悉对比学习、跨模态对齐、多模态融合、多任务学习等算法。
6.熟悉视觉语言模型或全模态模型的训练流程,具备真实模型训练经验,不限于接口调用。
7.熟悉监督微调、视觉指令微调、偏好优化或强化学习中的一种以上。
8.熟悉图像分类、目标检测、视觉指代、视频理解或音视频联合建模中的两类以上。
9.具备视频时序建模经验,熟悉时序注意力、状态转移识别或动作识别方法。
10.具备多模态数据集建设经验,能够设计样本组织方式、正负样本和任务标签。
11.具备独立设计损失函数、训练策略和评测指标的能力。
12.能够通过消融实验、错误样本分析和数据分布分析定位模型问题。
13.具备较强的论文阅读和算法复现能力,能够将前沿方法迁移到实际任务。
14.能够独立完成从任务定义、数据构建、模型设计到算法验证的完整研发过程。
【加分项】
1.具备视觉语言模型、音视频大模型或全模态模型训练经验。
2.具备多模态断言、视觉问答、视觉指代或视频时序推理项目经验。
3.具备GUI Agent、Computer Use Agent或智能终端操作模型研发经验。
4.熟悉模仿学习、强化学习、世界模型或智能体策略学习。
5.具备多模态自学习、主动学习或不确定性估计相关经验。
6.在多模态、计算机视觉、大模型或智能体方向发表过论文或拥有开源项目。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。