DeepSeek-R1 的 Group Relative Policy Optimization方法, 让模型仅通过”试错-奖励”机制就能使自主进化,涌现出类似人类的反思、多步验证等推理能力。该团队尝试将 DeepSeek-R1 的 GRPO 算法迁移到 Qwen2-Audio-7B 模型上。在仅使用 AVQA 的 3.8 万条训练样本的情况下,强化学习微调后的模型在 MMAU 评测集上实现了 64.5% 的准确率,这一成绩比目前榜单上第一名的商业闭源模型 GPT-4o 有近 10 个百分点的优势。
