MMAU基准测试

R1-AQA是基于Qwen2-Audio-7B-Instruct的音频问答模型，通过群组相对策略优化（GRPO）算法进行强化学习优化。在MMAU Test-mini基准测试中仅用38k样本即达到64.50%的平均准确率，显著优于传统监督式微调方法。该项目创新性地将GRPO应用于音频领域，展示了小样本场景下的高效性能，但研究也指出大型音频语言模型在听觉-语言推理方面仍落后于人类水平。

GRPO算法MMAU基准测试小样本学习强化学习优化

AI-magic收录了大量国内外AI工具箱，包括AI写作、图像、视频、音频、编程等各类AI工具，以及常用的AI学习、技术、和模型等信息，让你轻松加入人工智能浪潮。