Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
本文介绍了 OmniClean,这是一个视觉去偏基准,它揭示了全模态模型中虚高的性能提升,并证明了一种三阶段后训练方案(OmniBoost)能使一个小型的 30 亿参数模型通过有效整合音频 - 视觉 - 语言证据而不依赖视觉捷径,从而超越一个规模大得多的 300 亿参数模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在参加一场考试,以证明你是一位能够同时运用视觉、听觉和逻辑来解决谜团的“超级侦探”。
如今的大多数 AI 模型就像那些非常擅长“察言观色”却极其不擅长“倾听”的学生。如果你给他们看一张狗在吠叫的图片,并问:“这是什么声音?”,他们可能会仅仅因为看到狗张着嘴就猜出“吠叫”,而实际上并不需要听到音频。他们通过利用视觉捷径在“作弊”。
这篇由 StepFun-Audio 团队撰写的论文,旨在解决两个重大问题:如何测试这些模型以及如何教会它们真正去倾听。
1. 问题所在:“视觉作弊码”
研究人员发现,许多 AI 基准测试(考试)存在偏差。这些测试包含了一些仅凭观看图片或视频就能显而易见地得出答案的问题。
- 比喻:想象一场数学考试,答案被用大字写在试卷的背面。如果一个学生得了满分,他是真的做了数学题,还是仅仅读了背面?
- 解决方案(OmniClean):团队创建了一个更严格的新测试,名为OmniClean。他们审查了数千个问题,并问道:“模型能否在不听到音频的情况下回答这个问题?”如果答案是“是”,他们就会剔除该问题。
- 结果:他们从近 17,000 个问题开始,最终只保留了约 8,500 个。这些剩余的问题是“困难模式”的题目,你必须真正听取音频才能得出正确答案。
2. 解决方案:“三步烹饪食谱”(OmniBoost)
团队希望看看是否可以通过一种名为OmniBoost的特定训练食谱,教会一个小型 AI 模型(称为 Qwen2.5-Omni-3B)成为真正的超级侦探。他们尝试了三种不同的烹饪方法:
第一阶段:“沙拉吧”(混合双模态监督微调)
- 他们做了什么:他们向模型分别投喂了文本、图像和音频的均衡饮食。这就像给学生提供教科书、图画书和收音机,但从不将它们混合在一起。
- 结果:模型变得稍微好了一些,但表现不稳定。这就像一个学生知道如何阅读,也知道如何倾听,却不知道如何同时做到这两点。
第二阶段:“教官”(混合模态可验证奖励强化学习)
- 他们做了什么:他们开始使用一种名为RLVR(可验证奖励强化学习)的技术。这就像一位严格的教练,只有当模型同时利用图片和声音来解谜时,才会给予“竖起大拇指”的肯定。如果它通过只看图片来作弊,就得不到任何分数。
- 结果:这是最大的突破。模型终于学会了整合感官。它开始正确解决“困难模式”的问题。
第三阶段:“学习小组”(自蒸馏)
- 他们做了什么:模型根据在第二阶段学到的内容生成自己的练习题和答案,然后再次进行练习。这就像学生制作自己的抽认卡并自我测验,以巩固知识。
- 结果:这帮助模型变得更加稳定,特别是在面对非常庞大和复杂的测试时。
3. 大惊喜:小也能强大
通常,你需要一个巨大且极其昂贵的计算机大脑(巨型模型)来解决这些难题。
- 主张:研究人员采用了一个相对小型的模型(30 亿参数),并应用了他们的“三步食谱”。
- 结果:经过所有训练后,这个小型模型在严格的"OmniClean"测试中,表现与更大、更著名的模型(如 300 亿参数的 Qwen3-Omni)相当,有时甚至更好。
- 关键点:他们是在没有从更大、更聪明的老师那里抄袭答案的情况下做到这一点的。他们从零开始构建了自己的训练数据。
总结
该论文认为:
- 停止作弊:许多 AI 测试太容易了,因为它们允许模型根据图片进行猜测。我们需要像 OmniClean 这样的测试,迫使它们真正去倾听。
- 用正确的方法教学:仅仅向模型提供更多数据是不够的。你需要一个特定的训练过程(OmniBoost),迫使模型将视觉和听觉结合起来。
- 规模并非一切:如果训练侧重于真正的理解而非捷径,一个训练有素的小型模型可以击败一个训练不当的巨型模型。
简而言之:不要只让 AI 看图片;也要让它倾听故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。