Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings
本文提出了 Reason What Matters (ReWAM),这是一个基于检索增强的推理框架,它通过利用检索反馈来优化词元级信用分配并实现推理轨迹的提前停止,从而增强通用多模态嵌入,进而以显著提高的推理效率实现了最先进的检索性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在图像、视频和文本并存的广阔数字景观中,计算机面临着一个持续的挑战:理解这些不同形式的信息是如何相互关联的。多年来,研究人员一直致力于构建能够将图片转化为描述,或根据书面查询查找匹配照片的系统。这些系统通过创建一个共享地图来实现目标——一个通用的语言,让一张猫的照片和“猫”这个词落在同一个区域。这种统一不同类型数据的能力被称为通用多模态嵌入(universal multimodal embedding)。虽然这些系统的早期版本速度很快,但在处理需要深度思考的复杂任务时往往表现不佳,例如识别两个相似场景之间的细微差别或理解一系列事件。为了解决这个问题,科学家们开始教这些系统在做出决策前进行“大声思考”,即生成一步步的推理链来引导最终答案。然而,这种新方法引入了沉重的代价:思考的过程耗时过长,导致整个系统变慢,使其无法在海量数据库中进行高效搜索。
一组研究人员开发了一种名为“关注重点”(Reason What Matters,简称 ReWAM)的新框架,该框架教会这些系统如何在不牺牲准确性的情况下进行高效思考。他们解决的核心问题是,以往的方法会强迫计算机为每一次搜索都写出完整且冗长的解释,即使仅仅几句话就足以找到正确答案。这就像是要求图书管理员在把书交给读者之前,无论读者是否只需要书名,都要为每一本书写一份完整的传记。此外,旧方法将解释中的每个词都视为同等重要,未能区分哪些事实真正有助于找到目标,哪些是没有任何价值的填充词。ReWAM 通过引入两项关键创新解决了这一问题,使系统变得既更聪明又更快。
第一项创新是一种称为“检索感知自蒸馏”(Retrieval-aware Self-Distillation)的方法。该技术不再将整个推理链视为一个单一的信息块,而是像一位细心的编辑。它会观察输入信息中哪些特定事实有助于将正确答案与看似相似的错误答案区分开来。通过将正确答案与最容易混淆的错误答案进行对比,系统可以精准学习到其推理中的哪些部分得到了证据的支持,而哪些部分没有。随后,它利用这一洞察力,仅向那些真正重要的词汇给予权重,从而教会模型专注于那些确实有助于寻找匹配项的细节。这确保了系统学会生成的推理是基于图像或文本的实际内容,而非靠猜测或重复泛泛而谈的短语。
第二项创新——“检索自适应推理”(Retrieval-adaptive Inference)——解决了速度问题。过去,一旦系统开始思考,它就会一直持续到达到预设的长度,即使它在进行到一半时就已经找到了答案。ReWAM 通过引入一个实时监控推理过程的置信度检查改变了这一点。当系统生成想法时,它会不断自问:“我现在有足够的信息找到目标了吗?”如果答案是肯定的,它会立即停止,从而节省了编写剩余解释所需的时间和精力。如果系统仍不确定,则继续进行。为了让这个过程更快,系统还使用了一种技术,即一次性预测多个未来的单词并进行即时检查,而不是一个接一个地书写。这使得系统能够以更高的速度推进推理过程,而不会迷失方向。
这一方法的成果是显著的。在涉及图像、视频和文档的广泛任务测试中,这一新系统取得了此类技术史上最高的准确率得分。它的表现优于依赖长篇显式推理链的旧方法,也优于那些试图将推理隐藏在计算机内部计算中的新方法。或许最重要的一点是,该系统的速度比其最接近的竞争对手快了多达五倍。这意味着它可以以适用于实际应用的效率,从海量数据集中处理并检索信息,弥合了高质量理解与速度需求之间的鸿沟。研究人员证明,通过教导系统识别真正重要的内容并在获得足够信息后停止思考,实现深度智能与快速性能的并存是可能的,这使得先进的搜索功能在支撑现代数字生活的庞大数据集面前变得切实可行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。