Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents
该论文介绍了 SPARE,这是一个由 KL 指导的框架,它能够有效地剪枝多模态大语言模型智能体中冗余的推理文本,同时保留关键的视觉证据,从而提高任务准确性并缓解长程多模态工具使用场景中的“文本债务”问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种特定的计算机程序脱颖而出,它扮演着能够观察并思考的数字助手的角色。这些被称为多模态大语言模型的系统,旨在观察图像、理解关于图像的问题,并使用外部工具来寻找答案。为了解决复杂问题,它们不仅仅是进行猜测;而是将任务分解为一系列步骤,在执行过程中写下自己的想法和计划。这种写下推理过程的过程有助于它们保持条理并协调不同的动作,就像人类在解谜时可能会记下笔记一样。然而,随着这些数字助手处理冗长且困难的任务,它们生成的文本开始堆积。这些自写笔记的累积最终变得如此庞大,以至于挤占了原始图像以及工具提供的新的视觉线索的空间,导致系统过度依赖于自己过去的文字,而非面前的新鲜证据。
香港科技大学的研究人员将这一现象识别为“文本债”(textual debt),即一种对话历史淹没了智能体本应分析的视觉现实的状态。当一个智能体陷入早期错误的想法时,大量强化该想法的文本会使其对新信息视而不见,从而导致错误。为了解决这个问题,该团队开发了一种名为 SPARE 的方法,它充当了智能体记忆的选择性编辑者。SPARE 并不是简单地删除旧文本或压缩图像,而是仔细审查智能体过去的推理过程,以决定哪些仍然有用,哪些已经变得冗余。它的工作原理是询问一个简单的问题:如果智能体用几句话来总结当前的情况,它是否仍需要阅读之前写的特定段落推理才能理解下一步行动?
这个过程涉及一个巧妙的诊断检查,其中系统比较了两个版本的自身思考。在一个版本中,智能体阅读其完整的思想和行动历史。在另一个版本中,它阅读相同的历史,但加入了一个关于当前任务状态的紧凑摘要。随后,系统测量该摘要的存在对智能体预测下一个词的影响程度。如果摘要使智能体的思维发生显著变化,这意味着旧段落包含了摘要所遗漏的独特且关键的细节,因此保留该段落。如果摘要几乎没有引起任何变化,则意味着旧段落只是重复了已经被摘要捕获的信息,因此可以安全地移除。这使得系统能够修剪掉那些干扰上下文的“陈旧”文本,同时保留对任务至关重要的特定视觉细节,例如坐标或在图像中发现的文本。
为了使这种修剪更加有效,研究人员还训练系统编写更好、更全面的摘要。通过教导智能体更高效地压缩其任务状态,他们使修剪工具能够在不丢失重要信息的情况下,移除更多的冗余文本。在涉及图像编辑、工具使用和视觉搜索的几项具有挑战性的基准测试中,这种方法被证明是非常成功的。该系统成功移除了 37.89% 到 64.58% 的推理标记(即智能体写给自己的文字),同时实际上提高了其在任务中的准确性。在许多情况下,经过修剪的智能体表现得比保留完整历史记录的智能体更好,这表明减少文本噪声有助于它们更敏锐地关注视觉证据。
这些发现挑战了一个普遍假设,即智能体需要记住每一个推理步骤才能取得成功。相反,这项研究表明,对于长期且复杂的任务,忘记对话中无关部分的能力与推理能力同样重要。通过清除“文本债”,系统恢复了其关注图像和工具提供的最新数据的能力,而不是陷入自身过去假设的循环中。这项工作表明,对于人工智能要成为视觉任务中真正有效的长期合作伙伴,它不仅必须学会如何思考,还必须学会如何放下那些不再服务于目标的想法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。