← 最新论文
🤖 AI

Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

本文介绍了 CAPS,一种跨模态智能体策略自蒸馏框架,该框架通过利用模型更强的文本策略来监督其视觉历史对应的策略,从而弥合了基于文本的历史与经过视觉压缩的历史之间的性能差距,在显著提高决策准确性的同时,大幅降低了记忆上下文成本。

原作者: Cheng Fan, Junyi Zhou, Tingzhang Luo, RongJian Xu, Qiyanhui Lu, Mingjian Zhu, Hanting Chen, Jianyuan Guo

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng Fan, Junyi Zhou, Tingzhang Luo, RongJian Xu, Qiyanhui Lu, Mingjian Zhu, Hanting Chen, Jianyuan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个超级聪明的机器人侦探正在试图破解一个谜团。为了完成工作,它必须与一台电脑交谈,提出问题,阅读答案,然后决定下一步该做什么。但问题在于:每当机器人采取行动时,它都必须记住之前发生的一切。如果这个谜团很长,机器人的“记忆”就会变得非常庞大,就像一个不断被塞进更多重石头的背包。最终,背包会变得非常沉重,导致机器人移动变慢,运行成本增加,甚至可能被自己的思绪绊倒。

科学家们曾尝试通过将所有这些沉重的文本记忆压缩成一张单一的、密集的信息图来解决这个问题。这就像是将一部百页的小说变成一页信息量巨大的连环画。其核心理念是,机器人可以通过看这张图来记住故事,而不需要背负沉重的文本。但这里有一个问题:机器人通常是被训练来阅读文字,而不是通过图片来“思考”的。当它们从阅读书籍切换到观察连环画时,往往会感到困惑。它们可能能够完美地读出图片中的文字,却会忘记如何利用这些文字来解决谜题。它们变得擅长阅读,但在推理方面却表现糟糕。

这正是来自香港城市大学和华为技术团队试图解决的难题。他们发现,仅仅将文本转化为图像是不够的;机器人需要学习如何用图片来“思考”,而不仅仅是阅读它们。他们发现,阅读文本的机器人与阅读图像的机器人之间的差距,并不是因为机器人看不清文字(它们完全能看清),而是因为机器人失去了它的“行动计划”。即使所有的信息就在眼前,机器人也会开始做出错误的决策、问错问题或者过早放弃。

为了解决这个问题,该团队发明了一种巧妙的训练方法,称为 CAPS(跨模态智能体策略自我蒸馏)。你可以把它想象成一位大师级厨师(阅读文本的机器人)在教徒弟(阅读图像的机器人)如何烹饪。大师级厨师不仅向徒弟展示食材,还会观察徒弟的烹饪过程并说:“嘿,当你看到这张食材图片时,你应该这样切洋葱,而不是那样。”徒弟学习模仿大师的决策过程,尽管大师看的是食谱,而徒弟看的是食材的照片。

研究人员在两种截然不同的游戏类型上对该方法进行了测试:一种是机器人必须在网上寻找答案的搜索引擎问答,另一种是在虚拟房屋中移动物体的游戏。他们发现,这种新方法 CAPS 让阅读图像的机器人变得聪明得多。它不仅提高了阅读图片的能力,还提高了利用图片进行推理的能力。机器人开始做出正确的选择、提出正确的问题并在正确的时间停止,就像那个阅读文本的机器人一样。

结果令人印象深刻。在搜索问答测试中,与之前的方法相比,新方法将机器人的成功率提高了约 5%。在虚拟房屋游戏中,提升甚至更大,跳升了 15% 以上。但最棒的部分是?机器人仍然背着那个超轻的“连环画”背包。它解决问题的速度更快,使用的计算机内存也少得多——在某些情况下,内存成本降低了高达 83%。

该团队证明了你不需要在沉重缓慢的记忆与快速轻便的记忆之间做选择。通过教会机器人像专业人士一样思考,即使在观察图片时也是如此,你可以获得两者的精华:一个既极其聪明又极其高效的机器人。他们证明了问题不在于机器人无法“阅读”压缩后的历史,而在于它需要学习如何利用它进行“推理”。有了 CAPS,他们终于教会了它如何做到这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →