Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning
该论文提出了“Scaffolding Minds”,这是一种通过引入专门的脚手架编码器以在监督微调中获得更好的潜在目标表示,并同时学习均值与方差以使强化学习采样器能够进行有效探索,从而通过优化多模态推理,显著超越现有基线在各种视觉推理任务上的表现的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,人工智能在像人类那样观察世界方面一直面临挑战。当计算机观察一张图片时,它通常可以识别物体,但往往无法理解物体之间的关系,也无法通过复杂的视觉谜题进行推理。多年来,研究人员一直试图通过教机器“大声思考”来解决这个问题,即强迫它们在给出答案之前,先用文字写出逐步的解释。虽然这有所帮助,但它往往迫使机器将丰富、详细的视觉信息转化为笨拙的文字,从而在过程中丢失了重要的细微差别。一种更新的方法试图通过让机器保留其想法于一种隐藏的、内部语言中来解决这个问题——这是一种只存在于计算机大脑内部的连续数据流。这种被称为“潜空间推理”(latent reasoning)的方法,允许模型保留视觉细节,而不必将其描述为句子。然而,即使是这种先进的技术也遇到了瓶ط:机器生成的内部想法通常基于通用的、预制的工具,而这些工具并非为特定的问题而设计,导致机器难以探索不同的思考方式以找到最佳解决方案。
来自 Google DeepMind 和加州大学圣地亚哥分校的研究团队开发了一种名为“思维脚手架”(Scaffolding Minds)的新框架,旨在克服这些障碍。他们的工作专注于两个此类内部推理系统通常失败的特定阶段。首先,在初始学习阶段,机器通常被教导去模仿一个标准的、现成的视觉编码器(vision encoder)的输出——这是一种经过数百万张通用图像(如猫、汽车和风景)训练的工具,用于识别物体。问题在于,这个通用的工具并未针对机器试图解决的特定推理任务进行优化。它可能会保留无关的视觉细节,却忽略了解决谜题所需的关键证据。其次,当机器试图通过试错来改进自身时,现有方法通常会迫使它僵化地遵循单一的思考路径,或者仅允许它调整书面答案,而保持内部视觉推理不变。这阻碍了机器发现更好解决问题的新方法。
为了解决这个问题,研究人员引入了一个由两部分组成的系统,它就像是机器内部思想的一个定制构建的引导者。在第一阶段,他们没有依赖通用工具,而是训练了一个专门的“脚手架编码器”(scaffolding encoder)。可以将它想象成一位专门的导师,它学习的是什么样的内部笔记对特定任务最有帮助,而不是仅仅复制一本通用的字典。这位导师接收一张辅助图像(仅在训练期间提供的视觉辅助工具),并将其转换为一组优化的内部标记(tokens),这些标记经过完美调优,能够应对推理挑战。一旦机器学会了如何自主生成这些优化的笔记,导师就会被丢弃,机器便可以独立工作。
在第二阶段,研究人员用一个灵活的、基于学习的采样器(sampler)取代了通常支配机器内部思想的僵化规则。这种新方法不再强迫机器停留在单一的、预定的轨道上,而是允许机器在练习过程中对内部思想进行不同变体的采样。它学习调整思考的“均值”和“方差”,从而有效地探索更广泛的可能性,以观察哪条内部路径能导向正确答案。这种探索是由奖励引导的,鼓励机器寻找最有效的推理轨迹,而不是仅仅满足于它找到的第一条路径。
该方法的测试结果是在一系列具有挑战性的视觉推理任务上进行的,其中包括一个名为“冰湖”(FrozenLake)的空间规划游戏,其中角色必须在布满冰块和洞穴的网格中导航以到达目标。在标准的 8x8 网格上,与最强的先前尝试相比,新方法的准确率提高了 9.5%。随着谜题变得更加困难(网格扩展到 32x32),这种优势显著增长,新系统的表现优于之前的最佳方法 19%。研究人员还在另外九个需要精细观察和比较的视觉推理基准测试中测试了该系统。在所有这些测试中,该方法始终提高了性能,平均准确率提升了 5.2%。
该研究明确排除了“在推理过程中生成新图像对于成功是必要条件”的观点。其他试图通过绘制中间图像来辅助机器思考的方法,往往面临着高昂的计算成本和较慢的速度。Scaffolding Minds 方法在没有生成任何额外图像的情况下实现了卓越的结果,证明了优化视觉数据的内部、隐藏表示比创建可见的中间步骤更为有效。研究人员发现,这两个改进措施——为内部笔记定制训练的导师以及对这些笔记进行灵活探索——在结合使用时效果最好。如果没有定制的导师,灵活的探索就无法发挥其全部潜力;而如果没有探索,定制的导师也无法将其路径精炼至最佳解决方案。
这项工作表明,机器旨在达到的内部目标的质量,与其实现目标的方法同样重要。通过教机器生成经过优化的内部笔记,并允许它探索这些笔记的不同变体,研究人员创造了一个能够以更高精度和可靠性推理复杂视觉问题的系统。研究结果表明,未来的视觉推理进展可能不再仅仅取决于让机器“看”得更多或“说”得更好,而更多在于教它们如何构建其隐藏的、内部的思想,使其与手头的任务完美契合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。