← 最新论文
💻 computer science

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

本文介绍了 SCOLAR,这是一个新颖的框架,它利用轻量级去 Transformer 生成独立且自洽的视觉令牌,从而克服了限制现有潜在视觉推理方法的“信息增益崩溃”问题,进而实现了显著更长的推理链,并在真实世界基准测试中取得了最先进的性能。

原作者: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在尝试解决一个复杂的谜题,比如一个涉及几何图形的数学问题。你有一张该图形的图片,需要“思考”它来找到答案。

在人工智能(AI)的世界里,有一个流行的概念叫做“思维链”。这就像给 AI 一个记事本,让它在下达答案之前写下思考步骤。对于基于文本的 AI 来说,写下更多的步骤通常能带来更好的答案。这就像是在说:“我思考得越多,我就变得越聪明。”

研究人员试图将这一理念应用于视觉 - 语言模型(能够“看”到图像的 AI)。他们希望 AI 在回答问题之前,先写下“潜在思维”——即关于图像的不可见、内部的笔记。他们假设,如果 AI 写下更长的这些不可见笔记列表,它在解决视觉谜题方面就会变得更聪明。

令人惊讶的问题:“耳语链”效应
研究人员发现了一些奇怪且违反直觉的现象。当这些 AI 模型试图写下关于图像的列表不可见笔记时,它们实际上变得更笨了。

想象一个“传话”(或“耳语小径”)游戏。

  • 旧方法:AI 写下笔记 #1。然后它阅读笔记 #1 来写笔记 #2。接着它阅读笔记 #2 来写笔记 #3。
  • 结果:等到 AI 写到笔记 #50 时,图像的原始细节已经被扭曲和遗忘了。这就像传话游戏中,第一个人耳语“猫是蓝色的”,而到了第 50 个人,他们说的是“猫是蓝莓”。信息崩塌了。链条越长,AI 就越忘记它实际上在看什么。

这篇论文将这种现象称为“信息增益崩塌”。AI 停止学习关于图像的新事物,只是开始一遍又一遍地重复同样困惑、模糊的想法。

解决方案:SCOLAR(“快照”方法)
由 Chenfeng Wang 及其团队领导的研究人员构建了一个名为SCOLAR的新系统来解决这个问题。

SCOLAR 不使用 AI 在长链条中向自己耳语笔记的方式,而是使用一种称为“去 Transformer"(detransformer)的特殊工具。可以将这个工具想象成一位拥有超快相机的摄影师

  1. 旧方法(自回归):AI 查看图像,写下一条笔记,查看该笔记,再写下一条笔记,查看那条笔记……并逐渐丢失图像。
  2. SCOLAR 方法(单次拍摄):AI 查看图像和问题。它暂停。然后,“去 Transformer"瞬间同时一次性捕捉图像的一整套高质量“思维快照”。

简单的工作原理:

  • 独立性:SCOLAR 创建的每一个“思维令牌”(笔记)都直接锚定在原始、清晰的图像上。它们不依赖前一条笔记而存在。笔记 #100 与笔记 #1 一样清晰,并与原始照片保持同样的连接。
  • 无衰减:因为它们都是基于完整上下文在“一次拍摄”中生成的,信息不会消退。AI 可以拥有 1,000 条笔记的链条,而每一条仍然持有视觉谜题的清晰片段。

训练:教导 AI“视觉化思考”
为了实现这一点,团队分三个阶段教导了 AI:

  1. 学习观看:他们教导“去 Transformer"如何将 AI 的内部思维重新转化为清晰的视觉特征(就像翻译学习说图片的语言)。
  2. 学习何时停止:他们教导 AI 识别何时需要拍摄这些额外的视觉笔记。它学会说:“我需要更仔细地看这个三角形”,并触发快照工具。
  3. 强化:他们使用奖励系统(就像电子游戏得分)来鼓励 AI 仅在视觉笔记实际有助于解决问题时才使用它们,并在不需要时忽略它们。

结果
该论文声称 SCOLAR 取得了巨大成功:

  • 可扩展性:而其他方法在大约 10 条笔记后就会失效,SCOLAR 却能处理多 30 倍的笔记(高达 1,000 条),并且链条越长,表现反而越好
  • 性能:在现实世界的推理测试(如理解复杂图表或现实场景)中,它显著超越了其他开源模型。
  • 击败巨头:在一个特定测试(V*Bench)中,SCOLAR(一个 70 亿参数模型)得分83.77%,击败了著名的闭源模型 GPT-4o(得分为 67.50%)。

简而言之
该论文认为,试图通过让信息在长长的耳语链条中传递来让 AI“思考”图像是行不通的,因为信息会丢失。相反,SCOLAR 让 AI 能够一次性获得一堆全新的、高质量的自身思维照片。这使得 AI 能够尽可能深入和长久地思考,而永远不会失去对原始图像的关注。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →