← 最新论文
💻 computer science

On Test-Time Scaling for Vision-Language Models

本文提出了首个关于大型视觉语言模型(LVLMs)测试时扩展(test-time scaling)的全面研究,揭示了规模较小的高性能模型能从额外的推理计算中获益最多,而较大的模型则面临失去焦点的风险,并且视觉信息主要在推理链的早期被利用,随后转向以文本为主的处理过程。

原作者: Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一支正在试图破解谜团的侦探团队。有些侦探是著名的、受过高度训练的专家(即“大模型”),而另一些则是聪明且好学的初级侦探(即“小模型”)。

长期以来,人们一直认为,为了获得最好的答案,你必须雇佣最昂贵、最大的专家。但这篇文章提出了一个简单的问题:如果我们让这些初级侦探多花点时间,让他们把思考过程说出来,并反复检查自己的工作呢? 这个过程被称为“推理侧扩展”(Test-Time Scaling)。与其把侦探变大,不如只是在调查过程中给他们更多的“思考时间”和“草稿纸”。

以下是研究人员通过简单的类比所发现的成果:

1. “初级侦探”带来的惊喜

旧有观念: 在纯文本 AI 的世界里,人们认为小的、廉价的模型因为太笨,无法从更长的思考时间中获益。他们认为:“如果侦探本身规模很小,即便给他们更多时间也没用;他们只会变得更加混乱。”

新发现: 研究人员发现,对于视觉语言模型(能够看图并回答问题的 AI)来说,情况恰恰相反。

  • 类比: 想象一个虽然基础知识扎实但容易紧张的小型精干初级侦探。当你给他们一份“步步为营”的清单(这种方法被称为“思维链”,Chain-of-Thought)时,他们突然变得非常出色。
  • 结果: 这些小模型(如 2B 或 4B 参数的模型)的分数提升了高达 30% 到 40%。在许多情况下,一个拥有额外思考时间的模型,其表现甚至优于一个只给出快速直觉反应的庞大且昂贵的模型。
  • 启示: 你并不总是需要一位超级昂贵的“大师级侦探”。一个拥有良好流程的聪明小侦探可以击败大侦探。

2. “过度思考”的危险

问题所在: 研究人员注意到,如果你让侦探在处理简单任务时思考太多,他们就会开始出错。

  • 类比: 想象一名侦探正在看一张红苹果的照片,并被问到:“这个苹果是什么颜色的?”
    • 常规做法: “它是红色的。”(正确)
    • 过度思考的做法: “嗯,光线有点奇怪。也许是个陷阱。它是西红柿吗?是一个红球吗?等等,那个阴影看起来像个蓝莓……”(错误/幻觉)。
  • 结果: 当任务仅仅涉及“感知”(即看清物体)时,给 AI 更多时间去“思考”反而会让它失去焦点。它开始编造故事并产生错误。
  • 启示: 如果工作只是为了描述你看到了什么,请保持简短。如果你让 AI 喋喋不休,它就会开始“幻觉”(凭空捏造)。

3. “快照”效应

发现: 研究人员观察了 AI 是如何思考的。他们观察了 AI 在撰写答案时正在注视图像的哪些部分。

  • 类比: 把 AI 的推理过程想象成在读地图。
    • 第一步(快照): 在一开始,AI 会强烈地注视图像。它拍下一张精神上的“快照”,并将视觉细节存储在记忆中。
    • 第二步(行走): 在最初的几秒钟之后,AI 停止注视图像。它闭上眼睛,利用之前拍下的“快照”在记忆中穿行,以此来解开谜题。它不再看图片,而是开始自言自语。
  • 结果: AI 说话的时间越长,它实际观察图片的时间就越少。当它写到最后一句时,它几乎完全依赖于自己的文字,而不是图像。
  • 启示: 视觉信息是“前置”的。AI 需要在开始时进行快速、清晰的观察,然后利用其内部推理来解决问题,而不是依赖图片。如果它话太多,就会偏离原始图像。

总结规则

根据这项研究,以下是使用这些 AI 模型的简单指南:

  1. 针对困难的逻辑/数学问题: 不要只买最大、最贵的模型。买一个规模较小、较便宜的模型,并告诉它要“步步为营地思考”。它的表现很可能会超过大模型。
  2. 针对简单的“你看到了什么?”类问题: 不要让 AI 思考太久。保持回答简短。如果你强迫它对一张简单的图片写一段长篇大论,它会开始撒谎或变得混乱。
  3. 过程规律: AI 在开始时会对图像进行快速的精神拍照,然后利用其记忆(而非图片本身)来解决问题。

简而言之:拥有良好流程的小模型可以击败大模型,但前提是你得知道何时让他们停止过度思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →