← 最新论文
🤖 machine learning

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

本文介绍了 VisReason,这是一个包含 489K 个带有类人多轮推理过程的标注样本的大规模数据集,以及其专家策划的子集 VisReason-Pro,它们显著增强了多模态大语言模型的逐步视觉推理、可解释性和泛化能力。

原作者: Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个巨大且杂乱的房间里破解一个谜题。目前大多数“智能”计算机(被称为多模态大语言模型,Multimodal Large Language Models)的表现就像是一个站在门口瞥一眼整个房间,然后根据他们“以为”看到的东西来猜测答案的人。他们可能会说:“我看到一只鸟,所以它的肚子一定是白色的,”而没有真正去仔细查看。

VisReason 是一种全新的训练程序,旨在教会这些计算机停止猜测,开始像人类侦探一样进行调查

以下是该论文对这一概念的拆解,通过简单的概念进行说明:

1. 问题所在:“瞥一眼并猜测”的习惯

目前的 AI 模型擅长回答简单问题,但当答案隐藏在微小的细节中,或者需要理解物体在 3D 空间中的堆叠方式时,它们往往会失败。它们倾向于依赖“捷径”(例如基于常见词汇进行猜测),而不是仔细观察。这就像是从房间另一头去读药瓶上极小的标签;你可能会猜它写的是“阿司匹林”,但你很可能会猜错。

2. 解决方案:“缩放并验证”的训练手册

研究人员创建了一个名为 VisReason 的大规模数据集(以及一个更为详尽的版本 VisReason-Pro)。你可以将这个数据集视为不是一份问答列表,而是一份强制要求 AI “展示其推导过程”的分步训练手册

AI 不仅仅被训练去说“答案是 X”,而是被训练通过多轮“大声思考”来完成任务:

  • 第一轮(扫描): “我看到一只鸟在网上。我需要仔细观察它的肚子。”(AI 在该区域画出一个框)。
  • 第二轮(缩放): 放大该区域。 “好了,现在我可以看清了。它的肚子是白色且实心的。”
  • 第三轮(结论): “因此,答案是‘是’。”

该数据集包含 489,000 个示例,涵盖了四种不同的“谜题类型”:

  • 文本/文档: 阅读收据或发票上的微小文字。
  • 细粒度识别: 区分非常相似的事物(例如不同种类的鸟)。
  • 通用问题: 回答关于场景的标准问题。
  • 空间关系: 理解什么是“在……后面”或“在……前面”(例如:“树后面是什么?”)。

3. 秘密武器:“伪深度”(Pseudo-Depth)

其中一个独特的特征是其进阶版本(VisReason-Pro),它教会了 AI 关于深度(3D 空间)的概念,尽管它面对的是一张扁平的 2D 图片。

  • 类比: 想象你在看一张街道的照片。人类知道后面的车在前面那辆车的“后面”。AI 通常在这方面表现挣扎。
  • 解决方法: 研究人员使用了特殊的工具来估算物体之间的距离(例如“深度图”)。他们在训练期间将这些额外信息喂给了 AI。这就像是给侦探戴上了一副 3D 眼镜,让他们能够理解哪个物体挡住了另一个物体的视线。

4. 结果:更优秀的侦探

当研究人员使用这种新的“调查手册”训练他们的 AI 模型时:

  • 他们在细节处理上变得更强: 他们停止了猜测,开始寻找回答问题所需的具体证据。
  • 他们在空间理解上变得更强: 他们可以正确识别被其他物体遮挡或位于特定角落的物体。
  • 他们变得更加诚实: AI 展示了其推理步骤,使得人类更容易看到它给出答案的“原因”,而不仅仅是一个黑盒式的猜测。

这篇论文没有声称的内容

严格遵守论文的实际表述非常重要:

  • 没有声称这项技术目前已准备好用于医疗诊断或自动驾驶汽车。
  • 没有说 AI 现在能像拥有肉眼的人类一样进行 3D “观察”;它只是学会了比以前更好地利用深度线索。
  • 没有声称 AI 是完美的;论文承认,如果 AI 在第一步中缩放到了错误的位置,它可能会卡在那里(即“级联错误”)。

总结

VisReason 是一个庞大的“展示你的推导过程”示例库,它教会 AI 模型不要只是瞥一眼图片,而是要开始放大、检查细节并理解空间关系,就像一个细心的真人一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →