See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
本文介绍了 ForeSight,这是一个统一的 multimodal 框架,通过在强化学习范式中整合底层视觉工具和基于掩码的视觉反馈机制来增强视觉 - 语言模型的推理能力,并在新构建的 CG-SalBench 数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个棘手的谜题:在一幅图中找出那个与其他所有物体都不同的唯一物体。大多数当前的人工智能模型就像一个试图通过仅仅谈论图片来解决这个谜题的人。他们用文字描述所见,但往往因为并未真正“仔细观察”而遗漏细微之处。他们可能会猜出答案然后继续前进,却从不核实自己是否正确。
这篇论文介绍了一种名为ForeSight(意为“看得更远,想得更深”)的新人工智能框架。它教导人工智能停止仅仅“谈论”,转而真正行动以更好地理解图像。以下是其工作原理,使用简单的类比说明:
1. 问题所在:“盲谈者”
当前的人工智能模型就像一位仅通过阅读报告破案、却从未亲临犯罪现场的侦探。它们依赖内部记忆(文本)来猜测图像的样子。如果报告含糊不清,它们就会猜错。此外,它们没有一种方式可以说“等等,我可能错了”,然后回头去检查。
2. 解决方案:给人工智能一个“工具箱”(看得更远)
ForeSight 为人工智能提供了一副特殊眼镜和一系列工具,使其能够像人类一样近距离仔细检查图像。人工智能不再仅仅猜测,而是可以决定:
- 放大(Zoom In):就像凑近阅读罐子上的微小标签。
- 描边(Canny 工具):就像用荧光笔描出形状的轮廓,以确切看清其起止位置。
- 改变颜色:就像戴上特殊太阳镜,让红色物体呈现明亮的蓝色,从而在一堆绿色物体中更容易发现红苹果。
人工智能学会自问:“我有足够的信息吗?没有?好的,让我使用放大工具。”它仅在认为自己需要时才使用这些工具,从而使过程高效。
3. 秘诀所在:“自我修正镜”(想得更深)
这是最独特的部分。大多数人工智能给出答案后就停止了。ForeSight 则不同;它拥有一面镜子。
- 过程:人工智能做出第一次猜测(“草稿答案”)。
- 遮罩:随后,它取一个数字“遮罩”(就像一块黑色胶带),覆盖住它认为是答案的图像部分。
- 检查:它观察未被覆盖的其余图像部分。它自问:“我没覆盖的部分看起来像我正在寻找的东西吗?”
- 如果未覆盖部分与它所选之物完全相同,它就说:“好的,我没错!”
- 如果未覆盖部分看起来不同(例如,它选了一个红色圆圈,但未覆盖区域有一个蓝色方块),它就说:“等等,我犯错了!”并更改答案。
这将人工智能的思维过程从单行道(问题 → 答案)转变为一个循环(问题 → 答案 → 检查 → 修正答案)。
4. 如何习得:“练习教练”
研究人员并非仅仅告诉人工智能这样做;他们使用一种称为强化学习的方法对其进行了训练。
- 这就像一位视频游戏教练。人工智能尝试解决谜题。
- 如果它使用了正确的工具并得到了正确答案,它就获得“积分”(奖励)。
- 如果它在不观察的情况下猜测,或答错,它就得不到积分。
- 经过数千次尝试,人工智能学会了最佳策略:“我应该在这里使用边缘工具,并且我应该在完成前始终用镜子检查我的作业。”
5. 结果:更聪明、更小巧的人工智能
研究人员在它们创建的一组新谜题(称为CG-SalBench)上测试了这种新人工智能。
- 惊喜:他们在一个相对较小的人工智能模型(70 亿参数)上构建了该系统。
- 胜利:尽管它比某些庞大且著名的人工智能模型更小,但 ForeSight 在找出图片中“异类”方面击败了所有对手。它在精确定位物体位置方面,甚至优于那些大 10 倍的模型。
总结
简而言之,ForeSight 是一个不仅基于文字进行猜测的人工智能。它学会在困惑时拿起放大镜,并照镜子检查自己的作业。通过执行这些简单、类人的动作,它在理解图片方面变得更加聪明,证明了如果你拥有正确的工具和双重检查作业的习惯,就不需要一颗巨大的大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。