DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning
该论文介绍了 DWIM,这是一个通过采用差异感知工作流生成来提取可行训练数据,并利用指令掩码微调来引导模型克隆有效工具动作,从而克服冻结大语言模型的局限性并实现最先进性能的新颖框架,旨在增强组合视觉推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试解决一个复杂的谜题,比如弄清楚一张拥挤果园照片中到底有多少个苹果,或者解释为什么一只狗戴着帽子。在人工智能的世界里,这被称为视觉推理(Visual Reasoning)。
长期以来,AI 一直试图一次性完成所有工作(就像人类瞬间猜出整个答案一样)。但最近,更聪明的 AI 开始使用一种“工具箱”方法:它将问题分解成小的步骤,使用不同的工具(比如计算器、放大镜或搜索引擎)来解决其中的每一个部分。
然而,这种新方法存在一个大问题。AI 的“大脑”(大型语言模型或 LLM)是冻结的。这就像一位读遍了所有食谱的顶级大厨,却从未在配备特定工具的厨房里真正下过厨。他在理论上知道如何使用刀,但当他实际尝试切西红柿时,可能会割到手指或掉落刀具,因为他并不真正理解这些工具在实践中是如何运作的。
这篇论文介绍了一种名为 DWIM(意为 Do What I Mean,但在本文中是其特定方法的缩写)的新系统。你可以把 DWIM 想象成一位超级智能烹饪指导老师,她教会 AI 如何在不弄脏厨房的情况下真正使用工具。
以下是 DWIM 的工作原理,分为两个简单的部分:
1. “重新思考”策略(差异感知的工作流生成)
想象一下你正在教机器人烤蛋糕。
- 旧的方法: 你告诉机器人:“混合面粉,加入鸡蛋,烘烤。”如果机器人因为烤箱温度太高而烤焦了蛋糕,旧系统只会说:“这次尝试失败了,把它扔掉,”然后重新开始尝试。这浪费了很多时间和数据。
- DWIM 的方法: 机器人有一个“重新思考”按钮。如果它在混合面糊时,收到的反馈是“等等,温度不对”,机器人不会直接放弃。它会停下来,说:“噢,我明白错误在哪了!烤箱太热了,”然后改变它的下一步动作来修正错误。
DWIM 利用这种“重新思考”的能力来生成更好的训练数据。它不再仅仅丢弃失败的尝试,而是保存那些 AI 意识到某个工具不起作用并进行自我纠正的时刻。这创造了一个更丰富的“操作指南”库,不仅教 AI 该做什么,还教它在事情出错时该如何应对。
2. “高亮与学习”策略(指令掩码微调)
一旦 AI 拥有了这些“重新思考”的故事库,DWIM 就需要教会 AI 记住好的部分并忽略坏的部分。
- 旧的方法: 你向 AI 展示整个烘焙灾难的故事,并说:“记住整个序列。”AI 可能会在学习成功步骤(如“将烤箱设定为 350 度”)的同时,不小心把错误也一起学了进去(比如“把蛋糕放入 500 度的烤箱”)。
- DWIM 的方法: 想象一个“填词游戏”(Mad Libs)。老师拿着这个故事,遮盖(掩码)住成功的步骤(如“将烤箱设定为 350 度”),然后问 AI:“根据上下文,这里应该发生了什么?”
- 那些没有被遮盖的部分(错误和“重新思考”的时刻)会被留下来,以便 AI 看到:“噢,那一步错了。”
- 被遮盖的部分则是 AI 必须去猜测的“正确”动作。
这迫使 AI 只关注有效的行动,并学会忽略噪音。这就像通过只练习你做对的题目来备考,同时观察错题,仅仅是为了理解为什么它们是错的,而不是去死记硬背它们。
结果
论文表明,这种方法让 AI 在使用工具方面变得更加出色。
- 之前: AI 就像一个只懂理论但在实际操作考试中不及格的学生,因为它不知道如何处理工具。
- 之后: AI 就像一位经验丰富的大厨,知道该抓取哪种工具,如何使用它,以及如果它坏了该如何修理。
作者在许多不同的视觉谜题(计数物体、回答关于图像的问题、寻找照片中的特定物品)上测试了该方法。他们发现,DWIM 方法击败了之前所有的顶尖方法,甚至在测试期间没有给 AI 提供任何额外的“小抄”(示例)。它学会了变得更高效,犯错更少,并且能够解决它从未见过的全新问题。
简而言之: DWIM 教会了 AI 停止盲目猜测,开始在实时过程中从自己的错误中学习,从而将一个笨拙的工具使用者转变为一名大师级匠人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。