Self-Rewarding Vision-Language Model via Reasoning Decomposition
本文介绍了 Vision SR1,这是一种三阶段自奖励强化学习框架,它将推理分解为视觉和语言两个组成部分,以减轻视觉幻觉并减少视觉 - 语言模型对语言捷径的依赖,且无需外部视觉监督或额外的 GPU 开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于Vision-SR1论文的解释,将其拆解为简单概念并辅以富有创意的类比。
问题所在:“白日梦”艺术家
想象你聘请了一位才华横溢的艺术家来描述一幅画作并回答相关问题。然而,这位艺术家有一个坏习惯:当被问及画作时,他们经常闭上眼睛,仅凭他们认为画作通常的样子来猜测答案,而不是真正去观察它。
在人工智能领域,这被称为**“视觉幻觉”(凭空捏造)和“语言捷径”**(忽略图像,依赖文本模式)。
当前的人工智能训练方法就像一位只给最终答案打分的老师。如果学生答对了,他们就会得到一颗金星,即使他们是通过闭眼猜测作弊得逞的。老师从未检查学生如何观察图片。因此,人工智能学会了将猜测置于观察之上。
解决方案:Vision-SR1(“自我检查”系统)
作者引入了Vision-SR1,这是一种新的训练方法,迫使人工智能“展示其解题过程”并验证其自身的视觉能力,而无需人类教师或超级计算机来检查其作业。
将 Vision-SR1 想象为针对人工智能艺术家的三步训练营:
第一步:“蒙眼测试”(分解)
该方法不再仅仅要求人工智能“观察图像并回答”,而是迫使人工智能将大脑拆分为两个截然不同的任务:
- 描述者:首先,人工智能必须写出图像的详细描述。关键在于,该描述必须足够完整,以至于如果你拿走图像,仅将文本描述提供给人工智能,它仍然能正确回答问题。
- 推理者:然后,人工智能利用该文本描述来推导答案。
类比:想象一名侦探,在获准破案之前,必须先撰写一份完整的犯罪现场报告。如果他们无法仅凭书面报告(而不回看犯罪现场照片)解决案件,那么他们的报告就是不完整的。
第二步:自我检查(自我奖励)
这是魔法所在。人工智能不需要人类来给其描述打分。
- 人工智能生成描述。
- 然后,人工智能被问道:“这是你刚才写的描述。现在,请仅使用这段文本回答问题。”
- 如果人工智能仅凭自己的描述就答对了,它会给自己颁发一颗“金星”(奖励),以表彰其作为观察者的优秀表现。
- 如果失败了,它就知道自己的描述很薄弱,并会收到一面“红旗”。
类比:这就像一位厨师写下食谱,然后尝试仅凭该食谱烹饪菜肴。如果菜肴味道正确,说明食谱是好的。如果味道糟糕,厨师就知道自己在说明中漏掉了一种配料。厨师无需美食评论家即可对自己的食谱进行评分。
第三步:平衡记分卡(多奖励优化)
过去,如果人工智能答对了最终答案,即使其描述是胡言乱语,它也会得到奖励。Vision-SR1 改变了记分卡。
- 它为人工智能描述图像的质量单独打分。
- 它为人工智能解决问题的质量单独打分。
类比:想象一位体育教练,过去只关心球队是否赢得了比赛。现在,教练拥有两块记分牌:一块用于“防守”(观察图像),另一块用于“进攻”(回答问题)。人工智能被训练为同时提升两块记分牌的分数。如果它在防守上作弊(跳过观察),即使它在进攻上得分,也会失分。
为何这很重要
- 无需额外教师:大多数方法需要雇佣昂贵的"AI 裁判”(其他大型模型)或人类来检查人工智能是否在看图。Vision-SR1 利用人工智能自身进行检查,节省了金钱和时间。
- 杜绝“白日梦”:通过迫使人工智能证明其能仅凭描述回答问题,人工智能学会了不能仅仅靠猜测。它必须真正“看见”图像才能生成有用的描述。
- 高效性:论文声称,与标准训练相比,该方法不需要额外的计算能力(GPU),使其成为现有系统的实用升级。
结果
在针对各种任务(如带图表的数学题、图表阅读和通用图像问题)的测试中,Vision-SR1:
- 减少了幻觉:人工智能捏造的内容减少了。
- 停止了作弊:人工智能较少依赖文本捷径,更多地依赖实际观察图像。
- 提高了准确率:与以往方法相比,它在各类问题上的正确率均有所提升。
简而言之,Vision-SR1通过让人工智能向自己证明它确实看到了其所声称看到的内容,教会人工智能停止猜测,开始观察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。