V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
本文介绍了 V-Rubrics,这是一个通过将响应分解为原子命题,从而在视觉接地、推理和指令遵循方面进行结构化、部分加分评分的强化学习框架,旨在增强视觉语言模型的视觉忠实度,并克服标量结果奖励的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在飞速发展的人工智能领域,一种特定的计算机程序脱颖而出,它能够观察照片并描述其所见。这些被称为视觉-语言模型的系统,旨在将图像的像素与人类语言的词汇联系起来。它们可以识别公园里的狗,阅读外语菜单,或者解释复杂的图表。然而,一个持久的问题一直困扰着这些系统:它们往往流利却不忠实。模型可能会生成一段听起来非常自信且流畅的句子,但它描述的对象可能并不存在,或者误读了图表上的数字,亦或是得出了图片本身根本无法支持的结论。对于人类来说,这是幻觉;对于机器而言,这是未能将其言语锚定在视觉现实中的失败。研究人员面临的核心挑战在于,如何教导这些机器去诚实地描述它们所看到的,而不仅仅是擅长猜测正确答案。
这项研究背后的研究人员通过意识到目前奖励这些机器的方式过于粗放,从而着手解决这个问题。在标准训练中,计算机被展示一张图像和一个问题,然后产生一个答案。如果答案正确,系统就会得到一分;如果错误,则什么也得不到。这种方法对于简单任务效果良好,但在推理过程复杂时就会失效。想象一位学生正确识别了照片中的物体,但在将它们联系起来时犯了逻辑错误;或者一位学生尽管误读了图表,却纯粹靠运气得到了最终答案。简单的“对或错”评分无法区分这些场景。它无法看出这位学生看到了正确的物体但思考方式不对,或者是在抓住要点时忽略了某个特定指令。缺乏这种细微差别,机器就会学会优先考虑最终结果,而非达成结果所采取步骤的真实性。
为了解决这个问题,团队引入了一种新的训练方法,将答案视为一系列可检查的小事实集合,而非单一的文本块。他们将理想的响应分解为一系列具体的规则要求,即“评分标准(rubrics)”。对于一个关于太阳系图表的问题,评分标准不仅会询问最终答案。相反,它会列出不同的步骤:“模型是否正确识别了太阳?”“它是否注意到月球与地球处于一条直线上?”“它是否解释了这种排列为何会导致高潮?”每个步骤都会根据其重要性被分配特定的权重。随后,系统会针对每一个微小的准则逐一检查计算机的响应。如果模型识别物体正确但推理步骤失败,它会在第一部分获得部分分数,并在第二部分受到惩罚。这使得训练过程能够精确地看到机器在哪里出了错,并奖励它做得正确的部分,即使最终结论是有缺陷的。
研究人员构建了一个庞大的数据集来教导系统这种新的思维方式。他们从涵盖图表推理、图表理解、文档视觉问答(VQA)、数学视觉推理、计数、教育问答和通用视觉推理的17个经典来源中收集了超过50,000个示例。对于每个示例,他们使用强大的语言模型生成这些详细的评分标准,将简单的问答对转化为结构化的教学计划。随后,他们使用一种称为强化学习的技术来训练视觉模型,在这种模式下,计算机扮演着试图进步的学生角色。它不必等待最终成绩,而是能从它写的每一句话中获得即时反馈。如果它准确描述了一个视觉元素,它就会赢得分数;如果它幻觉出一个细节或跳过了某个逻辑步骤,它就会失去分数。至关重要的是,系统学会了将这些分数与发生动作的具体文本部分相关联,尽管这种定位是近似的,并依赖于模糊匹配来将反馈与响应对齐,从而让它知道哪些词该保留,哪些词该修改。
研究结果非常显著,尤其是在需要仔细观察和逻辑演绎的任务中。在广泛的基准测试中,使用这些详细评分标准训练的模型表现优于标准版本以及仅基于最终答案进行训练的版本。这种提升在视觉数学和图表分析等领域最为明显,因为在这些领域,一个未经证实的说法就可能毁掉整个解决方案。在这些测试中,经过评分标准训练的模型更擅长保持推理链条,确保每一个结论都有图中可见的证据支撑。它学会了避免为了错误的原因而猜测正确答案的陷阱。这项研究表明,通过将“正确性”的概念分解为更小的、可验证的部分,我们可以引导人工智能走向对视觉世界更可靠、更真实的理解,从而从简单的流利度迈向真正的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。