PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
本文介绍了感知增强型对齐直接偏好优化(PEA-DPO),这是一个通过显式利用视觉偏好信号来解决多模态大语言模型视觉不敏感问题的创新框架,从而在保持语言能力的同时,显著减少幻觉并提升多模态对齐水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,新一代系统已经涌现,它们能够同时进行视觉观察与语言表达。这些多模态大语言模型经过训练,可以观察图像并描述其所见,或者回答有关照片的问题。为了使这些机器真正有用且安全,它们必须与人类价值观对齐,这意味着它们的回答需要准确、有帮助,并且基于其所呈现的视觉现实。教导这些系统的一个主要挑战是它们存在“幻觉”倾向,即自信地描述那些根本不存在的物体或动作。为了解决这个问题,研究人员转向了一种称为“直接偏好优化”的技术,这种方法通过向模型展示成对的答案——一个好的和一个坏的——并要求它学习为什么第一个更好,从而对其进行教学。这种方法在纯文本模型上取得了显著成效,但当应用于同时也处理图像的系统时,却被发现了一个隐藏的缺陷,阻碍了它们真正“看清”清晰照片与关键细节被遮挡的照片之间的区别。
来自中国科学技术大学和新加坡国立大学的研究团队识别出了这一特定弱点,并开发了一个新的框架来治愈它。他们发现,标准的训练方法通常将图像仅仅视为背景,即对话的一个静态环境,而不是模型必须依赖的主要事实来源。正因如此,这些模型变得对视觉不敏感。在实验中,研究人员发现这些模型无法区分人们在野餐的照片和人们在阅读的照片,即使其中一张照片的视觉证据已被完全移除。模型会生成几乎相同的响应,未能注意到关键的视觉线索已经缺失。它们在区分单张图像中的特定物体时也存在困难,例如将厕所刷误认为普通的工具,因为它们没有足够关注定义该物体的关键视觉线索。
为了解决这个问题,研究人员创建了一种被称为“感知增强对齐”(Perception-Enhanced Alignment)的方法。他们不再仅仅教导模型选择更好的文本答案,而是重新设计了训练过程,强制模型去关注视觉语境本身。他们首先获取一张清晰的图像,并创建一系列经过修改的版本,在这些版本中随机遮蔽掉部分区域。通过使用一个独立的、高度敏感的视觉系统,他们识别出哪个修改后的版本丢失了最关键的信息,从而有效地创造了一个“被拒绝”的图像,该图像缺少正确回答问题所需的关键细节。然后,他们将这个信息缺失的图像与原始的完整图像进行配对。在训练期间,模型会被展示同一个问题和同一个文本答案,但先展示完整图像,然后再展示不完整的图像。模型被教导:当拥有完整的视觉证据时,它应该强烈偏好该答案;而当关键视觉语境缺失时,它应该识别出该答案的可靠性较低。
这种双重方法同时教会了模型两件事。首先,它学会了如何区分好的文本响应和坏的文本响应,就像以前一样。第二,更重要的一点是,它学会了识别视觉证据是否不足以支持某个说法。研究人员在两种不同规模的图文模型(一个具有70亿参数,另一个具有130亿参数)上测试了这种新方法。结果令人瞩目。在旨在衡量模型编造内容的标准测试中,新方法大幅降低了幻觉率。对于较小的模型,在某项主要基准测试中,编造细节的比例下降了近三分之一,而在另一项测试中下降了超过百分之九十。较大的模型也表现出类似的改进,通常甚至优于一些最先进的商业系统。模型在描述图片中确切内容方面变得更加出色,例如能正确识别书名或特定的工具,而不是基于通用知识进行猜测。
研究人员还检查了这种对视觉准确性的新关注是否会导致模型在其他任务上的表现变差。他们发现,模型保留了遵循指令和回答一般性问题的能力,在某些情况下,它们在这些通用任务上的表现甚至略有提升。唯一的明显权衡是,模型变得稍微保守了一些;当它们不确定时,不太可能进行猜测,这意味着它们提供的细节总量有时会减少,但它们提供的细节更有可能是真实的。通过明确教导模型像重视文本一样重视视觉证据,研究人员证明了构建不仅是在“看”图片,而且是在真正“看见”图片的智能系统是可能的。这项工作表明,对于想要成为理解视觉世界可靠伙伴的机器来说,它们必须学会感受信息缺失的分量,以确保它们的信心始终与眼前实际呈现的清晰度相匹配。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。