Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
本文提出了 AVES-DPO,这是一种自校正偏好学习框架,它通过基于共识的验证机制生成分布内偏好对,从而减轻大型视觉 - 语言模型中的幻觉问题,进而克服了因依赖专有模型而导致的分布不匹配问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、富有艺术感的机器人,它热衷于描述图片。你给它看一张厨房的照片,它说:“我看到一个棕色的橱柜、木地板,还有一个人站在狗旁边。”但等等——照片里根本没有狗!机器人只是凭空捏造了它。这被称为幻觉。就像机器人看着照片时在做白日梦。
很长一段时间以来,科学家们试图通过聘请一位“超级专家”(例如像 GPT-4V 这样庞大而昂贵的 AI 模型)来查看机器人的错误并告诉它:“不,那里没有狗。修正它。”然后,他们利用这些修正来训练机器人。
旧方法的弊端
这篇论文的作者意识到,这个计划存在缺陷。想象一下,让学生通过完全复制另一位艺术家的杰作来学习绘画。学生可能会学到大师的风格,但这并不符合他们自己自然的绘画方式。
同样地,当“超级专家”纠正机器人时,这种修正听起来像专家,而不像机器人。这就造成了不匹配。机器人感到困惑,因为“正确答案”对它的“大脑”来说显得格格不入,导致学习过程效率低下,并需要海量数据。
新方案:"AVES-DPO"(自我修正的艺术家)
作者提出了一种名为AVES-DPO的新方法。他们不再聘请外部专家,而是教导机器人检查自己的工作并自行修正。
以下是他们的“自我修正”过程,分解为简单步骤:
- 初稿(错误): 机器人查看图片并写下描述。它可能会意外地编造出一只狗,或者搞错橱柜的颜色。
- 侦探工作(验证): 在机器人尝试修正之前,他们使用一组“侦探”(专门的开源 AI 工具)来扫描描述。
- 机器人是否说那里有狗? 侦探检查照片。“没有,没有狗。”
- 它是否说橱柜是蓝色的? 侦探检查。“不,它们是棕色的。”
- 它是否说那个人拿着杯子? 侦探检查。“没有杯子。”
- 如果侦探们达成一致,错误即被确认。如果不确定,他们会寻求第二意见以确保无误。
- 自我修正(修复): 现在,机器人查看已确认的错误列表,重写它的描述。
- 它移除了那只假狗。
- 它将“蓝色橱柜”改为“棕色橱柜”。
- 关键在于,它不仅仅是删除错误的部分;它还补充了更多它遗漏的真实细节,比如“地板很亮”或“那里有一扇窗户”。
- 课程(偏好学习): 现在,机器人有了两个版本的描述:
- 版本 A: 原始的、充满错误的描述(“坏”答案)。
- 版本 B: 新的、经自我修正且细节丰富的描述(“好”答案)。
- 机器人被训练为偏好版本 B。因为它自己写出了版本 B,所以这个“好”答案听起来完全像它自己。它完美地融入了它自己的“大脑”。
为何这意义重大
该论文声称,这种方法之所以是游戏规则的改变者,原因有三:
- 高效: 因为机器人是从自己的“声音”中学习,所以它学得更快。他们只需要大约5,200 个示例就能教会机器人。其他方法需要 25 倍多的数据(超过 120,000 个示例)才能达到类似的效果。这就像对着镜子自言自语来学习一门语言, versus 试图模仿外国口音。
- 捕捉更多错误: 旧方法主要捕捉“大”错误,比如凭空捏造整个物体(一只狗)。这种新方法也能捕捉“微小”错误,比如搞错关系(说狗在左边,而实际上在右边)或颜色错误。
- 更便宜: 你不需要付费给昂贵的“超级专家”AI 模型来进行修正。机器人承担了繁重的工作。
结果
当他们测试这种新方法时,机器人在准确描述图片方面变得好得多。它不再编造物体,并能正确把握细节,同时仅使用了极少量的训练数据。
关于局限性的说明
作者诚实地指出了他们的方法目前尚未做到的事情。
- 它在一次观察一个物体时效果最好。如果一张图片里有 50 个人以复杂的方式相互交织,系统可能会变得有点困惑。
- 对于最大、最强大的机器人(130 亿参数模型),修正幻觉使它们稍微变得“谨慎”了一些。它们变得如此擅长不编造事物,以至于有时会忘记提及它们过去所知道的通用知识。这是在保持 100% 事实准确与保持 100% 健谈之间的权衡。
简而言之,AVES-DPO 是关于教导机器人成为自己最好的编辑,确保它所学到的“真理”是那种能自然地融入它自己心智的真理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。