Mitigating Object Hallucinations via Sentence-Level Early Intervention
本文介绍了 SENTINEL,这是一个通过开放词汇检测器自举领域内偏好数据并应用句子级上下文感知偏好学习,从而在无需人工标注的情况下于生成过程早期干预以减轻多模态大语言模型中物体幻觉的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、富有艺术感的挚友,他热衷于为你描述画面。这位朋友擅长把握整体图景,但他有个古怪的习惯:随着描述的深入,他开始编造一些实际上并不存在的东西。
如果你给他看一张安静厨房的照片,他可能会先说:“我看到一张桌子和几把椅子。”这是真的。但随着他继续描述场景,他可能会突然补充道:“看,桌上还有一瓶花”,尽管实际上并没有花。接着,他可能会越说越起劲,说道:“还有一只猫正睡在花瓶上”,尽管根本没有猫。
这篇论文将这种现象称为物体幻觉。模型并非故意撒谎;它只是沉浸在自己的故事中,编造出与视觉现实相矛盾的细节。
现有解决方案的弊端
作者解释说,其他研究人员曾尝试解决这个问题,但他们的方案就像用大锤砸坚果:
- “人工编辑”方法:一些方法要求昂贵的人工编辑或超强大的 AI 模型在故事写完后对其进行重写。这种方法既缓慢又昂贵,而且往往会改变原始模型的“风格”。
- “停顿检查”方法:另一些方法试图在每句话之后暂停模型,以检查物体是否存在。这就像要求司机每走 10 英尺就停车查看地图。虽然有效,但会让整个过程变得极其缓慢且笨拙。
重大发现:“雪球效应”
这篇论文的作者 SENTINEL 做出了一个关键观察。他们意识到,幻觉并非一次性发生;它们往往在早期出现,随后像滚雪球一样越积越大。
这就像玩“传话”游戏。如果队伍中的第一个人说错了一个事实,后面的人就会重复这个错误,并在此基础上添加更多的谎言。论文发现,如果模型在第二句话中出现幻觉,那么它在第三、第四和第五句话中出现幻觉的可能性就会大大增加。错误会不断传播。
解决方案:SENTINEL(早期干预者)
作者提出了一种名为SENTINEL的新框架。SENTINEL 不像传统方法那样等到整篇故事写完后再进行修正,而是像一位警觉的编辑,在第一句谎言说出的瞬间就介入。
以下是 SENTINEL 的工作原理,通过一个简单的类比来说明:
预演(Bootstrap):
想象模型是一位正在排练场景的演员。SENTINEL 要求模型多次表演该场景(描述图像)。- 第 1 次运行:“我看到一张桌子。”(真实)
- 第 2 次运行:“我看到一张桌子和一个花瓶。”(花瓶并不存在!)
- 第 3 次运行:“我看到一张桌子和一只猫。”(没有猫!)
事实核查(交叉验证):
SENTINEL 使用两个简单、快速的“侦探”(物体检测器)来审视照片和模型的剧本。- 如果剧本说“花瓶”但照片中没有花瓶,侦探们就会将其标记为幻觉。
- 如果剧本说“桌子”且照片中确实有桌子,则标记为事实。
- 如果侦探们无法达成一致,则忽略该情况(以避免混淆)。
学习(偏好学习):
现在,SENTINEL 为模型创建了一种“选择你自己的冒险”风格的学习课程。- 选项 A(正确路径):“桌子周围环绕着椅子。”(这与照片相符)。
- 选项 B(错误路径):“桌子周围环绕着椅子和一个花瓶。”(这包含了谎言)。
模型被训练去认识到:“啊!选项 A 是我应该选择的。选项 B 是错误的,因为它包含了那个虚假的花瓶。”
“上下文”转折:
这是其中的秘诀。模型不仅仅是学习在孤立的情况下选择正确的句子,而是学习基于前文内容来选择正确的句子。- 如果前一句话是真实的(“我看到一张桌子”),模型就会学会让下一句话也保持真实。
- 它了解到,一旦“谎言”(幻觉)开始,整个故事就会脱轨。因此,它学会在谎言首次出现时立即将其制止。
结果
论文声称,通过在最初阶段(句子级早期干预)捕捉这些谎言,SENTINEL 阻止了“雪球”的滚动。
- 减少幻觉:与原始模型相比,它将物体幻觉减少了 90% 以上。
- 提升通用能力:与其他使模型“变笨”或变慢的方法不同,SENTINEL 实际上提高了模型回答问题以及准确描述事物的能力。
- 无额外成本:它不需要昂贵的人工编辑或超级计算机来运行。它教会模型成为自己的事实核查员。
总结
可以将原始 AI 模型想象成一个过于兴奋、喜欢编造故事的说书人。
- 旧方法试图聘请一位严厉的编辑,在故事讲完后重写整个故事(昂贵且缓慢)。
- SENTINEL则教导说书人倾听自己的内心声音。一旦他们即将说出虚假的内容,他们就会学会暂停、核实事实,并说出真相。这种方法在谎言传播之前就将其制止,从而产生既准确又富有创意的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。