A Unified Definition of Hallucination: It's The World Model, Stupid!
本文提出了一个将幻觉统一定义为用户可观察到的不准确内部世界建模的定义,认为该框架涵盖了先前的定义,通过指定参考世界明确了评估标准,并将幻觉与其他类型的错误区分开来,以促进更好的基准测试和缓解策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个非常聪明但有点糊涂的机器人玩“传声筒”游戏。你给机器人讲一个故事、一张图片或一套规则,并让它讲述发生了什么。有时,机器人会告诉你一些听起来非常自信且流利的内容,但那些内容完全是编造出来的。在技术领域,我们称之为幻觉(hallucination)。
但问题在于,每个人都在争论到底什么才算作幻觉。
- 如果机器人总结一篇新闻文章时弄错了事实,这算幻觉吗?
- 如果机器人根据记忆回答一个常识问题时答错了,这算幻觉吗?
- 如果机器人试图点击一个并不存在的网页按钮,这算幻觉吗?
一些研究人员对这些问题都回答“是”。另一些人则说“不,那只是个错误”。这种混乱使得解决问题变得异常困难。
这篇论文认为,我们不应该再争论定义,而应该开始关注根本原因。作者提出了一个简单且统一的概念:幻觉本质上就是一个破碎的“世界模型(World Model)”。
核心思想:机器人的内部地图
把机器人想象成一个试图在城市中导航的探险家。为了做到这一点,它需要一张地图(世界模型)。
- 参考世界(The Reference World): 这是真实的地图。它是地面真理(ground truth)。它可以是你给它的新闻文章、真实的国际象棋规则、公司的真实数据库,或者是网站的实时代码。
- 机器人的视角(The Robot's View): 这是机器人实际被允许看到的内容。也许它能看到整篇文章,或者它只能看到一小段片段。
- 冲突规则(The Conflict Rule): 这是裁判。如果机器人的记忆说“天空是绿色的”,但文章说“天空是蓝色的”,谁赢?通常,文章(参考世界)胜出。
论文的定义:
只有当机器人的输出根据冲突规则与参考世界相矛盾时,才发生幻觉。
如果机器人说“天空是绿色的”,而参考世界(文章)说“天空是蓝色的”,那么机器人就有一张破碎的地图。这就是在产生幻觉。
为什么这能统一一切
作者展示了人们讨论的所有不同类型的“幻觉”,实际上都是在不同的房间里发生的同一件事:
- 摘要(Summarization): “参考世界”是源文档。如果摘要与文档相矛盾,说明机器人对该文档的地图错了。
- 常识问答(Open QA): “参考世界”是宇宙的真实事实(例如,谁获得了诺贝尔奖)。如果机器人基于其训练数据做出了错误的猜测,那么它对现实的内部地图就是错误的。
- 网页浏览(Agents): “参考世界”是实际的网站代码(DOM)。如果机器人说“我点击了提交按钮”,但代码显示并不存在这样一个按钮,那么机器人是在幻觉出一个不存在的对象。
“愚蠢”之处:是地图的问题,而不是机器人的问题
标题写着,“是世界模型,蠢货!”(It's The World Model, Stupid!),这是对一句著名政治口号的戏仿。作者的意思是:别再责怪机器人“糊涂”了。问题在于它的内部世界地图是不准确的。
有时机器人并不是在“撒谎”;它只是在看一张错误的地图。
- 规划错误(Planning Error): 机器人知道地图是对的,但它选择了一条错误的路径。(这不是幻觉)。
- 幻觉(Hallucination): 机器人认为地图上写着“此处有桥”,但地图实际写着“此处是悬崖”。(这就是幻觉)。
如何修复(根据论文观点)
论文建议我们不要试图构建一个“完美的机器人”,而是开始构建更好的测试场。
他们提议使用合成世界(如视频游戏或国际象棋)来测试机器人。
- 国际象棋类比: 想象一场国际象棋比赛,规则是100%清晰的,棋盘状态也是100%已知的。我们可以问机器人:“白色的骑士能否跳到这个格子?”
- 如果机器人说“可以”,但规则说“不可以”,我们就确切地知道它对国际象棋棋盘的内部地图是破碎的。
- 因为“参考世界”(国际象棋规则)是由计算机完美定义的,所以我们不需要人类来猜测机器人是否在撒谎。计算机能瞬间识别。
为什么这很重要
通过达成这一定义共识,研究人员终于可以:
- 进行同类比较: 我们可以判断一种新技术究竟是减少了幻觉,还是仅仅改变了游戏规则。
- 明确修复方向: 如果机器人是因为看不全整个文档而产生幻觉,我们就去修复“视角(View)”。如果它是因为忽略了文档而倾向于使用自己的记忆,我们就去修复“冲突规则(Conflict Rule)”。
- 构建更大的测试: 我们可以创建成千上万个测试场景(比如数百万个国际象棋谜题),在这些场景中,我们百分之百知道答案,而不需要人类去为每一个案例评分。
简而言之: 论文的核心观点是,“别再争论什么是幻觉了。它仅仅是指机器人的描述与我们约定的测试基准不符。让我们构建更好的地图和更好的测试,从而修复机器人破碎的指南针。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。