← 最新论文
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

本文介绍了 HalluWorld,这是一个利用显式参考世界模型来系统评估和分类语言模型中幻觉现象的受控基准,其结果表明,尽管感知错误已基本解决,但在多步状态跟踪、因果模拟和主动弃权方面仍面临挑战。

原作者: Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位非常聪明、博览群书的助手,帮助你穿越一个陌生且不断变化的迷宫。有时,这位助手会出错。他们可能会说“这里有一扇门!”,而实际上那是一堵墙;或者说“我记得我们向左转了”,而实际上你们向右转了。在人工智能领域,我们将这些错误称为幻觉

问题在于,直到目前为止,测试这些错误就像试图通过观察汽车在不同交通规则的城市中行驶来测量其速度一样。一项测试可能检查汽车能否读懂路牌(摘要),而另一项测试则检查它能否在街区中找到特定的房子(问答)。由于测试方式如此不同,很难判断针对路牌的修复方案是否也能帮助汽车找到房子。

“幻觉世界”(HalluWorld)登场了。

这篇论文的 authors 构建了一个巨大的、受控的实验室——一个“参考世界”,以公平、可重复且易于理解的方式测试人工智能助手。可以把它想象成一个视频游戏模拟器,开发者确切知道每一刻的真实情况,因此能够立即发现人工智能何时撒谎或陷入困惑。

三个测试区域

研究人员不仅建造了一个迷宫,还构建了三种不同类型的“世界”,以测试人工智能大脑的不同部分:

  1. 网格世界(视频游戏关卡): 想象一个像《吃豆人》或《我的世界》那样的简单二维游戏。人工智能必须四处走动、拾取钥匙并躲避火焰。研究人员可以精确控制人工智能看到的内容(也许它只能看到前方几步),甚至可以在其中植入“假路牌”来向人工智能传递谎言。这测试了人工智能是相信自己的眼睛,还是会被书面文字所欺骗。
  2. 棋盘(逻辑谜题): 国际象棋是一项规则严格的游戏。研究人员设置了特定的棋盘局面,并要求人工智能预测接下来会发生什么。这测试了人工智能能否模拟未来(例如:“如果我移动这个兵,我的国王会安全吗?”),还是仅仅基于它通常在象棋比赛中看到的内容进行猜测。
  3. 终端(计算机黑客): 这是最真实的测试。人工智能扮演一名计算机程序员的角色,看着满是代码和错误信息的屏幕。研究人员询问关于几分钟前发生的文件和命令的问题。这测试了人工智能能否记住漫长的历史事件,还是会被过时、陈旧的信息所迷惑。

五个“探针”问题

为了确切了解人工智能如何失败,研究人员提出了五种特定类型的问题,就像医生检查不同的反射一样:

  • 感知(“你看到了什么?”测试): “你正前方有一个红球吗?”(测试人工智能能否读取屏幕上当前的内容)。
  • 记忆(“之前发生了什么?”测试): “我们穿过了三个房间。第一个房间的门是什么颜色的?”(测试人工智能能否记住过去)。
  • 因果(“接下来会发生什么?”测试): “如果我推开这块巨石,它会挡住火焰吗?”(测试人工智能是否理解因果关系)。
  • 不确定性(“我不知道”测试): “你能告诉我我们尚未进入的那个黑暗房间里有什么吗?”(测试人工智能是否有勇气说“我不知道”,而不是编造答案)。
  • 复合(“连点成线”测试): “根据地图、钥匙和我们发现的便条,宝藏在哪里?”(测试人工智能能否整合不同的信息片段)。

他们的发现

在让数十个最先进的人工智能模型通过这些测试后,研究人员发现了一些令人惊讶的模式:

  • “眼睛”很好,“大脑”却在挣扎: 人工智能模型在回答关于它们当下所见的问题时几乎完美。如果你给它们看一张猫的照片,它们不会幻觉出一只狗。然而,当被要求追踪随时间变化的事物(记忆)或预测未来(因果)时,它们会变得非常困惑。
  • 更努力地思考并不总是有帮助: 你可能会认为,如果让人工智能在回答前“思考更久”,它会表现得更好。但研究人员发现,这往往适得其反。当被要求预测未来时,“思考型”模型实际上犯了更多的错误。它们似乎过度复杂化了简单的逻辑,并开始编造虚假的场景。
  • 信任错误的来源: 人工智能模型有一种奇怪的习惯:它们更相信书面路牌(如墙上的便条),而不是自己的眼睛。如果路牌上写着“门是开着的”,但人工智能看到的是一扇锁着的门,它往往会相信路牌。
  • “我不知道”的问题: 即使是最聪明的人工智能,最难做到的也是承认自己缺乏足够的信息。它们宁愿自信地猜错答案,也不愿说“我无法判断”。

结论

该论文得出结论,“幻觉”并非仅仅是一个大问题。它实际上是许多不同问题戴着同一顶帽子。有时人工智能会遗忘;有时它无法预测未来;有时它会轻信骗子。

通过使用幻觉世界,研究人员终于可以停止猜测,开始精确测量人工智能大脑的哪个部分出了问题。我们不再只是说“这个人工智能有幻觉”,现在我们可以说:“这个人工智能很擅长观察,但非常不擅长记忆,并且它需要学会何时说‘我不知道’。”

这个新的基准测试就像人工智能的标准化驾驶考试。它不仅检查汽车能否驾驶,还检查驾驶员能否在雾蒙蒙的道路上导航、记住五分钟前做出的转弯,以及在迷路时承认这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →