← 最新论文
💬 NLP

Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking

本文引入了一个细粒度的多语言视觉-语言幻觉检测基准,证明了人工编写的样本可以通过提供更高的标注一致性和更好的控制能力,同时保持分布相似性,从而成为模型生成数据的可行且与模型无关的替代方案。

原作者: Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的图书馆,一位新型的图书管理员刚刚抵达。这些图书管理员是人工智能(AI)模型,特别是那些能够“看”图并用句子“读”出内容的模型。它们速度极快且才华横溢,但有一个古怪的习惯:有时会极其自信地描述根本不存在的事物。在计算机科学领域,这被称为“幻觉”。这就像一位图书管理员看着一张猫的照片,却满脸自信地坚持认为这只猫戴着一顶小帽子,手里还拿着一杯咖啡,尽管照片里什么都没有。

这是一个大问题,因为如果我们无法信任这些 AI 图书管理员所说的话,我们就无法利用它们来帮助我们寻找真实的信息。为了解决这个问题,科学家们需要一种方法来测试他们的“幻觉检测器”(旨在识别这些谎言的程序)是否真的有效。但问题在于,大多数测试都是使用试图测试的那些 AI 模型本身生成的示例来构建的。这就像试图通过只给学生看由其他可能在耍花招的学生编写的假新闻,来教学生如何识别假新闻一样。这种测试最终测量的可能只是检测器识别特定学生花招的能力,而不是它识别普遍谎言的能力。随着 AI 模型每隔几个月就会变得更加聪明和变化,这些旧的测试就会变得毫无用处,就像试图用十年前的地图来测试一辆新车引擎一样。

这正是论文《人工智能会梦见电子羊吗?》所探讨的内容。研究人员提出了一个简单而大胆的问题:如果我们不再使用 AI 来创建测试题目,而是请人类来编写这些虚假的故事,情况会怎样?他们想知道,人类是否可以发明一种看起来与 AI 错误极其相似、但又不会带有依赖于某个特定且快速变化的计算机程序的“包袱”的幻觉。

为了验证这一点,团队构建了一个庞大的测试案例集,名为 SHEP(代表人类编写与电子错误生成集,Set for Human-written and Electronic Erroneous Productions)。他们总共收集了 20,000 个样本。其中约 18,400 个是由五种不同的 AI 模型在观察各种图像后生成的。剩下的 1,600 个样本是由人类编写的,这些人类在看到相同的图像后,被要求故意编造谎言,以模仿 AI 会犯的错误。这些样本涵盖了四种语言:英语、中文、法语和意大利语。

研究人员随后对这些样本进行了测试。他们让专家审阅了所有 20,000 项内容,并准确标记出哪里存在谎言。他们发现,当人类编写幻觉时,专家们对于什么是谎言、什么不是谎言的意见一致程度,要比在判断 AI 生成的样本时高得多。似乎当人类故意制造错误时,他们的做法是非常清晰且一致的。相比之下,AI 生成的样本则显得有些混乱,专家们对于某个特定句子究竟是真正的幻觉还是仅仅是奇怪的措辞,往往存在分歧。

至关重要的是,这项研究表明,这些人类编写的样本可以作为 AI 生成样本的可靠替代品。尽管这些谎言是由人类编写的,但这些错误的“风格”在统计学上与 AI 模型犯下的错误非常相似。当研究人员在人类编写的数据上测试他们的幻觉检测器时,得到的结果与他们在 AI 数据上测试的结果非常接近。这表明,我们不再需要依赖特定的 AI 模型来创建我们的测试。

论文指出,使用人类编写的样本是一个明智之举,因为这使得测试更加稳定。由于人类不会像 AI 模型那样每隔几个月就改变写作风格,因此这些测试不会过时得那么快。这就像是从在每周都会变化的赛道上测试汽车刹车,转变为在一条保持不变的道路上测试刹车。研究人员发现,虽然人类编写的样本在风格上与 AI 样本略有不同,但这种差异并不大于不同 AI 模型之间存在的自然差异。

简而言之,这篇论文表明,我们可以信任人类制作的示例来帮助我们构建更好的检测器,以识别 AI 的谎言。这是一种确保我们是在测试 AI 讲述真理的能力,而不是仅仅测试它识别特定、过时测试的能力的方法。虽然这项研究并未声称这是完美或最终的解决方案,但证据有力地表明,人类编写的数据是保持我们的 AI 图书管理员诚实的可靠且持久的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →