← 最新论文
💬 NLP

Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement

本文提出“概念场”,这是一种黑盒且可追溯语料的框架,通过将文本建模为嵌入空间中的局部漂移场,在不依赖模型内部机制的情况下,提供可解释的概率分数以检测幻觉并衡量新颖性。

原作者: Nicholas S. Kersting, Vittorio Castelli, Chieh Ting Yeh, Xinzhu Wang, Saad Taame

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas S. Kersting, Vittorio Castelli, Chieh Ting Yeh, Xinzhu Wang, Saad Taame

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大的图书馆,里面藏书无数,但你并非阅读文字,而是将每一句话都转化为巨大无形地图上独一无二的坐标。在这张地图中,含义相似的句子彼此靠近,而含义迥异的句子则相距甚远。

本文介绍了一种基于该图书馆来检测由人工智能(或人类)撰写的句子是否合乎逻辑的新方法。他们将这张地图称为“概念场”(Concept Field)。

以下是其工作原理,通过简单的类比进行分解:

1. “思想之河”(概念场)

想象这座图书馆并非静止的书籍堆砌,而是一条流动的河流。

  • 流向:如果你读到一句关于“买车”的话,河流自然会流向下一句最可能出现的内容,例如“开车回家”。
  • 水流:作者构建了一个系统来描绘这条河流的“水流”。他们不仅查看单句话,还查看一句话与下一句话之间的“变化”(增量)。
  • 地图:他们建立了一个名为VSDB的数据库,用于存储这些句子以及连接它们的“水流”。这创造了一个场域,其中每个点都有方向和速度,代表了在该特定图书馆中思想通常的流动方式。

2. “罗盘检查”(幻觉评分)

现在,假设人工智能写了一个新故事。我们如何知道它是在撒谎(产生幻觉)还是忠于事实?

  • 测试:你取出人工智能生成的句子,查看它是否遵循河流的“水流”。
  • 分数(Zeta):系统计算一个名为Zeta的分数。这就像罗盘的偏差。
    • 低分:人工智能的句子与河流完美契合。它是“有依据的”(忠于原始材料)。
    • 高分:人工智能的句子逆流而上,甚至完全跳出河流。它是“无依据的”(一种幻觉或狂野的创意飞跃)。
  • “不确定”区域:有时河流雾气弥漫,或地图不完整。系统可以说“我不确定”,而不是强行给出错误答案。这是一种“分诊”系统:有依据无依据不确定

3. “物理实验室”(二维弹道示例)

为了证明其想法有效,作者使用物理学而非文本进行了一项简单测试。

  • 设置:他们模拟了 1,000 个球以不同角度被抛向空中,并绘制了每个球的轨迹。
  • 结果:他们创建了一张“风场图”(即概念场),显示了球体通常的去向。
  • 测试:当他们抛出一个遵循相同物理规律的球时,地图显示:“是的,这符合!”当他们抛出一个带有“空气阻力”(不同的物理规则)的球时,地图尖叫道:“不!这不符合模式!”
  • 要点:这证明了他们的数学方法也适用于文本。如果思想的“流动”发生变化,系统就能检测到。

4. 两个不同的图书馆,同一个工具

作者在两个截然不同的图书馆上测试了该方法:

  1. 法律图书馆(CFR):美国联邦法规的集合。在这里,“逆流而行”是坏事(即谎言)。他们利用该系统捕捉法律文本中的人工智能幻觉。
  2. 故事图书馆(古腾堡计划):经典小说的集合。在这里,“逆流而行”可能是好事(即创造力)。他们利用该系统检测人工智能何时在创作的、富有创意的内容,而不仅仅是复制旧故事。

神奇之处:相同的数学原理在两种情况下都有效。高分意味着“与图书馆不同”。在法律中,这是一个警告;在故事中,这是一个特性。

5. 为何这很特别(“黑盒”优势)

大多数人工智能检测器试图窥探人工智能的大脑内部(白盒),或要求人工智能自我评估(这通常不可靠)。

  • 此方法为“黑盒”:它不在乎人工智能如何工作。它只查看输出并将其与图书馆进行比较。
  • 快速且廉价:它不需要昂贵的超级计算机。它只需要一台普通计算机和图书馆数据。
  • 可追溯:如果系统判定某句话是幻觉,它可以指出图书馆中证明这一点的特定句子。这就像说:“你说了 X,但图书馆说是 Y,这是页码。”

6. 发现隐藏模式(“漩涡”)

作者还观察了河流的形状。

  • 源与汇:他们发现了许多思想似乎开始的地方(如喷泉)或结束的地方(如排水口)。
  • 漩涡:他们发现了思想似乎围绕中心主题旋转而不向前推进的地方。
  • 重要性:这些不仅仅是数字;它们代表了人类交谈和写作方式的隐藏模式。例如,“漩涡”可能是一个人们谈论很多但似乎从未解决的话题。

总结

作者构建了一张特定文本集合中思想流动方式的地图。他们创造了一个罗盘,可以告诉你新句子是遵循该流动还是偏离了方向。

  • 如果你在检查事实,偏离意味着谎言。
  • 如果你在检查创造力,偏离意味着新思想。
  • 它运行迅速,无需了解人工智能的思考方式,并且可以通过指向原始文本来解释其做出决定的原因。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →