← 最新论文
🤖 AI

The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations

本文揭示,大语言模型中的时序知识漂移被编码为残差流中几何正交的方向,这使得现有的基于不确定性的检测方法失效,同时表明一个简单的线性探针通过直接访问模型的内部知识状态即可可靠地识别过时信息。

原作者: Rania Elbadry, Ahmed Heakl, Fan Zhang, Dani Bouch, Yuxia Wang, Preslav Nakov, Zhuohan Xie

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Rania Elbadry, Ahmed Heakl, Fan Zhang, Dani Bouch, Yuxia Wang, Preslav Nakov, Zhuohan Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《遗忘的几何学》的通俗解释,辅以生动的类比。

核心问题:自信过时的 AI

想象你向一位非常聪明、博览群书的图书管理员(即 AI)询问 2025 年某国的现任总统是谁。如果这位管理员是基于 2022 年出版的书籍受训的,他可能会自信地告诉你 2022 年担任该职位的人名。

令人恐惧的是?这位管理员对这一陈旧事实的表述,与对全新事实的表述一样确信、流畅且充满自信。当前用于检测“幻觉”(谎言或编造答案)的工具,主要寻找困惑的迹象,如结巴或缺乏自信。但由于这位管理员是“自信地”犯错,这些工具无法捕捉到错误。它们会想:“哦,他们听起来很确定,所以肯定是对的。”

发现:隐藏的“时间开关”

这篇论文的研究人员发现,这并非一个漏洞,而是这些 AI 大脑运作方式的结构性特征。

将 AI 的内部大脑想象成一个巨大的多维房间。

  • 轴 A(正确性): 房间中的一个方向告诉 AI:“这个答案是对还是错?”
  • 轴 B(自信度): 另一个方向告诉 AI:“我有多确定?”
  • 轴 C(时间漂移): 研究人员发现了第三个隐藏方向,它完全独立于前两个。这个轴追踪一个特定事项:“自受训以来,现实世界发生变化了吗?”

关键发现是,这个“时间漂移”轴在几何上与“正确性”和“自信度”轴正交(呈完美的 90 度角)。

类比: 想象试图用尺子测量房间的温度。无论你如何盯着尺子看,你永远找不到温度,因为温度存在于完全不同的维度上。同样,由于“时间漂移”存在于与“自信度”不同的维度上,任何仅检查自信度或正确性的工具,对于 AI 知识过时的这一事实都是盲目的。

实验:捕捉“时间漂移”

研究人员构建了一种新工具(一种“线性探针”),专门用于寻找那个隐藏的“时间漂移”轴。

  1. 数据集: 他们创建了一个包含 3,500 个关于随时间变化事实(如谁执教某支运动队或谁领导某政府)的庞大测试集。他们确切知道“现实世界”答案发生变化的时间点。
  2. 结果:
    • 旧工具: 当他们使用现有方法(检查困惑或低自信度)时,工具的表现不亚于抛硬币(准确率约 50%)。它们无法区分自信的谎言和自信的过时事实。
    • 新工具: 他们新的“时间漂移”检测器表现卓越,准确率达到 83% 至 95%。它能精准识别 AI 何时正在复述旧闻。

旧方法为何失效:“检索电路”

该论文深入探讨了 AI 为何会表现出这种行为。他们观察了 AI 的内部机制("MLP 检索电路”)。

他们发现,当 AI 检索旧事实(陈旧回忆)和编造虚假事实(虚构)时,内部的电信号看起来几乎完全相同

  • 类比: 想象两位不同的司机走完全相同的路线去杂货店。一位驾驶的是实际上已到达商店的汽车(正确)。另一位驾驶的是被困在 2022 年交通拥堵中的汽车(陈旧)。对于观察 GPS 信号的观察者来说,这两辆车看起来在做完全相同的事情。AI 内部的“引擎”无法区分“我找到了一个旧事实”和“我编造了这个事实”。它只是发出相同的信号。

“交叉切断”证明

为了证明 AI 实际上是在“记住”其受训日期(而不仅仅是对问题中的词语做出反应),研究人员进行了一项巧妙的测试:

  • 他们使用完全相同的问题(逐字节相同),将其输入两个不同的 AI。
  • AI A 受训于 2022 年。
  • AI B 受训于 2024 年。
  • 他们询问了一个在 2023 年发生变化的事件。

结果: 2022 年 AI 的“时间漂移”检测器被触发(尖叫“这已过时!”),而 2024 年 AI 的检测器保持静默(表示“这是当前的!”)。由于问题完全相同,唯一改变的是 AI 的内部记忆。这证明了检测器读取的是 AI 内部的“知识状态”,而非问题本身。

结论

该论文得出结论:时间漂移是大语言模型内部一个独特的、隐藏的维度。

  • 由于它隐藏在不同于自信度的轴上,我们无法仅通过观察 AI 听起来有多确定来检测过时的答案。
  • 要解决这个问题,我们需要专门寻找这个“时间漂移”轴的新工具,而不是试图通过仅仅让 AI 变得“更不确定”来解决问题。

简而言之:AI 并没有困惑;它只是被困在了过去,并将这一事实隐藏在我们当前工具无法看到的其大脑的一部分中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →