← 最新论文
🤖 machine learning

Guarantees on Dynamical System Distinguishability for LLM Token Generation

本文通过将大语言模型(LLM)的标记生成建模为动力系统,为区分这些生成过程提供了理论基础,证明了分类准确率随序列长度基于谱距离呈指数级提升,并确立了跨嵌入迁移的基础极限与泛化界限。

原作者: Mohamed Akrout, Dan Wilson

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Akrout, Dan Wilson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图分辨两个不同的讲述者。一个在说真话,而另一个在编造故事(幻觉)。如果你只看他们使用的单个词汇,你可能会陷入困境。他们可能都会以相似的频率使用相同的常用词,比如“the”、“cat”或“sat”。这就像是试图仅通过听音符的平均音量来区分两首不同的歌曲;如果音量相同,这些歌曲听起来就是完全一样的。这正是许多目前用于检查 AI 是否在撒谎的方法所面临的问题:它们将每个词都视为一个独立的、随机的事件,忽略了词语是以特定的顺序出现并相互流动的这一事实。

然而,如果你去聆听其中的“节奏”和“旋律”——即故事是如何从一句话过渡到下一句话的——你可能会听到一种模式。在科学领域,这被称为“动力系统”(dynamical system)。把它想象成一个小球沿着山坡滚下。小球在任何单一时刻的位置可能看起来是随机的,但它随时间移动的路径遵循严格的物理规则。大语言模型(LLM)就像这些滚动的球;它们通过遵循隐藏的规则来生成文本。田纳西大学的 Mohamed Akrout 和 Dan Wilson 最近发表的一篇论文提出了一个重大问题:我们能否不通过观察 AI 说了什么词,而是通过观察这些词如何演变的无形“舞蹈”,来检测 AI 是否正在产生幻觉?他们将 AI 的内部思维过程视为一个黑盒机器,并试图仅仅通过观察其轨迹,来判断这台机器是在运行“真相模式”还是“虚构模式”。

该论文证明,仅仅观察词语本身(即“边缘分布”)往往是一个死胡同。作者展示了两个完全不同的机器——一个在说真话,一个在撒谎——可以产生统计学上看起来完全相同的词汇组合。这就像两位不同的厨师在碗里使用了完全相同的食材;如果你只是品尝汤的味道,你无法分辨是谁烹饪的。论文指出,任何忽略故事“流动性”的方法都是有本质局限性的,并且会遇到一个瓶颈,即无法做得比随机猜测更好。

但令人兴奋的部分在于:当你开始观察“运动”时,故事发生了变化。作者论证了,如果你观察 AI 的内部状态如何随着一系列词语而演变,其中的差异就会变得巨大。他们从数学上证明,随着故事变得越来越长,误分类 AI 的概率呈指数级下降。这就像听一秒钟的歌曲,你可能不知道它的流派;但听上三十秒,节奏就会让一切变得显而易见。论文表明,一个幻觉故事的“节奏”与一个事实性故事的“节奏”有着本质的不同,而且这种差异随着你分析的词语越多而变得越强。

此外,该团队还解决了一个棘手的现实世界问题:如果你针对一种类型的 AI “语言”训练你的检测器,然后尝试将其用于另一种不同的 AI,会发生什么?通常情况下,这样做会失败,因为它们的内部编码是不同的。然而,论文发现,如果这两个 AI 系统共享相似的底层几何结构(就像两张绘制相同城市的地图),检测器就可以进行迁移。他们展示了这种迁移的成功取决于这两个系统在数学上被“翻译”成彼此的程度。如果翻译是清晰的,检测器就能奏效;如果翻译是混乱的,检测器就会失效。

简而言之,这篇论文提供了一个严密的数学保证:要抓住 AI 的谎言,你不应该只是计数词语,你需要观察那场“舞蹈”。通过将 AI 的输出建模为一个运动系统,而非静态的词语列表,只要给予系统足够的时间来展现其真实的节奏,我们就能以高度的信心区分真实与虚构。这使关注点从静态的数据快照转向了随着 AI 思维演进而产生的动态模式,为理解和验证这些复杂的机器提供了一种全新的、更强大的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →