← 最新论文
💬 NLP

WavePhaseNet: A DFT-Based Method for Constructing Semantic Conceptual Hierarchy Structures (SCHS)

本文提出了 WavePhaseNet,一种通过测度论和频率分析来重构大语言模型(LLM)注意力机制的方法,旨在通过离散傅里叶变换构建语义概念层级结构,从而实现降维与上同调正则化,以在理论上缓解幻觉并增强逻辑一致性。

原作者: Kiyotaka Kasubuchi, Kazuo Fukiya

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kiyotaka Kasubuchi, Kazuo Fukiya

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一台计算机理解人类语言。长期以来,我们一直使用一种叫做“Transformer”的工具来做这件事。你可以把 Transformer 想象成一个超级快速、注意力高度集中的读者,它逐字逐句地扫描句子,并根据之前出现的内容来猜测下一个词。它在写故事和聊天方面表现惊人,但它有一个奇怪的缺陷:有时它会自信满满地胡编乱造。我们将这些编造的事实称为“幻觉”(hallucinations)。

为什么会发生这种情况呢?这篇论文指出,这不仅仅是因为计算机学习得不够刻苦。相反,这是一个结构性的问题,就像试图只用直线画出一个完美的圆。计算机将语言视为一种平滑的、数学上的可能性的平均值,但现实世界是混乱、崎岖且充满特定事实的,而这些事实并不总是符合这种平滑的平均值。为了解决这个问题,作者提出了一种看待语言的新方式,不再仅仅将其视为单词列表,而是将其视为一首具有不同音符的歌曲。他们使用了一种数学工具,叫做离散傅里叶变换(DFT),这与将复杂的声波转化为简单的频率列表(如低音、中音和高音)所使用的数学原理相同。通过将句子视为音乐,他们希望能够将“大局”意义与“细节”语法区分开来,从而降低计算机产生困惑并胡编乱造的可能性。

问题所在:当数学变得过于平滑

作者 Kiyotaka Kasubuchi 和 Kazuo Fukiya 首先指出当前 AI 模型工作方式的一个根本缺陷。他们认为,这些模型将语言视为一条平滑、连续的曲线,其中一切都融合在一起。然而,在现实世界中,真相往往是崎岖且具体的。当模型试图通过平均所有可能性来寻找“最可能”的下一个词时,它有时会创造出一个语法上听起来完美但在事实上完全错误的句子。这不仅仅是一个漏洞;作者认为这是数学本身的一种特性。因为模型是建立在平均值之上的,它无法完美地表示现实中那些非平均化的、尖锐的真相。

解决方案:将句子转化为音乐

为了解决这个问题,论文引入了一种名为 WavePhaseNet 的新方法。想象一下,你有一张写着句子的纸。在旧的方法中,计算机从左到右逐字阅读。而在 WavePhaseNet 中,计算机首先将这个句子转化为一个音乐和弦。

通过使用被称为**离散傅里叶变换(DFT)**的数学过程,模型将句子分解为不同的“频率”,就像音响工程师将一首歌分离成低音、鼓点和人声一样。

  • 低频: 代表句子的“低音”——即大局、主旨和整体意图。(例如:“这个故事是关于一只猫的。”)
  • 高频: 代表“高音”——即快速的变化、具体的语法和表达的细微之处。(例如:“那只猫正垫子上。”)

作者提出,通过分离这些频率,计算机可以对“大意”和“小细节”进行不同的处理。它可以锁定主要含义(低频)以免其偏移,同时允许细节(高频)发生变化。这创建了一个语义概念层级结构(SCHS),这是一种高级说法,意指计算机正在构建一个清晰、有组织的意义地图,而不是一个模糊的猜测云团。

神奇数字:缩小大脑

该论文中最引人注目的观点之一是关于这种新方法需要多少空间。目前的强大模型(如 GPT-4 背后的模型)使用大量的空间来存储信息——具体来说是 24,576 个维度(可以把这些想象成 24,576 个不同的滑块或旋钮,用来控制一个词的含义)。

作者指出,由于语言遵循一种被称为**齐普夫定律(Zipf's Law)**的自然模式(即少数词被频繁使用,而许多词很少被使用),句子的能量集中在较低的频率中。他们进行了数学分析,发现你不需要全部 24,576 个维度就能保持含义完整。

他们计算出,你可以将模型缩小到仅 3,000 个维度,而不会丢失核心含义或意图。这就像意识到你不需要 4K 电视也能欣赏电影一样;高质量的 1080p 屏幕足以让你看清故事。通过将规模从 24,576 减少到 3,000,模型变得更加高效,并且至关重要的是,它更不容易产生幻觉,因为它被迫专注于本质的“低频”真相,而不是迷失在高频的噪声中。

粘合碎片:“上同调”技巧

即使使用了音乐类比,计算机在观察句子的不同部分时仍存在产生困惑的风险。为了解决这个问题,作者使用了来自**上同调(cohomology)**这一数学分支的概念。

想象一下,你正在尝试组装一个巨大的拼图,但你只有几组朋友在观察不同的部分。有时,朋友 A 认为某个碎片应该放在一个方向,而朋友 B 认为应该放在另一个方向。在旧模型中,这些分歧可能会被简单地平滑处理,从而导致图像破碎。

WavePhaseNet 将这些局部群体视为一个网络。它会检查来自句子不同部分的“局部想法”是否相互一致。如果它们不一致,它会计算一个“分歧得分”(称为上边界/coboundary)。然后,系统使用一种称为**霍奇分解(Hodge decomposition)**的数学技术来寻找“调和”解——即在所有局部部分之间实现最大一致性的版本。这就像是一个裁判,确保故事的每个部分都尽可能与整体保持一致,从而帮助防止 AI 在一句话里说“猫在垫子上”,而在下一句里说“猫在飞”。不过,论文指出,一些“真实的阻碍”或不可避免的语义矛盾仍然可能存在,系统旨在减少而非完全消除这些矛盾。

这对未来意味着什么

这篇论文并不声称已经永久解决了 AI 问题,但它提供了一种看待问题的新方式。它建议不要仅仅向模型投入更多数据,而是改变底层的数学逻辑。通过将语言视为基于频率的层级结构,并使用这些“调和”检查来确保一致性,作者相信我们可以构建出逻辑推理能力更强、能抑制幻觉的 AI。

他们展示了通过使用 DFT 来分离“意图”与“表达”,并通过将模型缩小到其核心的 3,000 个维度,我们可以创建一个不仅更快而且更严谨的系统。这是一种从要求 AI “猜测下一个词”到要求它在唱出第一个音符之前先“理解整首歌”的转变。虽然这篇论文是理论性的,且依赖于数学证明和模拟,但它为实现一个显著减少 AI 幻觉、取而代之以更严密、更具数学完备性的意义理解的未来,提供了一个引人入胜的蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →