← 最新论文
💬 NLP

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

本文介绍了语义感知核熵(Semantic-Aware Kernel Entropy, SAKE),这是一种通过在核格拉姆矩阵上利用二阶 Rényi 熵来动态平衡文本扩散模型中的保真度与多样性的新型无需训练的引导方法,从而在代码和数学生成等推理密集型任务上超越了现有基准模型。

原作者: Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事、解数学题或编写视频游戏代码。长期以来,最好的方法是让机器人像人类在键盘上打字一样,一次写一个词。但问题在于:一旦机器人选定了一个词,它就不得不受限于它。如果它在早期犯了一个微小的错误,整个故事可能会陷入混乱,而且它很难回头去修正。最近,科学家们发明了一种新型的机器人大脑,叫做“扩散模型”(Diffusion Model)。扩散模型不再是一个词一个词地打字,而是从满页的乱码开始,通过不断清理,一次性地逐步完善。这就像是在观察一幅泥泞的画作如何通过艺术家的擦拭,逐渐变成一幅清晰的杰作。这种方法很棒,因为它能同时观察全局,但它也有一个棘手的问题:它经常会陷入某种套路。它可能会一遍又一遍地重复写出同样枯燥的句子,或者因为它试图变得与众不同而过于混乱,导致故事彻底崩塌。科学家们面临的大问题是:我们如何让这个机器人既具备创造力去探索新想法,又不至于失去逻辑性?

这篇论文介绍了一种聪明的技巧,叫做 SAKE(语义感知核熵),旨在帮助这些“扩散”机器人进行更具创造性的思考。研究人员发现,通常让这些机器人变得更多样化的方法——仅仅是调高“温度”旋钮来增加随机性——就像是通过向一个无聊的故事里撒一把纸屑来试图修复它一样。这可能会增加一些变化,但也会破坏质量,让故事看起来像是随机的噪音。相反,作者提出了一个更聪型的引导方式,它扮演着“好奇探索者”的角色。这个引导器会检查机器人是否即将选择一个与它刚刚写下的内容过于相似的词。如果机器人正陷入重复想法的循环中,引导器会轻轻地将它推向一条不同但依然合理的路径。如果机器人已经在进行创作,引导器则会退后一步,让它自由发挥。

团队在一些具有挑战性的任务上测试了这种方法,例如编写计算机代码和解决复杂的数学问题。他们发现,与旧方法相比,这种新的引导器能帮助机器人生成更多样化的正确答案。例如,在编写代码的任务中,当给予 32 次尝试时,使用 Sete 的机器人得到正确答案的概率为 55.8%,而标准方法仅为 41.1%。在数学方面,改进情况也类似。论文指出,通过使用这种“基于熵的引导”,我们可以让 AI 探索更多的可能性,而不会牺牲其工作的质量,从而有效地解决了创造力与正确性之间的权衡问题。

问题所在:机器人的“枯燥循环”

为了理解为什么这很重要,让我们看看这些 AI 模型通常是如何工作的。想象你在玩一个猜秘密单词的游戏。如果你想稳扎稳打,你可能会先猜最常见的词。但如果你想赢,你就需要尝试不同的猜测。在 AI 文本生成的领域,有一个常用的工具叫做“温度缩放”(temperature scaling)。你可以把它想象成一个控制随机性的音量旋钮。如果你把旋钮调低(低温度),AI 会表现得非常保守,选择概率最高的词,这往往会导致重复且枯燥的文本。如果你把旋钮调得很高(高温度),AI 就会变得狂野,选择随机的词。这确实带来了多样性,但这种多样性是混乱的。这就像把收音机的音量开到最大来听一个新频道;你可能会听到不同的声音,但同时也会听到大量的静电和噪音,音乐变得无法辨认。

研究人员认为,对于编程或数学等复杂任务,我们需要的不仅仅是更多的多样性,我们需要的是更好的多样性。我们需要 AI 去探索不同的推理路径(比如尝试解决谜题的不同方法),而不是陷入胡言乱语。旧的方法要么让 AI 太过保守(枯燥),要么让它太过狂野(崩溃)。

解决方案:“好奇探索者”引导

本文的作者张景威(Jingwei Zhang)及其团队提出了一种名为 SAKE(语义感知核熵)的新方法来引导 AI。SAKE 不仅仅是调高“随机性”旋钮,它更像是一个站在 AI 身边的聪明教练。

以下是其工作原理的简单解释:

  1. 教练查看地图: 在 AI 生成文本的过程中,SAKE 会观察它已经选择的词以及它正在考虑的下一个词。它使用一种特殊的“地图”(称为核 Gram 矩阵)来查看这些想法之间的相似度。
  2. “排斥”力量: 如果 AI 即将选择一个与它刚刚表达的内容过于相似的词(比如先说“狗在跑”,接着又说“狗在跑”),教练就会感受到一种“排斥力”。它会将 AI 推离那个重复的选择,并鼓励它尝试一个不同但仍相关的想法。
  3. 动态调整: 最酷的地方在于这个教练很聪明。如果 AI 已经在进行创作并选择多样化的词汇,教练就会放松,让 AI 遵循其自然的信心。只有当 AI 开始陷入循环时,它才会介入。

论文将这一过程描述为问题的“线性化”。由于尝试计算字典中每一个词的完美答案会耗费极长时间,AI 转而观察其大脑中想法的“形状”(嵌入空间),并快速计算出一个向正确的方向推进的推力。这使得该过程足够快,能够投入实际应用。

研究结果:更好的结果,更少的噪音

团队在多个基准测试上测试了这种新的引导方法,以验证其是否奏效。他们将 SAKE 与标准的“温度”法以及另一种流行的“离散分类器无关引导”(D-CFG)进行了对比。

  • 代码生成: 当被要求编写计算机代码时(使用 HumanEval 和 MBPP 测试),使用 SAKE 的 AI 在多次尝试中能更好地找到正确解。在 HumanEval 测试中,成功率从标准方法的 41.1% 跃升至 SAKE 的 55.8%。在 MBPP 中,从 48.2% 提升到了 56.1%
  • 数学推理: 在 GSM8K 数学测试中,使用 SAKE 的 AI 实现了 75.1% 的自一致性得分,超过了标准模型的 71.5%
  • “帕累托前沿”(Pareto Frontier): 研究人员还观察了质量与多样性之间的平衡。他们发现,虽然提高温度会让 AI 变得更多样化,但会损害文本的质量(使其连贯性降低)。然而,SAKE 却成功地将“前沿”向外推了一步。这意味着 AI 可以变得更具多样性,而不会损失其质量。这就像是找到了既能享受美食又能兼顾健康的办法。

一个有趣的发现是关于“模式坍缩”(mode collapse)。这是指 AI 陷入生成少数几个答案的循环中。论文显示,在低温度(即 AI 通常非常保守)的情况下,标准方法很快就会陷入僵局。然而,SAKE 迫使 AI 进行探索,即使在“随机性”设置较低时,也能显著提高其性能。

权衡:速度与智能

当然,天下没有免费的午餐。论文承认,SAKE 比标准方法需要更多的计算能力,因为“教练”必须进行额外的计算来检查词语的相似性。然而,团队发现这种减速非常轻微。AI 生成文本的速度仍能达到未引导版本的约 93%。相比之下,另一种方法 D-CFG 则要慢得多,速度降至约 67%。这表明 SAKE 是一个实用的工具,不会造成过多的延迟。

为什么这很重要

论文总结道,多样性不仅仅是为了让事物看起来不同,更是为了鲁棒性(稳定性)。在解决数学问题或编写代码等复杂任务时,拥有多种不同的思考方式会增加找到正确答案的机会。通过使用 SAKE,我们可以帮助 AI 模型探索这些不同的路径,而不至于让它们变成混乱、无意义的生成器。

作者们认为,这种方法可能会改变我们未来使用 AI 的方式,特别是在需要深度思考和创造力的任务中。他们证明了,通过理解 AI 思维中想法的“形状”,我们可以引导它既聪明又富有创造力,从而解决质量与多样性之间的古老难题。虽然论文并未声称解决了 AI 的所有问题,但结果表明,这种全新的“基于熵的引导”是让文本生成 AI 变得更加可靠和多功能的重大进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →