← 最新论文
💬 NLP

Entropy Gate: Entropy Quenching for Near-Lossless Token Compression in LLM Pipelines

本文介绍了 Entropy Gate,一种受热力学启发的“熵淬火”(entropy quenching)过程来选择性地移除低信息量 Token,从而在保持语义保真度的同时实现高达 96% 的智能体 LLM 工作负载压缩率的无状态且与模型无关的 Token 压缩框架。

原作者: Justice Owusu Agyemang, Jerry John Kponyo, Kwame Opuni-Boachie Obour Agyekum, Francisca Adoma Acheampong, Kwame Agyeman-Prempeh Agyekum, James Dzisi Gadze

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Justice Owusu Agyemang, Jerry John Kponyo, Kwame Opuni-Boachie Obour Agyekum, Francisca Adoma Acheampong, Kwame Agyeman-Prempeh Agyekum, James Dzisi Gadze

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图给一位特定领域的专家朋友写一封非常长且详尽的信。然而,你的朋友按字数收费,而且如果你的言辞啰嗦,他们会感到疲劳。你希望在不丢失任何原意的前提下,用更少的文字传达完全相同的信息,即剔除废话而不失真。

这篇论文介绍了一个名为 Entropy Gate(熵门) 的工具,它正是为此设计的。它就像一个智能编辑,坐在你和人工智能(AI)之间,在你发送请求(提示词)或 AI 回复之前,对它们进行精简。

以下是它的工作原理,通过简单的类比来解释:

1. 问题所在:“Token 税” (The "Token Tax")

AI 系统以被称为“Token”(标记/词块)的单位进行思考。目前,这些系统在那些无法增加新信息的词汇上浪费了大量的金钱和时间。

  • 类比: 想象你在为旅行打包行李。你不小心带了 50 只一模一样的袜子、三份同样的地图,以及一本你永远不会读的厚百科全书。你正在为携带这些重量而付费,但它们对你到达目的地毫无帮助。论文称之为“Token 税”。

2. 解决方案:“熵淬火” (Entropy Quenching)

作者使用了物理学中的一个概念——淬火 (Quenching)

  • 类比: 想象一锅热汤,里面漂浮着各种食材。有些食材沉重且有价值(比如牛排或土豆),而有些则轻盈且蓬松(比如蒸汽或气泡)。
    • 普通冷却: 如果你缓慢冷却汤,所有东西都会混合在一起。
    • 淬火: 如果你极快地冷却它,沉重且有价值的食材会沉到底部并保持固体状态,而轻飘飘、无用的气泡会冻结在原地,从而可以从顶部撇除。
  • 在 AI 中: 系统为每个词分配一个“能量得分”。高能词汇是“牛排”(重要的事实、名称、指令)。低能词汇是“气泡”(重复的短语、填充词、礼貌性的问候)。系统通过“冷却”对话,将低能词汇冻结,以便将其移除。

3. 它如何决定保留什么

系统并不只是瞎猜;它使用一个由三部分组成的评分卡来决定一个词是否重要:

  1. 统计能量 (Statistical Energy): 这个词是否罕见且具有特异性?(例如,“SQL injection”是高能的;“the”是低能的)。
  2. 结构能量 (Structural Energy): 这个词承担什么功能?(例如,像“Review”这样的命令或像“def”这样的代码关键字是高能的;逗号或空格是低能的)。
  3. 位置能量 (Positional Energy): 词语所处的位置在哪里?(位于句子开头的词通常承载更多权重)。

“能量平方”技巧 (The "Energy Squaring" Trick):
论文提到一个聪明的数学技巧,即对这些得分进行平方处理。

  • 类比: 想象你有一份跑步者名单。如果你只看他们的速度,快跑者和慢跑者之间的差距很小。但如果你将他们的速度平方,快跑者会显得极其迅速,而慢跑者则显得极其缓慢。这使得系统更容易识别出“赢家”(重要的词)并忽略“输家”(废话)。

4. 安全网:“保真门” (The "Fidelity Gate")

你不希望从“不要开门 (Do not open the door)”这句话中删掉“不 (not)”,从而变成“开门 (Open the door)”,那会造成灾难。

  • 类比: 系统有一个被称为 Fidelity Gate(保真门) 的安全检查员。在最终确定精简版本之前,它会检查:“这个缩减后的版本是否仍保留了原意 80%(或更多)的信息量?”
  • 如果答案是 ,它就发送精简版。
  • 如果答案是 (因为删除了太重要的内容),它会停止并保留原始词汇。

5. 对回答的处理

该系统也会精简 AI 的回答

  • 类比: 如果你提问,AI 可能会先进行一段冗长的礼貌开场白,给出答案,然后再进行一段冗长的总结。系统意识到,AI 的“废话”质量甚至比人类的写作还要低。它会激进地精简 AI 的回复,保留核心事实并切掉那些礼貌性的客套话。

6. 结果

论文在五种不同类型的任务上测试了该系统:编程、安全检查、文档编写、SQL 查询和系统指令。

  • 结果: 他们能够在不产生错误的情况下,减少 40% 到 60% 的词量。
  • “神奇数字”: 在某些情况下,结合记忆系统(即 AI 记住过去的对话,因此不必重新阅读旧文件),他们将总数据量减少了 88% 到 96%
  • 速度: 它几乎不会带来延迟(约 6 毫秒),这就像眨眼的时间一样快。

7. 重要警告(“不要做”的事项)

论文非常谨慎地指出了该工具不应该使用的场景:

  • 短消息: 如果你的消息已经非常短了(例如“修复这个 bug”),系统不会对其进行处理。因为没有废话可以切除,一旦切除就会破坏原意。
  • 智能体循环 (Agent Loops): 如果 AI 正在使用工具(如读取文件或运行代码),系统必须非常小心。如果它切掉了文件路径或特定的错误信息,AI 可能会感到困惑并陷入死循环。系统设有特殊规则来保护这些“关键”部分。

总结

Entropy Gate 是一个基于数学的智能过滤器,充当 AI 对话中的严厉编辑。它利用受物理学启发的规则来识别并移除“气泡”(无用词汇),同时确保“牛排”(重要信息)的安全。它节省了成本,减少了浪费,并让 AI 的大脑专注于真正重要的事情,同时保证意思不会丢失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →