← 最新论文
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

本文介绍了 AgentFootprint,这是一个揭示了即便在任务准确率相同的情况下,LLM 智能体在不同框架和配置下的持久化存储占用量也存在巨大差异的基准测试,同时证明了内容寻址存储可以在不损害数据可重构性的情况下显著降低这种开销。

原作者: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位天才机器人侦探破解谜题。它阅读线索、提问,并写下最终答案。每当侦探得出正确答案时,大家都欢呼雀跃,并检查它的思考速度和运行成本。但没有人注意到侦探在地上留下的狼藉

这篇名为《隐藏的足迹》(The Hidden Footprint)的论文,就像是一份清洁工的报告。它在问:“当侦探结束任务时,会在房间里留下多少垃圾?”

大惊喜:这堆“垃圾”巨大无比

主要发现令人震惊:两个侦探可以完美地解决同一个谜题,但其中一个留下的垃圾堆比另一个大 15.7 倍。

你可以这样理解:你和你的朋友都烤出了一个完美的巧克力蛋糕。你们都交出了蛋糕(结果)。但是,当你只是擦了擦台面时,你的朋友却留下了 15 个碗、30 杯面粉和一座粘稠包装纸的小山。蛋糕看起来是一样的,但你朋友的厨房却成了一个灾区。

在现实世界中,这种“垃圾”不仅仅是纸张,而是存储在硬盘上的数字字节。研究人员发现,对于单个任务,某些框架会留下 131 MB 的数据,而实际的答案(即“交付的蛋糕”)仅为 2.6 MB。这意味着该框架的“残留物”是其本应完成的工作量的 24,033 倍

“隐形”的双重计数陷阱

这里有一个棘手之处:如果你只是计算电脑上的文件,你可能会认为这些垃圾并不严重。论文指出,标准的计数方法是一个陷阱

想象一下,你在纸上写下“Hello”这个词。然后,你复印了这张纸,但复印机在每一份复印件上都添加了一个微小的“隐形墨水”印章。如果你数纸张,你会看到一张纸。但如果你观察墨水,你会看到“Hello”这个词被写了十二遍。

研究人员发现,由于计算机保存数据的方式(使用诸如“SQLite”页面和“JSON”转义等技术),相同的信息会被反复存储,隐藏在系统内部。

  • 天真的计数法认为:“哦,只有一点点重复。”
  • 论文中的聪明计数法则指出:“实际上,相同的内容被存储了 12.1 次!”

他们证明了,如果你不观察“隐形墨水”,你就会错过真实规模的巨大差距。

“增长”问题

论文还测试了当侦探必须检查同一个线索 200 次时会发生什么。

  • 一些框架(如 LangGraphAutoGen)表现得像一只永远不会忘记任何事的小松鼠。每次它检查线索时,都会再次把整个历史记录写下来。这导致存储量呈超线性增长(越来越快)。在 200 轮之后,它们仅为一个微小的文件就留下了 323 MB 的数据。
  • 其他框架(如 OpenAI Agents)则表现得像一个聪明的记录员。它们只记录新的内容。它们的存储增长缓慢,几乎呈直线。

论文测量了这种增长率(称为 α\alpha),发现其范围从 0.73(变小了!)到 1.95(爆炸式增长)。

垃圾越多,代表侦探越聪明吗?

你可能会想:“也许那个邋遢的侦探只是因为更加谨慎,所以才更聪明?”
论文给出的回答是:不。

他们查看了来自一个著名编程挑战(SWE-bench)的 108 个真实案例提交。他们发现,这些系统导出的数据量差异巨大,达到了 1,617 倍(从极小的文件到巨大的文件)。但关键在于:数据的规模与系统解决问题的能力之间没有任何联系。

事实上,这种相关性极其微弱,几乎为零。一个系统可能会留下堆积如山的资料却依然失败,或者留下极小的足迹却获得成功。论文明确排除了“更多存储 = 更好性能”的可能性。

“魔术橡皮擦”(但先别急着买)

研究人员不仅指出了问题,还展示了一种解决方法,但他们谨慎地表示这只是一个概念验证,而非成品。

他们构建了一个“内容寻址存储”(content-addressed store)。想象一个图书馆,与其把每本书都放在书架上,不如拍摄每本书的唯一指纹照片。如果两本书是完全相同的,你只需保留一张照片并注明“这本和那本一样”。

当他们将这种“魔术橡皮擦”应用于那些混乱的框架时:

  • 它将存储量减少了 4.8 到 32.7 倍
  • 至关重要的是,他们证明了即使删除了所有这些数据,你仍然可以完美地重建整个对话历史。用于回放侦探思维过程的“得分”保持不变。

论文排除了哪些观点

  • 它排除了“我们应该忽略存储,因为‘它很便宜’”的观点。论文认为,存储是一种持续性的债务,会随着时间累积,这与任务结束即消失的 AI 运行成本不同。
  • 它排除了标准文件计数器是准确的观点。他们证明了简单的计数会漏掉隐藏在系统代码中的重复内容。
  • 它排除了更大的数据轨迹意味着更好的结果。数据表明,规模与成功之间没有关联。

他们有多确定?

作者对他们所做的测量非常有信心。他们在隔离、干净的计算机环境(沙盒)中进行了 1,061 次实验,以确保没有其他因素干扰。他们使用完全相同的任务和模型测试了 8 种不同的框架(如 LangGraph、CrewAI 和 AutoGen)。

他们不是在猜测,而是在测量。他们发现,在完全相同的条件下,表现最好和最差的框架之间留下的数据量差异为 15.7 倍。他们还表明,这种差异并非因为一个框架比另一个更“聪明”,而是因为它们构建数据保存的方式不同。

总结

论文得出结论:我们需要开始像衡量 AI 的速度或成本一样,去衡量 AI 智能体的“足迹”。目前,我们正任由一些系统留下堆积如山的数字垃圾,而另一些系统几乎不留痕迹,而且事实证明,那些邋遢的系统并没有做得更好。

作者建议,如果我们想要大规模运行这些智能体(例如每天运行 10,000 个机器人),一个“整洁”的框架与一个“混乱”的框架之间的差异,可能意味着每天需要 3 GB 还是 51 GB 的存储空间。对于一个他们已经证明并不直接提升机器人智能的问题来说,这是一个巨大的差异。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →