← 最新论文
💻 computer science

Tessera: Lossless-First, Vendor-Free Session Compression for Long-Horizon Agent Harnesses

Tessera 是一款无需供应商依赖、以无损优先为导向的会话压缩代理,它通过采用一个三层存储系统来确定性地重写对话历史,同时通过模型上下文协议(Model Context Protocol)保留对原始数据的可验证访问,从而为长程 LLM 智能体降低 Token 成本并减少延迟。

原作者: Mohammad Mosafer

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad Mosafer

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,一种被称为“智能体”(agent)的特定软件正扮演着数字员工的角色。这些智能体不仅仅是进行聊天,它们还能通过使用工具、读取文件和运行命令来执行任务。为了实现这一点,它们依赖于大语言模型——一种能够理解并生成人类语言的强大计算机程序。然而,这些模型存在记忆限制。每当智能体采取一步行动时,它必须将整个对话历史重新发送给模型,这样模型才能知道到目前为止发生了什么。随着会话变得越来越长,涉及数十个文件和数百条命令,这种历史记录会变得非常庞大。每次都发送所有内容既缓慢又昂贵。

为了解决这个问题,工程师们尝试了两种主要的技巧。第一种是简单地切断对话中最旧的部分,只保留最近的消息。这节省了空间,但也带来了丢失重要事实的风险,例如智能体稍后可能需要的密码或文件位置。第二种技巧是要求模型将旧的部分总结成一个简短的故事。这同样具有风险,因为总结可能会遗漏关键细节或凭空捏造新内容,而且无法检查总结是否准确。这两种方法都迫使人们在节省成本与保持真实性之间做出选择。

研究员 Mohammad Mosafer 提出了一种不同的方法,拒绝做这种选择。他构建了一个名为 Tessera 的系统,充当智能体与模型之间的智能中间人。Tessera 并不删除旧信息或将其改写为摘要,而是通过寻找并移除完全相同的副本和近乎重复的内容来压缩对话。它将原始文本安全地保存在一个单独的存储区域,并在主对话中用微小且精确的指针替换重复部分。如果智能体需要再次查看旧文本,它可以请求获取,系统会立即检索出完全一致的原件。这种方法让智能体能够使用更短的对话历史,而不会丢失任何事实,也不依赖于特定的公司技术。

问题的核心在于这些智能体是如何工作的。当智能体运行一个命令时,它会得到一个结果。如果它再次运行相同的命令,通常会得到完全相同的结果。在长会话中,智能体可能会多次读取同一个日志文件或反复检查同一个状态。因为智能体每次都会发送整个历史记录,它最终会一遍又一遍地发送大量相同的文本块。Tessera 注意到了这种重复。它扫描对话历史,并识别出一段文本何时与之前发送的内容完全一致。与其再次发送全文,它会发送一个短标记,说明:“这是与三步之前的文本相同的内容。”模型仍然可以阅读该标记并理解上下文,但发送的数据量却大幅减少了。

Tessera 不仅仅是寻找完全相同的副本。它还会寻找几乎相同的文本,例如仅有几个单词发生变化的日志文件。当它发现这些近乎重复的内容时,它会发送一条关于仅发生变化之处的小笔记,而不是整个文件。它还通过剥离不必要的格式并仅保留基本结构来处理大型数据块,如长数字列表或代码。所有这些操作都不需要使用大语言模型来进行决策。该系统使用简单的、确定性的规则,这意味着对于相同的输入,它始终会产生相同的结果。这使得过程快速且可靠,仅为发送消息增加了几毫秒的时间。

为了测试这个系统是否真的有效,研究人员创建了一个受控环境。他构建了一个生成器,用于创建充满现实数据(如 JSON 响应、服务日志和命令输出)的伪智能体会话。在这些会话中,他在随机位置植入了特定的、唯一的细节,例如随机代码或特定设置。随后,他通过 Tessera 运行这些会话,并测量了有多少植入的事实在压缩后的历史记录中得以存留。他将此与其他仅仅保留最近消息或切断旧消息的方法进行了对比。结果非常明确:当系统将对话压缩到原始大小的 29% 时,它在主历史记录中保留了 61.8% 的事实。相比之下,其他被迫保持相同空间容量的方法,仅保留了大约 26% 到 30% 的事实。

该系统还包含一种在需要时找回缺失信息的方法。这被称为“召回层”(recall tier)。如果智能体针对对话中较旧的部分提出特定问题,系统可以搜索其原始文本的安全存储库,并将确切的段落带回。当使用此功能时,即使这些事实不在主压缩历史记录中,系统也能恢复 9 la 9.5% 的事实。这意味着智能体可以使用极小、高效的历史记录,但仍能在必要时访问完整的细节。研究人员发现,当智能体记得旧事件的上下文时,这种恢复效果最好,但即使在问题很模糊的情况下,它依然表现良好。

研究还观察了不同类型智能体的行为。一些旨在修复软件漏洞的智能体往往会重复命令并看到相同的结果。对于这类智能体,系统发现近 15% 的对话是完全重复的。而使用不同模型的其他智能体则很少重复自己。系统适应了这两种情况,证明它不需要针对特定类型的智能体进行调优即可工作。它只是移除了现有的冗余,无论其中是大量的重复还是极少的重复。压缩数据所需的时间微乎其微,每次请求增加的时间不到 8 毫秒,这远低于模型生成响应所需的时间。

最重要的发现之一是,这种方法不需要放弃准确性。与可能丢失细节或改变含义的摘要法不同,Tessera 保留了每一个原始字节的文本。如果一个事实为了节省空间从主视图中被移除,它并没有消失,只是隐藏在一个可以随时打开的句柄之后。这使得系统具有完全的可审计性。工程师可以查看压缩后的历史记录,并准确知道哪些内容被移除了,以及在哪里可以找到原件。这与当前的方法相比是一个显著的转变,因为当前方法通常依赖模型去猜测什么重要,而这是一个难以验证的过程。

研究人员将他们的系统与几种管理内存的其他方式进行了对比。他们发现,仅仅保留最近的消息(一种常见的做法)是保留事实最有效率较低的方式。甚至一个随机保留消息的方法也比直接切断旧消息的表现要好,但仍无法达到 Tessera 的精确度。Tessera 成功的关键在于它不是丢弃整个消息,而是从消息内部“修剪脂肪”,保留长文本的头部和尾部,并将中间部分替换为指针。这使得智能体能够在保留对话上下文的同时,减轻数据的负担。

研究还检查了系统对其设置的敏感程度。研究人员调整了关于什么构成重复以及多少近期消息不受压缩保护的规则。他们发现,该系统非常稳健。稍微改变规则并不会导致性能崩溃。系统始终能节省大约 70% 的数据,同时保留绝大部分的重要事实。这种稳定性表明,该系统可以在实际应用中使用,而无需不断的调整。

最后,这项工作证明了在不丢失真相的前提下,让智能体对话变得更短是可能的。通过将对话历史视为可以压缩和检索的数据集合,而不是必须进行总结或切断的故事,该系统实现了一种此前被认为需要在效率与准确性之间进行权衡的水平。智能体可以运行更长、更复杂的任务,而不会耗尽内存或支付过高的额外数据传输费用。该系统独立于任何特定的模型提供商,这意味着它可以与任何使用这些智能体标准语言的工具配合使用。

研究人员承认,他们的测试是使用合成数据进行的,这意味着会话是由计算机生成的,而非记录自真实的真人使用。他们计划在现实世界的智能体轨迹上测试该系统,以观察其在实际环境中的表现。他们还指出,虽然目前的系统非常擅长移除冗余,但它尚未理解对话的深层含义。未来的版本可能会加入能够根据当前任务识别哪些对话部分最重要的层级。然而,目前的系统提供了一个坚实的基石。它证明了通过精心的工程设计,我们可以保留智能体工作的完整记录,同时仅发送一小部分数据,确保没有任何事实真正丢失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →