← 最新论文
🤖 AI

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

Nexus 通过语义旁路缓存(semantic lookaside buffer)和压缩签名将工具路由与昂贵的模式预填充(schema prefilling)解耦,并采用具有回退重解码机制的深度自适应 KV 缓存拼接机制,在通过统一内存加速代理式 LLM 的同时,确保尽管存在旋转位置嵌入(rotary position embedding)漂移,仍能保持输出保真度。

原作者: Mustafa Arslan

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Mustafa Arslan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,一种特定类型的软件智能体正在学习如何代表我们行事。这些数字助手不仅仅是回答问题,它们还会主动调用工具,比如检查日历、搜索数据库或发送电子邮件。为了实现这一点,软件必须首先理解每一个可能使用的工具的详细说明书。随着可用工具的数量增长到数百个,这些说明书变得极其庞大,在智能体甚至开始思考之前,就会填满计算机的短期记忆。这造成了一个瓶颈:智能体拥有的工具越多,开始工作所需的时间就越长,因为计算机每次执行新步骤时,都必须重新阅读并处理这些庞大的指令集。

研究人员一直在寻找绕过这一瓶颈的方法。一种想法是将计算机对这些指令的工作以压缩形式保存下来,就像一个书签一样,并在需要时将其重新粘贴回内存中。这听起来很高效,但却遇到了现代AI模型追踪时间和顺序方式的一个根本性问题。这些模型使用一种系统来记录它们在单词序列中的位置,如果将保存的工作块移动到内存中的不同位置,模型会对事件的顺序感到困惑。这就像是从一本书的中间撕下一页并将其粘贴到另一个章节中;故事本身可能仍然通顺,但句子之间微妙的联系可能会断裂,从而导致错误。

一支独立研究团队现在构建了一个名为 Nexus 的系统,用以应对这一复杂的局面。他们发现,虽然你不能随意移动这些保存的指令块而无风险,但如果你能谨慎地处理它们放置的位置并修复必然产生的错误,则是可以实现的。他们的研究在一种现代笔记本电脑中常见的特定强大计算机芯片上进行了测试,揭示了在AI输出变得不可靠之前,你可以移动这些数据块的精确边界。他们发现,如果数据块移动得太远,模型的序列理解就会发生偏移,但这种偏移是可预测的。研究人员设计了一种方法,用于检测这种偏移何时变得过大,并自动重新读取必要的指令部分,从而完美地将记忆缝合在一起。

这项工作的最显著发现是,该系统不需要依赖这些具有风险的记忆捷径来完成其最关键的任务:决定使用哪个工具。Nexus 并没有强迫 AI 阅读庞大的指令手册来做出选择,而是使用了一个独立的、极速的查找系统。该系统通过扫描一份包含工具名称和描述的精简列表,在微秒内找到匹配项。一旦工具被选中,AI 就会利用一份极小的、压缩后的指令摘要(通常仅有几十个单词)来生成必要的参数,而不是使用那份臃颖的全文。这种方法保持了主内存的整洁,并使智能体能够更快地开始工作,在生成答案的第一个词时,比重新阅读完整手册所需的时间缩短了不到一半。

研究人员还严格测试了他们这种“记忆拼接”技术的极限。他们证实,虽然该方法在短距离内表现良好,但存在一个硬性限制。如果保存的数据块距离其最初创建的位置超过 256 个位置,错误将变得过于严重而无法忽视。此时,系统会停止尝试修补记忆,转而退回到较慢但更安全的方法——即重新阅读全文。这确保了最终输出的准确性始终与从未尝试过捷径的情况完全一致。他们还证明,一种基于快速检查内存内部状态来猜测何时停止捷径的更简单、更廉价的方法是行不通的,因为它无法可靠地预测错误。

在测试中,Nexus 系统能够处理包含 250 种不同工具的注册表而不减速,并保持了极高的正确工具选择成功率。在上下文长度适中时,该系统的速度比传统的重新阅读全文法快了高达 1.7 倍。然而,随着对话变得越来越长、越来越深,其速度优势自然会逐渐消退,最终与标准方法持平。这并非失败,而是其设计的特性:系统将“答对问题”置于“速度”之上。它保证了输出结果绝不会比标准方法差,即便有时两者耗时相同。

这项工作是在一种具有统一内存架构的单一类型计算机芯片上进行的,这种架构允许处理器直接访问数据,而无需在机器的不同部分之间移动数据。这种特定的硬件设置对于实现记忆拼接技术至关重要,因为它需要对内存单元进行直接的物理访问。研究人员明确表示,虽然这些速度数据是针对这一特定设置的,但其背后的原理——即移动内存块的限制以及建立独立路由系统的必要性——似乎是关于这些模型运作方式的普遍真理。他们提供了一张清晰的地图,标明了捷径在哪里有效、在哪里失效,以及如何构建一个尊重这些边界的系统,从而同时实现速度与可靠性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →