← 最新论文
🤖 AI

Dual-Cache Latent Space Communication between Heterogeneous Language Models

本文介绍了 XKV,这是一种新颖的通信协议,它通过学习其键值(KV)缓存的转换器,使异构且冻结的语言模型能够交换信息,克服了以往在几何结构和层对齐方面的限制,从而实现了比基于文本及以往潜空间通信方法更高的准确率和显著更快的推理速度。

原作者: Jiyao Liu, Qi Zhang, Yaoyi Jia, Ziwen Kan, Song Wang

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiyao Liu, Qi Zhang, Yaoyi Jia, Ziwen Kan, Song Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的版图中,大型语言模型正日益不再作为孤立的思考者,而是作为团队的一员。想象一群研究人员正在研究一个复杂的谜团,其中每个人只阅读了不同的一套文件。为了解决这个案例,他们必须分享各自所知。在数字世界中,这些“研究人员”是软件智能体,而他们持有的文件是隐藏在内部记忆中的证据碎片。为了让这些智能体协同工作,它们需要一种在彼此之间传递信息的方式。直到最近,标准的方法是让一个智能体用纯英文写一份摘要并发送给下一个。虽然这便于人类阅读,但对机器来说效率极低。发送方必须缓慢地逐字构建信息,而接收方则必须阅读这些文字,并从头开始重建自己的内部理解。这个过程就像一场接力赛,跑者必须停下来,写下一张便条,递交给下一位,然后花时间阅读便条后才能再次奔跑。

研究人员一直在探索一种更快捷的沟通方式,这种方式完全跳过了文字的编写与阅读。他们尝试不再交换文本,而是直接将一个机器的原始内部“想法”传递给另一个。这类似于递给跑者一张预先写好的便条,他们可以瞬间吸收,而无需阅读。然而,早期的直接传输尝试遇到了障碍。这些尝试仅在两个机器是“孪生兄弟”时效果良好,或者它们会迫使发送方将其所有知识压缩成一个单一的、通用的摘要,从而忽略了接收方已有的知识。这意味着接收方收到的信息要么过于模糊,要么与其特定需求无关。挑战在于创建一个既快速、能在不同类型的机器之间运作,又能让接收方根据自身需求请求精确信息(而非接受“一刀切”式摘要)的通信通道。

一组研究人员现在推出了一种名为 XKV 的新系统,解决了这些问题。他们的方法将两个不同语言模型之间的通信视为一次共同协作,而非简单的交接。在他们的系统中,这两个模型——一个持有拼图的一部分,另一个持有剩余部分——都保持其原始状态不变,这意味着它们的内核智能不会被改变。相反,一个轻量级的转换器位于两者之间。这个转换器会同时观察两个模型的内部记忆。它不仅仅是总结第一个模型知道什么;它通过比较两组记忆,来计算第二个模型缺失了什么。随后,它会创建一个紧凑的共享记忆库,将发送方的证据与接收方的当前状态融合在一起。

这项创新的关键在于如何使用这个共享记忆。在之前的系统中,接收模型的每一个部分都被迫聆听同一个单一的摘要,就像一个教室里的每个学生无论其理解程度如何,都会听到完全相同的讲座。新的 X-KV 系统允许接收器记忆中的每一个位置向这个共享库提出特定的问题。这就像班级里的每个学生都可以举手,为自己缺失的特定事实提问,而老师则提供恰好那个事实。该系统随后为接收器记忆的每个部分交付精准且定制化的更新,在不干扰其原有知识的情况下填补空白。这个过程发生的时间仅为编写和阅读一条文本消息所需时间的极小部分,并且即使在两个模型的架构完全不同、使用不同的词汇表或具有不同的内部层数时也能正常工作。

研究人员在多种场景下测试了该系统,让不同家族的语言模型在五项推理任务上进行对决。这些任务涉及回答需要结合分布在两个智能体之间的证据的问题,例如通过连接不同段落中的事实来解决一个多步骤问题。结果显示,新系统在性能上始终优于传统的基于文本的方法以及之前表现最好的直接记忆传输尝试。平均而言,新系统显著提高了答案的准确性,在某些特定测试中,其精确匹配得分比之前的最佳方法提高了超过四个百分点。除了更聪明之外,它还快得多。新系统的转换器组件运行速度比之前的领先方法快十倍以上,并且比标准的基于文本的方法快近七倍。

研究还强调,这种速度提升并未以增加复杂性为代价。新转换器所需的训练参数比之前的领先方法减少了 76%,使其在构建和运行方面更加高效。至关重要的是,即使在两个通信模型完全不同(例如一家公司的模型与另一家公司的模型对话,或较小的模型与较大的模型对话)的情况下,该系统仍能保持高性能。这种灵活性表明,该系统可以部署在现实世界的场景中,在这些场景下,多样化的 AI 工具需要在无需重新训练或被迫统一形态的情况下进行协作。研究人员发现,当系统能够从双方构建共同记忆,而非仅仅依赖于单方面的摘要时,效果最好。这证实了最高效的沟通发生在将发送方和接收方视为一个整体时,从而允许接收方从共享的信息池中检索其所需的确切内容。

这项工作的意义不仅在于让 AI 变得更快。通过消除模型需要使用人类语言来理解彼此的需求,该系统为更流畅、更高效的多智能体系统打开了大门。这些系统可以协调复杂的任务,例如分析海量数据或解决复杂的科学问题,而不会受到生成和重读文本的瓶颈限制。研究人员证明,创建一个能够感知接收方状态、能从共享记忆中检索特定更新、且比其取代的“以发送方为中心”的摘要模式更廉价、更快速的通信通道是完全可能的。这代表了一种转变:从将 AI 智能体视为必须将思想转化为文字的孤立实体,转变为视为一个可以直接共享原始理解的凝聚网络。研究结果表明,协作式人工智能的未来可能不在于更好的语言,而在于更优化的分享那些驱动智能的、沉默的内部状态的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →