AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
AsymSpec 是一种非对称投机解码框架,它使轻量级草拟器能够访问完整的输入上下文,而大型验证器则在压缩视图上运行,通过以显著降低的计算成本实现接近全上下文的性能,从而有效平衡智能体大语言模型(agentic LLMs)的推理速度与准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能系统正日益成为自主智能体,能够检索文档、使用软件工具并进行多轮对话以解决复杂问题。随着这些智能体的运行,它们会积累不断增长的信息历史:搜索结果、工具输出以及过去的对话信息。为了使这些系统达到实际应用中的速度,工程师通常会对这些历史记录进行压缩,将长文档总结为短句,或剥离详细的图像以节省时间。然而,这种压缩付出了沉重的代价:人工智能失去了进行准确推理所需的细粒度细节,迫使人们在速度与智能之间做出艰难的选择。一种被称为“投机采样”(speculative decoding)的标准技术——利用一个小巧、快速的模型来猜测大模型、慢模型的输出——一直是加速人工智能的主流方案。然而,这种传统方法在智能体场景中遇到了瓶颈,因为它要求作为“猜测者”的小模型和作为“验证者”的大模型必须看到完全相同的信息。如果信息为了节省时间而被压缩,猜测者也会像验证者一样丢失关键细节,这意味着这种加速手段无法挽回损失的准确性。
华为技术有限公司与中国科学技术大学的研究人员提出了一种名为 ASYMSPEC 的新方法,通过允许两个模型看到同一故事的不同版本,打破了这一僵局。在他们的系统中,负责做出最终决策的强大且大型的模型仅基于压缩后的快速版本输入进行操作,以保持低延迟。与此同时,一个更小、更轻量级的模型在后台读取完整的、未压缩的历史记录。这个小模型充当了一个引导者,精确识别出压缩过程中丢失了哪些信息,并微妙地引导大模型的预测,使其包含这些缺失的细节。研究人员发现,这种非对称设置使系统能够在保持压缩版运行速度的同时,保留几乎接近全上下文分析的准确度。在包括复杂多步提问和工具使用在内的四种不同智能体能力测试中,该方法在仅使用 20% 到 30% 计算成本的情况下,恢复了约 90% 的全上下文准确度。
其核心创新在于两个模型如何进行通信。该系统并非简单地让小模型进行猜测并寄希望于大模型达成一致,而是将小模型对全文的反应与其对压缩文本的反应进行对比。这两个反应之间的差异揭示了压缩过程究竟剔除了什么。随后,系统利用这一特定信号来调整大模型的输出,从而在不需要大模型本身处理沉重的全长数据的情况下,有效地填补了空白。一种智能门控机制确保这种引导仅在必要时才被应用,从而防止系统在压缩程度较轻时产生困惑。这种方法即使在输入涉及不同类型媒体时也同样有效;例如,一个小模型可以查看原始图像,而大模型仅能看到文本描述,此时小模型可以引导大模型去理解它无法看到的视觉细节。
研究人员在现实世界的智能体任务上测试了这种方法,例如回答需要检索多个文档、遵循多轮指令以及使用软件工具的问题。他们将该系统与标准方法进行了对比,这些标准方法要么缓慢地处理所有内容,要么快速地压缩所有内容。结果显示,传统的投机采样无法挽回因压缩而损失的准确性;它仅仅是加速了这一有损的过程。相比之下,这种新的非对称方法成功弥合了差距,以极小的代价实现了接近于缓慢、全上下文理想状态的表现。在涉及长文档的具体基准测试中,该系统与未压缩的基准线相比,实现了 1.3 到 1.7 倍的加速,同时将所需的计算能力降低到了约五分之一。研究表明,当压缩程度非常严重时,该技术尤其具有价值,因为系统恢复丢失信息的能力与最初剥离细节的程度直接相关。
这项工作证明了人工智能智能体中速度与准确性之间的权衡并非不可逾越。通过将快速模型所见的内容与慢速模型所见的内容解耦,并利用轻量级引导者来传输关键洞察,实现效率与高质量推理是可能的。研究结果表明,对于上下文沉重且细节易丢失的任务,一个阅读完整图景的小模型可以有效地引导一个处理摘要的大模型。这种方法为在生产环境中部署复杂的 AI 智能体提供了一条切实可行的路径,在这些环境中,延迟和成本是关键约束,同时又无需牺牲复杂决策所需的可靠性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。