← 最新论文
💻 computer science

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE 是一个将投机采样解码集成到边缘与云端环境中的分布式推理框架,它利用紧凑的边缘草拟模型生成 Token,并利用云端验证器并行验证这些 Token,从而在不进行重训的情况下,在保持大语言模型准确性的同时,减少了 76% 的云端模型调用并降低了成本。

原作者: Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图解开一个巨大且复杂的拼图,但唯一知道最终图案的人是一位住在遥远且昂贵城堡里的天才、博学多才的教授。每当你向教授询问下一个拼图块时,他们都必须停下手中的一切,进行深度思考,然后将它发送给你。这就是当今最强大的人工智能(AI)的工作方式。这些“大语言模型”就像那位教授:他们极其聪明,能够写故事、解数学题,并像人类一样聊天,但他们也非常庞大,对计算能力有着极高的渴求,而且如果你每次都要等待“城堡”那边的反馈,速度会变得非常慢。

为了提高速度,有些人尝试在你的手机或笔记本电脑上构建一个微型的、本地化的教授版本。但这个本地助手通常有点笨拙;它可能会猜错拼图块,从而导致愚蠢的错误。科学家们面临的挑战是:我们如何既获得本地助手的速度,又不丢失教授的天才智慧?我们需要一种方法,让本地助手承担重活,而只在绝对必要时才去请教昂贵的教授,从而确保最终结果依然完美。这正是这篇论文的研究人员决定解决的谜题。

于是,SPADE 登场了,它是一个巧妙的新系统,充当了本地“草拟员”与云端“编辑”之间的高速接力赛。论文介绍了一种被称为**投机采样(Speculative Decoding)**的方法,这正是其中的秘密武器。你可以这样理解:与其向教授逐个单词地询问,不如让你的本地草拟员(一个运行在你设备上的更小、更快的 AI)快速草拟出一整句猜测的话。然后,你只需将这整句话发送给云端的教授一次。教授并不需要重写整个句子,他们只需快速扫描,看看哪些单词是正确的。如果草拟员猜对了,教授就会给予认可,你就保留这些单词。如果某个单词错了,教授就只修正那一个词,然后草拟员可以从那里继续下去。

来自印度理工学院孟买分校(IIT Bombay)的作者们发现,这种方法是一个游戏规则的改变者。通过让本地设备承担大部分猜测工作,并仅要求云端进行“检查作业”,他们成功地大幅减少了系统调用昂贵云端模型的次数。在测试中,他们展示了 SPADE 可以将云端调用的次数大幅削减 76%。这意味着 AI 运行得更快,使用成本也更低,然而——神奇之处在于——它生成的答案与云端教授从头开始逐字编写的答案一样准确。他们在各种任务(如新闻文章摘要和回答难题)上进行了测试,结果是一致的:该系统几乎与完整的巨型模型一样聪明,但效率却高得多。

论文明确反对那种认为你必须在速度和智慧之间做出选择的观点。你不需要屈就于一个缓慢但完美的云端模型,也不必接受一个快速但易出错的本地模型。相反,SPADE 证明了通过智能地分配工作,你可以两者兼得。研究人员对这些发现非常有信心,因为他们在多个真实世界的数据集上进行了测量。他们不仅仅是在猜测,而是通过数据证明了该系统在保持大模型高准确度的同时,显著降低了云端计算的时间和金钱成本。这是一个实用的、即插即用的解决方案,不需要重新训练 AI,为将强大、智能的 AI 带入日常设备且不至于耗尽预算提供了一条可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →