X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative Decoding
本文提出了 X-CoSD,这是一个通信高效且无损的协作式投机解码框架,通过引入混合重采样以及一种服务器重采样结合设备验证的变体,实现了设备与服务器之间具有异构词表的分布式大语言模型推理,从而在不损害输出质量的前提下显著加速了 Token 生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能领域,最强大的工具是大型语言模型——这些庞大的数字大脑能够编写代码、创作故事并解决复杂问题。然而,这些模型运行起来既沉重又缓慢,通常需要远离用户的庞大服务器。为了让它们运行得更快,研究人员开发了一种称为“投机采样”(speculative decoding)的技术。想象一下这样一个团队:一名反应迅速、轻量级的助手起草几句话,然后由一位资深专家立即进行检查。如果助手的草稿正确,团队就会快速推进;如果助手错了,专家就会纠正错误。这种协作使得系统生成文本的速度远快于专家独自工作时的速度。然而,为了让手机与远程服务器之间实现这种协作,它们必须使用完全相同的语言,甚至精确到它们所识别的特定词汇表和符号。在现实世界中,不同的设备往往使用不同的词典,这造成了一道障碍,此前阻碍了这种快速协作的顺畅运行。
首尔大学的研究团队通过一个名为 X-CoSD 的新框架解决了这一障碍。他们的工作针对了一个特定的瓶颈:当手机和服务器的词汇表不一致时,每当发生错误时,服务器都必须向手机发送大量数据,使整个过程变得极其缓慢。研究人员设计了一个系统,允许手机和服务器即使在词典不匹配的情况下也能进行协作,且不会牺牲写作质量或响应速度。他们证明了该方法在保留强大的服务器模型原有的智能水平的同时,极大地减少了需要在互联网上传输的数据量。
问题的核心在于这些模型如何处理错误。当服务器检查手机的草稿并拒绝一个“标记”(token)时,它必须提供一个新的、正确的选项。在以往试图解决词汇不匹配的尝试中,服务器会向手机发送其完整的概率图——即它可能选择的下一个词的所有列表。这就像老师每当学生写错一个单词时,都要把整本教科书发给学生一样。这极其低效,尤其是在无线网络环境下,发送大量数据既耗时又耗电。研究人员意识到,手机只需要看到它与服务器共同认可的词汇,再加上一点点额外的信息,以处理仅服务器知道的词汇。
为了解决这个问题,团队引入了一种称为“混合重采样”(hybrid resampling)的方法。服务器不再发送完整的可能性词典,而是仅发送出现在手机和服务器共同词汇表中的词汇的概率。它还会发送一个单一的数值,代表服务器特有词汇所占的权重。凭借这些有限的信息,手机可以从数学上决定是选择来自共享列表的词汇,还是请求服务器从其特有列表中挑选一个词。如果手机选择的是共享列表中的词,这个过程会瞬间完成。如果服务器需要挑选一个特有词,它只需传回那一个词,而不是整个选项列表。这种方法确保了最终输出保持完美准确,与强大的服务器独立生成的结果完全一致,但避免了以往会导致系统卡顿的大规模数据传输。
研究人员通过一个增强版本 X-CoSD-E 进一步提升了效率。在这种设置下,当错误发生时,服务器首先向手机发送少量候选替换词。手机立即检查这些选项。如果其中一个足够好,过程就会在此停止,不再发送任何数据。只有当手机拒绝了所有初始候选词时,服务器才会发送较大的概率列表。这种“先试几个”的策略意味着在大多数情况下,系统都能完全避免沉重的数据传输。团队在各种任务上进行了测试,包括机器翻译、新闻摘要总结以及数学问题求解,并使用了不同的手机模型和服务器模型。
结果表明,这种新方法的效果与强大的服务器模型单独工作时一样出色,保持了相同的高质量文本生成。同时,它显著减少了往返传输的数据量。在实验中,特别是在互联网连接较慢或数据传输受限的情况下,该系统生成标记的速度明显快于以往处理不同词汇表的方法。研究人员发现,通过仔细管理发送的信息内容及其发送时机,可以保持协作的无缝衔接。这项工作证明,即使参与其中的设备并不说完全相同的语言,高速、协作式的人工智能也是可能的,这为在日常设备上实现更高效、更易用的 AI 工具打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。