VIA-SD: Verification via Intra-Model Routing for Speculative Decoding
该论文提出了 VIA-SD,一种多层投机解码框架,它利用模型内路由来部署一个精简子模型,用于验证中等置信度的草拟标记(draft tokens),从而降低拒绝率,并在无需修改训练的情况下,相比现有方法实现显著的推理加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图写一个长篇且复杂的的故事,但你有两位编辑:一位是速度极快的实习生,另一位是大师级编辑。
在大型语言模型(LLM)的世界里,“大师级编辑”是那个庞大、超级聪明、能生成高质量文本的模型,但它运行起来非常缓慢且昂贵。“速度极快的实习生”是一个微型、快速的模型,它可以快速猜测下一个词,但也会犯错。
旧方法:“全有或全无”的检查
传统上,当实习生猜出一个句子时,大师级编辑必须对其进行检查。
- 如果大师级编辑表示赞同,太棒了!实习生的猜测被接受。
- 如果大师级编辑表示不同意,实习生的猜测就会被丢弃,然后由大师级编辑从头开始重新编写整个句子。
这就像一个严厉的老板,会说:“如果你不是100%完美,那我就要把整个任务全部亲自动手重做。”这浪费了很多时间,因为大师级编辑经常不得不重做那些其实已经“差不离”对的工作。
新想法:“中层管理人员”
这篇论文引入了一个名为 VIA-SD 的新系统。它意识到,实习生的许多猜测并非一塌糊涂;它们只是“还可以”或“挺好”。它们并不需要动用大师级编辑的全部力量来修复。
因此,VIA-SD 在实习生和大师级编辑之间加入了一个中层管理人员(称为“精简验证器”)。这个中层管理人员是大师级编辑的一个特殊版本,因为它通过“路由”(即选择大模型中的特定部分)构建而成,所以更加轻量且快速。
这个新的三步流程如下运作:
- 轻松获胜: 实习生猜出一个词。如果这个词显然是正确的,系统会立即接受它。无需任何人检查。
- “足够好”区域: 如果实习生的猜测有些拿不准,中层管理人员就会介入。与其拒绝这个猜测并要求大师级编辑从头开始,不如由中层管理人员快速地修复或改写这个词。这就像一位资深团队成员,可以在不需要 CEO 批准的情况下,对草稿进行微调。
- 困难案例: 只有当中层管理人员也感到非常困惑时,系统才会最终请出大师级编辑来进行繁重的体力活。
“路由”技巧
他们是如何构建这个中层管理人员的呢?他们并没有从头开始训练一个全新的模型。相反,他们通过关闭(跳过)大师级编辑内部的一些层,创造出了一个“精简版”。
把大师级编辑想象成一座拥有 50 条组装线的巨大工厂。中层管理人员就是同一座工厂,但只运行其中的 25 条线。它更快了,但因为它使用相同的蓝图和工具构建,所以它依然能完美理解这项工作。论文使用了一种智能搜索方法(称为 DIMR),来确定究竟保留哪 25 条线,以达到速度与准确性的最佳平衡。
为什么这很重要
论文声称,通过加入这个中层管理人员:
- 更少的拒绝: 该系统拒绝的猜测更少。它不再丢弃“还可以”的工作,而是快速将其修复。
- 更快的速度: 因为大师级编辑被调用的次数减少了,整个过程比以往的方法快了 10% 到 20%,并且比标准解码快了高达 3 倍。
- 无需额外训练: 这个系统可以直接配合现有模型使用,无需重新训练它们。它只是改变了模型在实际使用过程中验证答案的方式。
简而言之,VIA-SD 不再将每一个错误都视为一场灾难。它不再采用“通过或失败”的二元制系统,而是创建了一个分层系统:让“差不离正确”得到快速修复,而只有真正破碎的部分才会获得那个庞大、缓慢模型的全力关注。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。