← 最新论文
🤖 machine learning

Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting

BASTION 是一种无需训练且感知预算的推测解码框架,它通过自适应最佳优先扩展动态构建查询依赖的树结构,以在草稿质量与硬件约束之间取得平衡,在实现比标准自回归解码高达 6.61 倍加速的同时,其表现优于现有的块扩散基线。

原作者: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位非常睿智但极其缓慢的编辑(即目标模型)合作撰写故事。每当你写下一个字,都必须等待这位编辑阅读、思考并给出“绿灯”后,才能继续写下一个字。这就是当前 AI 聊天机器人的工作方式:它们逐字生成,每一步都要等待一次“检查”。这种方式准确,但慢得令人痛苦。

为了加速这一过程,研究人员会使用一个草稿模型(一位更快但智慧稍逊的助手)在编辑检查之前,先猜测接下来的几个字。如果编辑认可这些猜测,你就可以一次性写出多个字,从而跳过等待时间。

然而,最新的、最快的草稿模型(称为块扩散)存在一个陷阱。它们不是逐字猜测句子,而是同时“喊出”一整块字词。问题在于,由于它们是同时喊出的,因此并不总能确定这些字词在逻辑序列中如何相互衔接。这就像一位厨师将一堆食材一次性扔在柜台上;单独看,每样食材都不错,但如果你只随手抓起最上面那一个,最终可能会得到一道怪异且毫无意义的菜肴。

BASTION 是一个新系统,旨在解决这一混乱局面,并使整个过程变得闪电般迅速。以下是其工作原理,使用简单的类比来说明:

1. “可能性之树”(而非单一路径)

旧的方法会采纳草稿模型的“喊声”,挑选出单个“最佳”字词,接着再选下一个“最佳”字词,并寄希望于好运。如果那条路径被证明是错误的,编辑就必须拒绝整个结果,导致时间浪费。

BASTION 则不同。想象一下,草稿模型不再只给你一条路径,而是提供了一棵可能性的家族树

  • 在第一步,它会说:“下一个词可能是‘猫’(80% 的概率)或‘狗’(20% 的概率)。”
  • BASTION 不会只挑选‘猫’,而是构建一棵微小的树:一条分支代表‘猫’,另一条代表‘狗’。
  • 接着,对于下一个词,它会从‘猫’和‘狗’两者再次分叉延伸。
  • 突然间,你便拥有了从同一出发点生长出来的、由潜在句子组成的微小森林。

2. “智能园丁”(预算感知控制器)

这里是棘手之处:你无法让森林无限生长。编辑(目标模型)对一次性能检查的分支数量有限制。如果你让树长得太宽或太深,检查这棵树所花费的时间就会超过逐字生成的时间。

这就是 BASTION 的**“智能园丁”**发挥作用的地方。

  • 预算:园丁确切地知道编辑有多少时间(即“预算”)。
  • 策略:园丁不是将树生长到固定大小(例如“总是 10 个分支”),而是审视每个分支的置信度。
    • 如果某个分支看起来非常有希望(高置信度),园丁就会让它生长得更深。
    • 如果某个分支看起来较弱,园丁就会停止在该处生长。
  • 停止信号:园丁不断自问:“再增加一个分支是会增加速度,还是仅仅会浪费时间去检查死胡同?”一旦检查新分支的成本超过其收益,园丁就会停止生长,并将这棵树发送给编辑。

3. “速度计”(硬件感知)

不同的计算机(GPU)就像不同的汽车。跑车(强大的 GPU)可以非常快速地检查巨大的树。而紧凑型轿车(较弱的 GPU)面对同样的树可能会力不从心。

BASTION 内置了一个速度计,它能确切知道你的特定计算机有多快。它不是凭空猜测,而是测量在你的机器上验证特定大小树所需的时间。它利用这些实时数据,来决定你的特定配置下树应该有多大,从而确保你在不过载计算机的情况下获得最大速度。

结果

通过结合这些理念,BASTION 实现了论文所称的6.61 倍加速

  • 标准 AI:写 1 个字,等待,写 1 个字,等待。(速度:1 倍)
  • 旧式快速方法:猜测几个字,但经常卡在错误的路径上。(速度:约 2-3 倍)
  • BASTION:生长出一棵智能的、自定义大小的猜测树,检查最有希望的路径,并在效率最高时精确停止。(速度:约 6.6 倍)

简而言之,BASTION 就像是 AI 写作的智能项目经理。它不是盲目猜测或构建僵化的结构,而是动态地构建一棵灵活且大小完美的“选项之树”,使其与计算机的速度完美匹配,从而确保 AI 在不出错的前提下尽可能快地写作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →