SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
本文提出了 SelfJudge,这是一种自监督方法,它利用目标模型本身训练判断验证器,基于语义保留性来验证推测解码候选项,从而在不依赖人工标注或真实标签的情况下实现更快且更具泛化能力的大语言模型推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图撰写一个长篇且复杂的故事,但时间紧迫。你拥有一位大师级作家(一个庞大而强大的 AI),它能写出完美的故事,但速度非常慢,因为它在写下每一个字之前都会仔细斟酌。你同时还有一位敏捷助手(一个更小、更快的 AI),它能极快地预测接下来的几个词,但有时会犯小错,或用略微不同的措辞。
旧方法:严苛的编辑
过去,为了加快速度,你会让敏捷助手提前写出一整段,然后由大师级作家进行检查。然而,这位大师级作家是一位严苛的编辑。如果助手写了“猫坐在垫子上”,而大师级作家认为应该是“猫正坐在垫子上”,这位严苛的编辑就会拒绝整个句子,并让助手从头开始。这浪费了大量时间,因为尽管措辞略有不同,但含义完全一致。
“裁判”构想:更灵活的编辑
研究人员最近尝试通过聘请一位“裁判”来解决这个问题。这位裁判会审视助手的用词,并判断:“这在大致含义上是否接近大师的风格?”如果是,就予以接受。这很棒,但有一个陷阱:要训练这位裁判,你需要让人类坐下来,手动标注成千上万句话,说明“是的,这个词可以”或“不,这个词不对”。这既缓慢又昂贵,且仅适用于那些有明确对错答案的任务(如数学或编程)。它在创意写作或一般性问题(没有唯一“正确答案”)上效果不佳。
新方案:SelfJudge(自我训练的裁判)
本文介绍了SelfJudge,一种无需人类参与即可训练裁判的新方法。
其工作原理如下,借助一个简单的类比:
- 自我测试:不求助于人类,而是让大师级作家(目标模型)充当自己的老师。
- “假如”游戏:系统选取大师级作家写出的一个句子,将其中的一个词替换为敏捷助手建议的另一个词。
- 原文:“猫正坐在垫子上。”
- 替换后:“猫坐在垫子上。”
- 信心核查:随后,大师级作家自问:“这个改动是否改变了故事的含义?我是否仍对句子的其余部分感到确信?”
- 如果大师级作家回答:“不,含义未变,我依然确信”,系统就将该词替换标记为可接受。
- 如果大师级作家回答:“哇,这改变了含义”,则将其标记为拒绝。
- 训练裁判:通过自动执行此过程数千次,系统会生成一个包含大量“可接受”与“不可接受”词汇的数据集。随后,它训练一个极小、超快的“裁判”来识别这些模式。
结果
现在,当敏捷助手进行写作时,这个微小的裁判可以立即判断:“是的,这个词没问题,即使它不是大师级作家会选的那个词,因为含义得到了保留。”
为何这很重要
- 通用性:与以往仅适用于数学或编程(可检查最终答案)的方法不同,SelfJudge 适用于任何任务——创意写作、新闻摘要或回答一般性问题——因为它关注的是含义,而不仅仅是“正确”答案。
- 快速:这个微小的裁判极其轻量,几乎不会为流程增加任何时间。
- 准确:论文表明,该方法显著加快了写作过程(接受了更多来自助手的词汇),同时并未使最终故事的质量变差。
简而言之,SelfJudge教会 AI 信任自身关于哪些词“感觉”正确的直觉,使其能够跳过缓慢、严苛的检查过程,在保持质量的同时大幅提升写作速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。