← 最新论文
💻 computer science

Divergence Decoding: Training-Free Capability Fusion

Divergence Decoding 是一个无需训练的框架,它通过使用 Jensen-Shannon 散度来自适应地路由标记生成,从而将专业化模型的领域专长与通用模型的逻辑推理进行动态融合,进而使在科学基准测试上的表现超越了单模型基线。

原作者: Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有两位才华横溢的朋友,他们即将参加一场极其困难且复杂的考试。其中一位朋友,我们称她为“专家”,她背下了化学教科书中的每一个事实。她知道每一个分子的名称以及反应的精确公式。然而,她有时会过于专注于细节,以至于忘记进行逻辑思考,在解决复杂谜题时会在步骤上出错。另一位朋友,“通才”,则是逻辑和推理的高手。他能够推导出解决几乎任何问题的步骤,但他并不了解具体的化学名称或事实;如果遇到从未见过的成分,他可能会猜错。

长期以来,科学家们一直试图在这两位之间做出选择。如果你需要回答一个化学问题,你通常必须二选一。但如果能让他们实时协作呢?如果让“专家”来撰写答案,而让“通才”站在她身边,实时低声提醒:“等等,这一步逻辑不对,”并在必要时介入修正呢?这就是一种被称为**“分歧解码”(Divergence Decoding)**的新方法的核心思想。这是一种将专家的深度知识与通才的敏锐逻辑融合在一起的方法,且无需教给他们任何新知识,也不需要对他们进行共同训练。


问题:“聪明但笨拙” vs. “逻辑强但无知”的困境

在人工智能领域,我们有两种主要的“大脑”。首先是通用大语言模型(LLMs)。它们就像互联网上的百科全书,擅长推理、遵循长链逻辑并从错误中恢复。它们几乎可以谈论任何话题。另一方面是领域专家模型。它们是真正的专家,在科学(如化学或生物学)方面经过了专门训练。它们比任何人都更了解专业术语和事实。

问题在于,两者单独使用都不完美。通用模型可能推理完美,但因为缺乏特定事实而导致科学性错误。专家模型虽然掌握事实,但往往会丢失逻辑思路,在复杂的解释过程中犯下低级错误。科学家们想知道:我们能否在计算机思考的瞬间将这两者的优势结合起来,从而获得两全其美之效?

解决方案:“JS 门控”与“草拟与校验”之舞

来自北京大学及其他机构的论文作者提出了一种巧妙的、无需训练的技巧,称为**“分歧解码”(Divergence Decoding)**。你可以把它想象成一场由两人进行的、带有转折的高速版“传声筒”游戏。

通常,当计算机生成文本时,它是一个词一个词地预测下一个词。在这种新方法中,“专家”(化学专家)占据主导地位。它会像快速记录句子的作者一样,“草拟”出领先于当前的几个词。但在这些词被正式写下之前,“通才”(逻辑专家)会对它们进行检查。

神奇之处在于:系统不仅仅询问“通才是否同意这个词?”,而是询问:“他们的想法有多不同?”它使用了一个名为 Jensen-Shannon (JS) 散度的数学工具。你可以把它看作是一个“分歧度量计”。

  • 低分歧(绿灯): 如果专家和通才对下一个词的想法几乎一致,系统就假设专家是正确的。它接受这个词并继续向下进行。这保证了科学事实的准确性。
  • 高分歧(红灯): 如果两个模型的预测完全不同,系统会将此视为警告信号。这意味着专家可能即将犯下一个逻辑错误。在这种情况下,系统会立即将控制权切换给通才,由通才选择一个更好的词来确保逻辑不偏离轨道。

这个过程在单个词(token)层面发生,每秒钟进行数千次,形成了一场无缝的对话:专家提供事实,而通才提供安全网。

研究发现:“A + B > A”效应

研究人员在一些极难的化学和科学谜题上测试了这个想法,包括 ChemBenchChemCo-TBenchGPQA 等基准测试。他们将不同的模型(如 Qwen 和 Llama 系列)进行配对,以观察这种“融合”是否奏效。

结果令人兴奋。组合后的系统(分歧解码)表现始终优于单独的专家模型或单独的通用模型。

  • 在涉及分子理解和编辑的化学任务中,融合模型的得分高于单独工作的任一模型。
  • 例如,在一项名为“环系统骨架”(识别分子中复杂的环结构)的任务中,融合模型达到了 0.70 的得分,超过了专家的 0.58 和通才的 0.67
  • 在极具挑战性的 GPQA(研究生水平的谷歌无法搜索类问答)化学问题中,融合模型的准确率达到了 37.50%,而专家仅为 15.28%,通才为 23.61%

这表明,通过让两个模型协作,它们创造出了一个比各自部分都更聪明的“超级大脑”。

魔法发生的“何时”与“何处”

论文还仔细观察了这种切换发生的时间点。他们发现,系统主要在回答的起始阶段(前 0% 到 25% 的文本)进行干预。这是推理路径正在建立的阶段。如果专家在早期就开始走错逻辑路径,通才就会介入纠正方向,防止错误扩散。

有趣的是,被替换掉的词通常不是那些硬核科学术语(如“苯”或“催化剂”),而是连接词和逻辑短语(如“因此”、“然而”或“一旦识别出这些特征”)。这说明通才的主要职责是保持故事的逻辑连贯,而专家负责填充事实

它不是什么(以及它不是什么)

需要注意的是,这种方法不是“投机采样”(Speculative Decoding)——这是一种常用于提高 AI 速度的技术。投机采样试图通过预测下一个词来提高速度,同时假装是一个单一模型。而分歧解码并不关心速度,它关心的是质量。它通过主动改变答案来使其变得更好,即使这意味着计算机需要思考得更久。

此外,论文指出,之所以有效,是因为这两个模型犯错的类型不同。当它们产生分歧时,通常意味着专家在逻辑上遇到了困难,而不是通才感到困惑。系统利用这种分歧作为切换模式的信号。

总结

分歧解码是一种构建更聪明 AI 的新方法,无需花费数月时间去训练一个新的、庞大的模型。它只需将一名专家和一名逻辑学家放在一起,让他们相互交流,并使用一个“分歧度量计”来决定谁该接下来的发言。研究结果表明,这种简单的、无需训练的技巧可以创造出一个比任何单一模型都更可靠、更准确的系统,为构建更好的科学探索 AI 工具提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →