← 最新论文
🤖 AI

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

本文提出了Tandem,这是一个协作框架,其中大型语言模型充当战略协调者以生成关键见解,从而指导更小、更高效的模型执行完整推理,进而在保持数学推理和代码生成等任务的高性能的同时,将计算成本降低约40%。

原作者: Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Tandem:大小语言模型协同高效推理》的通俗解读,辅以生动的类比。

核心难题:“过度思考者”

想象你有一位才华横溢、世界级的教授(即大语言模型LLM),他能解决极其复杂的数学难题。然而,这位教授有个习惯:在给出答案之前,他会先写出一篇 5000 字的长文,详尽解释每一个念头、每一个曾考虑的死胡同,以及每一处微小的计算。

虽然答案通常正确,但这个过程既缓慢昂贵。这就像聘请一位大师级建筑师去建造一个简易的鸟屋,结果他却花了三天时间绘制蓝图、计算木材密度,并撰写木工史,直到最后才钉下第一颗钉子。

另一方面,你有一位敏捷、精力充沛的学徒(即小语言模型SLM)。他们速度快且成本低,但如果直接让他们回答难题,他们往往会猜错或陷入困境。

解决方案:"Tandem"团队

作者提出了一种名为Tandem( tandem 意为“ tandem 自行车/ tandem 协作”)的新工作模式。与其让教授独自承担所有工作,或让学徒盲目猜测,不如让他们在导师 - 实习生的关系中协同工作。

以下是"Tandem"系统的运作方式:

1. 导师提供“作弊条”(而非整本书)

大模型(导师)不会撰写整篇长文。相反,它会快速生成一份紧凑的“作弊条”,包含四个关键要点:

  • 目标:我们实际上要解决什么问题?
  • 规划:高层策略是什么?
  • 检索:我们需要哪些具体事实或公式?
  • 行动:前几步逻辑步骤是什么?

这就像教授递给学徒一张详细的地图和指南针,而不是亲自替他们开车。

2. 实习生负责驾驶

小模型(实习生)利用这份“作弊条”承担繁重的工作。因为手握地图,它不会迷路。它驾驶车辆(生成推理步骤)抵达终点,其速度和成本效益远优于教授独自完成。

3. “停止信号”机制(成本感知判断)

这是系统最智能的部分。系统并非盲目遵循“总是让教授讲 5 分钟”这样的规则。

相反,小模型内置了一个置信度计。在读取导师的提示时,它会检查自身的内部状态:

  • “我是否理解得足够透彻,足以完成工作?”
  • “我是感到困惑,还是充满信心?”

如果小模型感到自信(低“熵”或不确定性),它会举起停止信号。导师立即停止发言,由小模型完成答案。如果小模型仍感困惑,导师则只需再提供一点点指导。

结果:更快、更省、更聪明

该论文在复杂的数学问题和代码生成任务上测试了此方法。结果如下:

  • 最佳平衡点:由“大脑”(32B 模型)和“小脑”(7B 模型)组成的团队,其解题效果优于单独使用“大脑”。
  • 节省成本:在实现更高准确率的同时,他们节省了 40% 的算力(和资金)。
  • 神奇迁移:“置信度计”(决定何时停止的分类器)是在数学问题上训练的。令人惊讶的是,它在代码问题上同样表现优异,无需重新训练。这就像一位在纽约学会在红灯前停车的司机,无需新课程就能立即在东京的红灯前停车。

为何这很重要

该论文指出,我们无需强迫最大、最昂贵的 AI 模型执行每一个思考步骤。通过让它们充当战略指导者,而让更小、更便宜的模型负责执行,我们可以兼得两者之长:既拥有大模型的深度推理能力,又具备小模型的速度与效率。

简而言之:不要要求 CEO 去整理文件。请 CEO 撰写备忘录,然后让高效的助理去整理文件。"Tandem"系统自动化实现了这种完美的分工。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →