← 最新论文
🤖 AI

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

虽然大语言模型可以有效地预测失败的一般风险,以证明升级到协作模式的正当性,但它们目前仍难以准确地确定哪种特定的协作协议(例如迭代自我修正、规划者-执行者-审查者,或多智能体审议)能为给定的推理任务带来最佳的成本性能权衡。

原作者: Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,新一代被称为“大语言模型”的计算机程序已经出现,它们能够解决曾经看似超出机器能力的复杂问题。这些系统通过预测句子中的下一个词来工作,但当面对高级数学等困难任务时,它们经常会出错。为了克服这一问题,研究人员开发了一种策略,允许计算机在单个问题上投入更多的时间和精力。系统不再是给出一个快速的答案,而是可以被指示去检查自己的工作、将问题分解为步骤,甚至模拟一个专家团队对解决方案进行辩论。然而,这种额外的努力是有代价的:它需要显著更多的计算能力,这转化为更高的成本和更长的等待时间。对于任何部署这些系统的人来说,核心挑战在于知道何时应该停止并直接给出快速答案,以及何时应该投入额外的资源以获得更好的结果。

来自阿贡国家实验室(Argonne National Laboratory)和俄勒冈州立大学(Oregon State University)的一个研究小组致力于解决这个特定的谜题。他们想知道人工智能是否可以扮演一名聪明的管理者,针对每个新问题决定是采用简单、廉价的尝试即可,还是需要一种更昂贵、协作式的方法。为了寻找答案,他们创建了一个大规模测试,其中包含超过4,000道竞赛级别的数学题。对于每一个问题,他们都让同一个计算机模型通过四种不同的工作方法运行。第一种方法是直接的一次性尝试。第二种方法允许模型纠正自己的错误。第三种方法涉及一个模拟团队,其中一部分负责规划方案,另一部分负责执行,第三部分负责审查工作。第四种方法让多个版本的模型在一起对答案进行辩论。通过让每个问题都经过每种方法运行,研究人员可以准确地看到哪种方法对特定问题效果最好,以及在以“Token”(模型努力程度的计量单位)衡量的计算成本方面表现如何。

结果揭示了管理这些系统时存在的惊人难度。研究人员发现,虽然计算机可以可靠地预测自己在简单尝试中可能失败的时机,但它很难预测哪种特定的、更昂贵的方法才值得投入额外的成本。当系统决定将问题升级到更复杂的方法时,它经常做出错误的决策。那些试图节省成本的保守策略经常在一些本可以通过稍多努力就能解决的问题上过早放弃。相反,那些试图用最强大方法解决所有问题的激进策略,则会在不需要它们的题目上浪费大量的资源。计算机可以判断自己是否不确定,但它无法准确判断一场团队辩论或一个自我纠错循环是否是合适的工具。

为了测试这是一个普遍问题还是仅限于数学领域,该团队将研究范围扩大到了生物学和普通科学问题。他们发现了同样的模式:使用更复杂方法的价值在很大程度上取决于任务的类型。有时,团队辩论是最好的方法;而有时,简单的自我纠错就足够了。这意味着没有适用于所有情况的单一规则。研究人员还测试了一种更简单的策略,即让计算机在开始前先评估自己的信心。如果它感到自信,就给出一个快速答案;如果不自信,则切换到一种稍贵一点的方法。这种方法在决定是保持简单还是升级时效果很好,但它仍然无法告诉系统应该选择哪种昂贵的方法。

这项研究得出结论,虽然我们在让计算机知道自己何时可能出错方面取得了进展,但我们尚未解决如何准确知道该使用哪种昂贵工具的问题。目前最好的方法是一种混合方案:利用计算机的自我信心来决定是坚持简单的答案,还是切换到更复杂的方法,但要接受“选择完美的复杂方法”仍是一个未解决的挑战。研究人员提供了一份关于这些成本和结果的详细地图,表明虽然我们可以构建出比随机猜测更好的系统,但那个能为每个问题完美平衡开支与准确性的、具备成本意识的理想管理者仍然遥不可及。未来的路径在于利用这些发现来构建更好的决策工具,并承认对于目前而言,最高效的路径通常是结合简单的信心检查,并接受在某些问题上仍会使用并不严格需要的昂贵方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →