← 最新论文
🤖 AI

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

本文介绍了 ExTS,一种新颖的树搜索策略,它通过判别式奖励塑造、随机虚拟子节点和质量条件分支,将扩展视为一种信息价值决策,从而优化了受预算约束的智能体搜索,与标准方法相比,在多种任务中实现了持续的性能提升。

原作者: Haoyang Fang, Bernie Wang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyang Fang, Bernie Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,出现了一类新的系统,它们不仅能回答问题,还能主动寻找解决方案。这些“智能体”(agentic)系统就像数字探险家,提出想法、测试想法,并一遍又一遍地优化其最佳猜想。无论是编写计算机代码、设计化学化合物,还是解决复杂的逻辑谜题,这些智能体都依赖于一个“生成与验证”的循环:它们创建一个候选方案,通过测试来观察其效果如何,然后利用反馈来创造更好的版本。然而,这个过程是昂贵的。每当系统生成一个新想法或运行一次测试时,它都会消耗一种有限的资源:计算预算。在许多现实场景中,这种预算非常紧张,仅允许进行几十次或几百次尝试,之后系统就必须停止。研究人员面临的核心挑战在于,如何明智地使用这笔有限的预算。如果系统将尝试浪费在死胡同里,它就无法找到最优解;如果它过于谨慎,它可能会错过就在极具前景的路径前方几步之遥的突破。

多年来,导航这些搜索树的标准方法一直是一种借鉴自游戏算法的策略,该策略平衡了两种相互竞争的本能:探索(exploration)与利用(exploitation)。探索意味着尝试未经测试的新路径以观察其是否具有潜力,而利用则意味着深入挖掘那些已经显示出良好结果的路径。传统方法对搜索树中的每一个新分支都保持一定程度的好奇心,通常在致力于任何单一路径之前,会先扩展所有可用的选项。当有充足的时间和资金去探索一切时,这种方法效果很好。但在现代 AI 智能体这种高风险、预算受限的世界里,这种“尝试一切”的方法往往会失败。它将有限的资源过度分散在宽而浅的树结构中,导致最有希望的想法无法得到充分开发。系统最终得到的是一张包含许多平庸方案的宽泛地图,而不是对少数优秀方案的深度理解。

为了解决这个问题,亚马逊 AGI(Amazon AGI)的研究人员引入了一种名为 ExTS 的新搜索策略。与其盲目地扩展每一个分支,这种新方法将创建新分支的决策视为一种精算的投资。它在花费任何预算之前都会问一个关键问题:创建一个新路径的潜在价值是否值得其成本?系统通过观察自身成功与失败的历史来实现这一点。如果某条推理线路产生了许多失败的尝试,系统就会学会停止扩展该路径,转而将精力集中在那些已经奏效的线条上进行深化。它有效地过滤掉了噪声,忽略了那些在旧系统中会消耗宝贵资源的死胡同。

研究人员在四个截然不同的领域测试了这种方法:优化语言模型的指令、生成计算机代码、从光谱数据中推导分子结构以及设计自动化工作流。在每种情况下,他们都给了新系统与旧方法相同的紧凑预算。结果是一致的。通过更聪明地决定在哪里花钱,新系统始终比为每个特定任务设计的专门方法找到了更好的解决方案。例如,在优化问答问题的提示词任务中,与之前的最佳方法相比,新方法的准确率提高了 10% 以上。在代码生成方面,它解决了更多困难的问题,找到了旧方法错过的解决方案。即使是在高度技术化的分子结构鉴定领域(即系统必须根据光谱特征推断分子的形状),新方法在相同尝试次数下也实现了更高的准确率。

这一成功背后的一个关键洞察是,新系统不仅看单次尝试的分数,还观察分数的模式。在许多这类任务中,好方案与卓越方案之间的差异非常微妙,分数可能彼此非常接近。旧方法难以分辨,将所有选项视为大致相等。新系统使用一种技术来放大这些微小的差异,使其能够区分出一个稍好的路径和一个真正优秀的路径。它还使用了“虚拟子代”(virtual child)的概念来模拟如果创建新分支可能会发生什么。通过对以往成功经验的采样,它可以在不实际消耗预算构建新路径的情况下,估算新路径的价值。如果模拟表明新路径不太可能取得成果,系统就会跳过它,转而深入研究已证实的路径。

研究人员还发现,并非所有的搜索问题都是相同的。有些任务容易频繁失败(大多数尝试都会导致错误),而有些任务则比较稳定。有些任务的分数会随着新发现而剧烈波动,而有些则保持稳定。新系统足够灵活,可以适应这些不同的景观。通过运行一个小型的初步测试来了解问题的性质,系统可以调整其策略以匹配特定任务的挑战。这种适应性使其能够在各种领域中表现出色,而无需为每个领域设计一套全新的设计。

这项研究表明,AI 智能体如何使用其计算预算,与其拥有的智能水平同样重要。通过将搜索过程重新设计得更具选择性,并对自身进展的质量保持更高觉察,系统可以用同样的努力实现显著更好的结果。这种方法为构建更高效的 AI 智能体提供了实践指南,使它们能够在不需要无尽计算能力的情况下解决复杂问题。研究结果表明,在未来,最有效的 AI 系统不一定是那些尝试最多的系统,而是那些准确知道哪些事情值得一试的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →