← 最新论文
🤖 machine learning

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS 引入了一种智能体化测试时扩展框架,其中 LLM 编排器动态控制整个推理过程——包括何时进行探索、使用哪种求解器以及如何综合答案——在多种基准测试中超越了固定工作流基准模型,同时显著降低了 API 调用成本。

原作者: Peijia Qin, Qi Cao, Pengtao Xie

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Peijia Qin, Qi Cao, Pengtao Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文 ATLAS: Agentic Test-time Learning-to-Allocate Scaling 的解释,采用了通俗易懂的语言和富有创意的类比。

核心理念:谁该当老板?

想象一下,你正在尝试解开一个非常困难的谜题。你有一支由聪明助手(AI 模型)组成的团队,他们可以尝试为你解决这个谜题。

旧方法(设计者工程化):
在过去,人类经理(“设计者”)必须在团队开始工作之前就制定好规则。经理会说:“好吧,大家,每个人尝试正好 5 次。然后,我们将选择出现次数最多的答案。”或者,“尝试直到你得到 90 分为止,然后停止。”
问题在于,人类经理并不知道这个谜题是简单还是困难。

  • 如果谜题很简单,要求尝试 5 次就是在浪费金钱和时间。
  • 如果谜题是不可能完成的任务,要求尝试 5 次同样是浪费,但现在你还花了更多的钱。
    AI 助手只是在听从命令;它们无法决定何时停止或如何工作。

新方法 (ATLAS):
这篇论文的作者引入了 ATLAS。ATLAS 不再是由人类经理设定僵化的规则,而是指派了一个 AI 助手来负责整个团队。这个“编排者”(Orchestrator)就是老板。

  • 编排者观察问题。
  • 它请求一名助手去尝试解决。
  • 它查看助手的答案。
  • 至关重要的是: 编排者会决定:“这个够好了吗?我需要再请另一位助手吗?我应该换一种类型的助手吗?还是我现在就应该停止并给出最终答案?”

AI 不再仅仅是在解决问题;它是在管理资源(时间与金钱)来解决问题。


它是如何运作的:“探索”按钮

把编排者想象成一名正在办案的侦探。它有一个名为**“探索”(Explore)**的单一工具。

  1. 侦探(编排者): 它坐在办公桌前,面前有一个卷宗(问题)。
  2. 行动(探索): 侦探按下按钮,派出一名全新的、独立的侦探去进行调查。
    • 重要提示: 新来的侦探从零开始。他们看不到之前侦探发现的内容。这确保了每个人都能给出真正独立的见解。
  3. 报告(观察): 新来的侦探带着答案、推理过程以及他们的信心程度回来。
  4. 决策: 主侦探阅读报告。
    • 场景 A: 答案看起来不太靠谱。侦探再次按下**“探索”**,以获取更多证据。
    • 场景 B: 三名侦探都使用了不同的方法并对同一个答案达成了一致。侦探说:“太好了,我们有了足够的证据,”然后按下**“停止”**。
    • 场景 C: 侦探们不断失败或给出荒谬的答案。侦探意识到:“用我们目前的工具无法解决这个案子,”于是停止工作以节省开支。

“动作空间”:给老板更多工具

论文表明,编排者拥有的工具越多,它的表现就越好。他们测试了三个版本:

  1. ATLAS(基础版老板): 编排者只能说“探索”或“停止”。它决定何时停止,但始终使用同一种类型的助手。
  2. ATLAS-MM(多功能工具版老板): 编排者还可以选择要派出的哪种助手。
    • 类比: 如果第一个助手是一名初级实习生且失败了,老板可以决定:“好吧,让我们派资深专家过来。”或者,“先派三个便宜的实习生,如果他们意见不一,我们就请出昂贵的专家。”
  3. ATLAS-MI(专注型老板): 编排者可以给助手一个特定的提示。
    • 类比: 如果前三个助手都犯了同样的错误,老板可以告诉下一个助手:“忽略第一部分,专门关注这个棘手的步骤。”

结果:更聪明的消费

研究人员在四种不同类型的硬核挑战上测试了这个系统:

  • 科学问题: (类似于研究生水平的物理或化学考试)。
  • 编程: (编写计算机程序)。
  • 视觉推理: (观察图像并回答相关问题)。

发生了什么?

  • 更高的准确率: ATLAS 比旧的“固定规则”方法获得了更高的分数。例如,在最难的科学问题上,它的正确率从大约 83% 提升到了 85.86%
  • 更便宜: 尽管它获得了更高的分数,但它实际花费的钱更少(更少的 API 调用次数)比其他方法。
    • 为什么? 因为旧的方法在简单问题上浪费钱(做了 5 次尝试,而其实 1 次就够了),也在不可能完成的问题上浪费钱(做了 5 次尝试,而其实 0 次就足够了)。ATLAS 在拥有足够证据时会精准停止。

秘密武器:“有状态的证据”

论文发现,ATLAS 之所以奏效,最大的原因在于 “有状态的证据管理”(Stateful Evidence Management)

  • 旧方法: 想象一个委员会,每个人都投票,但统计票数的人只看到最终的名字列表。他们不知道人们是如何投票的,也不知道他们在想什么。
  • ATLAS 方法: 编排者看到了整个故事。它看到了每一次思考、每一次尝试,以及助手给出答案背后的每一个理由。
    • 如果编排者看到两个助手对答案达成了一致,但使用的是相同的错误逻辑,它就知道这是一个陷阱,并会继续寻找。
    • 如果它看到一个助手给出了奇怪的答案,但有一个极其精彩且独特的解释,它可能会信任这个少数派意见,而不是仅仅看多数派。

总结

ATLAS 是一个让 AI 充当聪明经理的系统。它不再遵循僵化的剧本,而是观察它的团队,收集证据,并决定究竟何时停止工作以节省成本,以及何时继续工作以获得正确答案。它将“规模化”(使用更多计算能力)从一把钝重的铁锤变成了一把精密的解剖刀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →