← 最新论文
🤖 machine learning

Adaptive Generate-Rank-Verify: Inference-Time Search with Costly Verification

本文介绍了 ADAP,一种自适应推理时间算法,它通过动态采样和排序候选项,在廉价奖励评分与昂贵验证之间实现高效平衡,在单调性假设下,于数学推理和代码生成等任务中实现了接近最优的成本性能。

原作者: Shaddin Dughmi, Mahdi Haghifam, Yusuf Hakan Kalayci

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaddin Dughmi, Mahdi Haghifam, Yusuf Hakan Kalayci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正试图破解一个谜团,但你手头有两种截然不同的工具,而且使用它们都需要花钱。

工具:

  1. “直觉”(奖励模型): 这是一种廉价、快速但有时不可靠的直觉。它可以审视嫌疑人并说:“这个人看起来有罪!”或者“这个人看起来无辜!”询问它的成本几乎为零,但它会犯错。
  2. “测谎仪”(验证器): 这是一种昂贵、缓慢但 100% 准确的测试。它能确切地告诉你嫌疑人是否有罪。但每次使用它,都需要花费巨资(就像一笔巨大的实验室检测账单)。

问题:
你有一份嫌疑人名单(由人工智能生成的候选答案)。你需要找出那个“有罪”的人(正确答案)。

  • 如果你对每个人都使用测谎仪,你会破产。
  • 如果你只相信直觉,你可能会抓错人。
  • 旧的方法是采用固定规则:“我会让直觉评估 100 个人,然后对排名前 5 的人使用测谎仪。”
    • 缺陷: 有些谜团很简单(有罪者显而易见),所以你浪费了钱去检查 100 个人。而有些谜团很难(有罪者深藏不露),只检查 5 个人是不够的,导致你失败了。你无法用同一条固定规则应对所有案件。

解决方案:"ADAP"(自适应侦探)
这篇论文的作者创造了一种名为ADAP的智能策略。ADAP 不像死守固定规则,它更像是一位能边行动边学习的侦探。

以下是 ADAP 的工作原理,使用一个简单的类比:

“外壳”策略

想象你正在 haystack(干草堆)里找一根针,但你不知道干草堆有多大。

  1. 从小开始: ADAP 首先只让廉价的“直觉”评估少数几个嫌疑人。
  2. 排序: 它将它们从“最可能有罪”到“最不可能”进行排列。
  3. 首次检查: 它对排名第一的嫌疑人使用昂贵的“测谎仪”。
    • 成功了吗? 太好了!停止并庆祝。
    • 失败了吗? 好吧,排名第一的嫌疑人是无辜的。
  4. “外壳”扩展: 由于第一次检查失败了,ADAP 意识到:“这个谜团比我想象的要难。”它不会放弃,而是加倍努力。
    • 它让“直觉”评估更多的新嫌疑人。
    • 它重新排列整个堆栈(旧的和新的)。
    • 它对新的前几名嫌疑人使用测谎仪。
  5. 重复: 如果仍然失败,它就再次加倍努力。它不断以“外壳”(层)的形式扩大搜索范围,规模越来越大,直到找到答案。

为什么这很出色?

  • 对于简单案例: 如果答案显而易见,ADAP 能迅速找到它,只需极少的检查。它节省了大量资金。
  • 对于困难案例: 如果答案深藏不露,ADAP 会持续寻找直到发现它。它不会像固定规则那样过早放弃。
  • 结果: 平均而言,ADAP 的花费比旧的“固定规则”方法少得多,同时仍能 100% 地找到正确答案。

“单调性”规则(秘密武器)

为了让 ADAP 发挥作用,有一个重要的假设:直觉必须大体上是正确的。
论文假设,如果直觉说某个嫌疑人“非常可能有罪”,那么他们实际上比直觉说“稍微可能”的人更可能有罪。它不需要完美,只需要大致顺序正确。如果直觉完全是随机的,ADAP 就无法工作。但在现实世界(数学问题和编程)中,直觉通常能相当好地对事物进行排序。

论文证明了什么

作者们不仅仅是猜测这会奏效;他们通过数学计算进行了证明。

  1. 理想场景: 他们首先设想了一位确切知道每个嫌疑人有罪概率的侦探。他们计算了解开谜团所需的绝对最低成本。
  2. 现实世界: 他们证明了 ADAP 在不知道未来的情况下,其成本可以控制在“完美”成本的常数倍以内。用通俗的话说:ADAP 几乎和拥有水晶球的侦探一样好,但它不需要水晶球。
  3. 结构的必要性: 他们还证明,如果直觉完全是混乱的(毫无规律),没有任何策略能高效运作。你需要那种“分数越高 = 越可能正确”的模式来节省资金。

现实世界测试

团队在两项困难的任务上测试了这种方法:

  1. 数学问题: 解决棘手的数学题。
  2. 编程: 编写能通过隐藏测试的计算机程序。

结果:

  • ADAP 100% 地找到了正确答案。
  • 旧固定方法(检查固定数量的人)要么未能找到答案,要么为了获得相同的结果,花费了3 到 5 倍的资金。
  • 即使与一种试图预先猜测问题难度的“智能”方法相比,ADAP 的表现也与之相当或更好,而且不需要任何先验知识。

总结

这篇论文介绍了一种使用人工智能的智能自适应方法。它不再盲目地生成固定数量的答案并检查固定数量的答案,而是根据具体问题的难度动态调整其投入。通过保持灵活性,它节省了巨大的计算能力(和资金),确保你不会在简单任务上过度支出,也不会在困难任务上投入不足。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →