← 最新论文
🤖 machine learning

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

本文介绍了“草图与验证”(Sketch-and-Verify),这是一种面向小型代码模型的成本效益型推理时扩展策略,它通过枚举多样化的算法草图并用多个候选方案填充这些草图,其表现优于扁平采样,尽管其性能尚无法完全取代更强大模型层级的表现。

原作者: Shan Jiang, Zijian Yi, Chenguang Zhu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Shan Jiang, Zijian Yi, Chenguang Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图解决一个棘手的谜题,但只有一台小型、廉价的机器人来协助你。这台机器人速度快且成本低,但它有个坏习惯:当它尝试解决问题时,几乎总是选择同一种错误的思维方式。如果你让它尝试 100 次,它只会给你 100 个略微不同的同一错误答案的变体。

这正是论文《草图与验证》(Sketch-and-Verify)试图解决的问题。它提供了一种新方法,让这台小型、廉价的机器人能够解决更多问题,而无需升级为超级昂贵的大型机器人。

以下是该方法的运作原理,分解为简单步骤:

1. 问题:“老调重弹”

通常,当我们要求 AI 编写代码时,我们只是说:“尝试 100 次,然后给我最好的那个。”

  • 缺陷:如果 AI 的“默认”想法是错误的,让它尝试 100 次,就像要求一个人写出 100 个同一首糟糕歌曲的不同版本。你可能会改变歌词或节奏,但旋律仍然是错的。AI 会陷入“表面”变化的循环(例如更改变量名或格式),而从未尝试从根本上不同的方法。

2. 解决方案:“建筑师与建造者”

作者提出了一种名为草图与验证(Sketch-and-Verify)的两步流程。他们不是要求 AI 立即编写完整代码,而是将工作分为两个角色:

  • 步骤 1:建筑师(草图)
    首先,他们要求 AI 扮演建筑师的角色。他们说:“先不要写代码。只需列出 5 种完全不同的解决这个问题的方法。”

    • 示例:“策略 A:使用映射。策略 B:先对列表排序。策略 C:使用循环。”
    • 一旦 AI 选定一种策略,它就会绘制一个带有空缺的粗略“蓝图”(即草图)。蓝图包含主要结构(墙壁和屋顶),但将具体细节(油漆颜色、门把手)留作标记为 ?? 的空槽。
    • 为何有效:这迫使 AI 在开始构建之前停下来思考不同的路径。它确保 AI 探索不同的解决方案“街区”,而不是在同一个街区里原地打转。
  • 步骤 2:建造者(填充)
    现在,对于每个蓝图,AI 扮演建造者的角色。它填充 ?? 空槽以创建完整的程序。

    • 如果 AI 生成了 5 个蓝图(策略)并将每个填充 10 次,那么它现在就有 50 个完全不同的程序可供测试。
    • 由于蓝图各不相同,这 50 个程序在结构上是多样化的。它们不仅仅是同一想法的重写,而是真正不同的方法。
  • 步骤 3:检查员(验证)
    最后,他们通过测试运行所有这些程序。他们保留那些能运行的程序,并挑选出最好的一个。

3. 结果:廉价 vs. 昂贵

研究人员在名为**HumanEval+**的标准代码测试上,使用 Google Gemini AI 的三个版本对此进行了测试:

  • Lite:小型、廉价、快速的模型。
  • Flash:中型模型。
  • Pro:大型、昂贵、智能的模型。

主要发现

  1. 对于廉价机器人(Lite):“草图与验证”方法是一个转折点。

    • 如果仅仅让 Lite 机器人正常尝试 100 次(扁平采样),它解决了约 53% 的难题。
    • 如果采用草图与验证方法(生成 10 个蓝图并将每个填充 10 次),它解决了 79% 的难题。
    • 类比:这就像告诉学生:“不要就同一个主题写 100 篇论文。先为 10 个不同的主题写 10 个大纲,然后再填充内容。”这样学生能学到更多,并在付出相同努力的情况下获得更好的成绩。
  2. 对于昂贵机器人(Pro):该方法帮助不大。

    • Pro 机器人已经非常聪明,其“默认”想法通常是正确的。强迫它草拟不同的策略实际上会使其表现稍差,因为这分散了它对最佳直觉的注意力。
    • 规则:如果你拥有超级聪明的机器人,就让它深入思考(贪婪搜索)。如果你只有廉价的机器人,就使用草图与验证来迫使它进行创造性思考。

4. 核心结论

该论文认为,草图与验证是一种明智的方式,可以在你受限于较小、较便宜的 AI 模型时,更有效地利用额外的计算资源。

  • 它不是魔法:它不会让弱模型变得比强模型更强。如果你负担得起昂贵的"Pro"模型,直接使用它即可。
  • 它是一种策略:如果你必须使用廉价模型(由于预算或速度限制),那么这种方法是从中榨取额外性能的最佳途径。它能防止 AI 陷入死胡同,并迫使其探索不同的解决方案,就像人类的头脑风暴会议一样。

简而言之:不要只是要求 AI 更努力地尝试;要要求它尝试不同的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →