← 最新论文
🤖 machine learning

When Independent Sampling Outperforms Agentic Reasoning

本文表明,对于编程竞赛任务,将推理时计算资源分配给重复的独立采样(k-shot),即使在考虑提示缓存的情况下,也始终比基于代理的推理产生更优的准确率 - 成本和准确率 - 查询权衡。

原作者: Yihe Dong, Boris Shigida

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihe Dong, Boris Shigida

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一笔有限的资金,用于在迷宫中寻找隐藏的宝藏。你有两种主要策略可供选择:

  1. “深度思考者”(代理推理):你雇佣了一位非常聪明且执着的侦探。这位侦探进入迷宫,尝试一条路径,撞墙后感到沮丧,试图调试自己的地图,自言自语,并缓慢地完善其方法。他们可能会解开谜题,但会花费大量时间(和金钱)进行交谈、思考和回溯。
  2. “飞镖群”(独立采样):你雇佣了一百个不同的人,而不是只雇佣一名侦探。你给每个人一小笔钱,并告诉他们:“进去,猜测路径,如果卡住了就停止。”你不让他们互相交流或修正错误。你只是向问题抛出大量独立的猜测。

该论文的重大发现:
普林斯顿大学的研究人员在竞争性编程问题(如 Codeforces 上出现的数学和逻辑谜题)上测试了这两种策略。他们发现,策略 2(飞镖群)几乎总是获胜

即使他们给“深度思考者”大量资金进行深度思考,“飞镖群”仍以更低的成本解决了更多问题。

为什么“深度思考者”在此处会失败?

论文解释说,竞争性编程问题就像自包含的谜题。它们有特定且正确的答案,规则清晰。

  • 侦探的陷阱:“深度思考者”(代理)经常陷入循环。它尝试一个解决方案,失败,尝试“调试”它,再次失败,并不断调整同一个想法,却从未意识到整个方法都是错误的。它将预算浪费在无成效的优化上。这就像一个人试图通过反复拧紧同一颗螺丝来修理一块坏掉的手表,而不是意识到他们需要一块新手表。
  • 飞镖群的优势:“飞镖群”(k-shot)依赖于探索。因为每个人都是独立猜测,所以飞镖群更有可能在早期就偶然发现那条唯一幸运且正确的路径。它不会浪费时间修正错误;它只是不断尝试新的、全新的想法。

“每次成功的成本”指标

作者不仅关注谁解决了最多的问题,还关注效率。他们提出了一条关于如何分配预算的简单规则:

不要问:“这个方法有多聪明?”
要问:“失败的成本是多少,以及它失败的频率有多高?”

他们从数学上证明,如果你有一笔固定预算,最大化成功几率的最佳方式是找到那种能提供**最低“每美元对数失败可能性”**的方法。

用通俗的话来说:如果一次快速的猜测成本较低且有一定成功几率,你就应该反复进行这种猜测。你不应该为了那些仅略微提高成功几率的漫长复杂过程而额外花费金钱。

核心结论

  • 对于软件工程(修复大型代码库中的错误):“深度思考者”非常出色,因为问题错综复杂,环境复杂,你需要与文件和工具交互才能解决问题。
  • 对于竞争性编程(解决逻辑谜题):“飞镖群”更胜一筹。这些问题就像孤立的数学方程。你不需要侦探去与墙壁对话;你只需要尝试足够多的不同方程,直到有一个奏效。

总之:当你拥有有限预算且面对自包含的谜题时,不要过度思考。与其支付高昂费用进行一次性深度调查,不如向问题抛出大量廉价且独立的猜测。该论文表明,在这种特定情境下,独立尝试的数量往往胜过深度推理的质量

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →