← 最新论文
💬 NLP

Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution

本文提出了名为"Squeeze Evolve"的统一多模型编排框架,通过按需分配不同成本模型的计算资源以解决无验证器进化中的多样性与效率瓶颈,在显著降低 API 成本并提升吞吐量的同时,实现了多项基准测试上的新最优性能,甚至媲美基于验证器的进化方法。

原作者: Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, T
发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SQUEEZE EVOLVE(挤压进化) 的新方法。为了让你轻松理解,我们可以把它想象成一家**“超级高效的创意工作室”**的运作模式。

🌟 核心问题:为什么现在的 AI 进化太贵、太慢?

想象一下,你想让 AI 解决一个超级难的数学题或设计一个复杂的图案。

  • 传统方法(单一模型进化): 就像你雇佣了一位世界顶级的诺贝尔奖得主(昂贵的模型)来反复思考、修改、再思考。虽然这位大师很厉害,但他太贵了!而且,如果让他一直重复同样的思考路径,他可能会陷入思维定势,想不出新花样(这叫“多样性崩溃”)。
  • 带验证器的方法: 就像请了一位严厉的考官在旁边,每写一步就检查对错。但这在现实中往往行不通,因为有些问题(比如核聚变研究)根本没有现成的“标准答案”可以检查,或者请考官的成本比请大师还高。

结果就是: 要么烧钱烧不起,要么想不出好点子。


💡 SQUEEZE EVOLVE 的解决方案:聪明的“团队分工”

SQUEEZE EVOLVE 的核心思想很简单:“好钢用在刀刃上,便宜的人做基础活。”

它不再只雇佣一位“诺贝尔奖得主”,而是组建了一个混合团队

  1. 大师(昂贵模型): 负责最关键的起步和最难的部分。
  2. 实习生(便宜模型): 负责大量的草稿、修改和整理。
  3. 智能调度员(路由机制): 负责决定哪部分工作交给谁。

🎨 生动的比喻:写小说的“主编与编辑团队”

想象你要写一本畅销书(解决难题):

  1. 起步阶段(初始化):

    • 做法: 你请大师(昂贵模型)来构思故事大纲和第一章。
    • 原因: 就像盖房子,地基打不好,后面再装修也没用。论文发现,起步的质量决定了最终的上限
  2. 进化阶段(迭代修改):

    • 做法: 故事写了几章后,你不需要每次都请大师来改。
    • 智能调度: 系统会检查每一章的“自信度”。
      • 如果这一章大家意见很统一,或者内容很简单(比如只是润色一下句子),调度员会直接把它交给实习生(便宜模型)去改。这就像让实习生去整理文档,成本极低。
      • 如果这一章大家意见分歧很大,或者逻辑很混乱(比如剧情卡住了),调度员会立刻把这一章交给大师来深度思考。
    • 结果: 你只在大脑最累、最需要智慧的时候花钱,其他时候用低成本方案。
  3. 多样性保护(防止思维僵化):

    • 如果只用一个模型,它可能会反复写出相似的故事(多样性崩溃)。
    • SQUEEZE EVOLVE 混合了不同性格的“作者”(不同模型)。有的擅长逻辑,有的擅长发散。这种**“混血”**团队能保证故事(解决方案)始终丰富多彩,不会陷入死胡同。

🚀 它带来了什么惊人的效果?

论文在数学、编程、视觉推理甚至科学发现(比如“圆堆积”问题)上做了测试,结果非常亮眼:

  1. 省钱(成本降低 3 倍):

    • 以前解决一个问题可能要花 17 美元,现在只要 7 美元。就像你以前请大师写全书,现在只请他写大纲和关键章节,其他交给实习生,省下的钱能买好几杯咖啡
  2. 提速(效率提升 10 倍):

    • 在同样的预算下,以前只能处理 1 个任务,现在能处理 10 个。因为大部分时间都在用便宜的“实习生”干活,速度快且便宜。
  3. 甚至更强(效果超越):

    • 在 ARC-AGI-V2(一个极其难的抽象推理测试)上,它用 7.74 美元就拿到了 97.5% 的准确率,而之前最好的方法(需要代码执行和昂贵模型)要花 11.77 美元,准确率还略低。
    • 在科学发现任务中,它是第一个在没有外部“考官”验证的情况下,就能达到甚至超过那些有验证器方法的成果。

🌍 总结:为什么这很重要?

这就好比**“技术民主化”**。
以前,只有大公司才用得起最聪明的 AI 来探索科学难题。SQUEEZE EVOLVE 告诉我们:不需要最贵的模型,只需要最聪明的“用工策略”。

它把昂贵的“超级大脑”和便宜的“普通大脑”完美结合,用最少的钱,办最大的事。这不仅让 AI 变得更便宜、更快,还让它能在没有标准答案的领域(如科学研究)里,像真正的科学家一样去“进化”和“发现”。

一句话总结: SQUEEZE EVOLVE 就是给 AI 进化装上了一个**“智能省钱开关”,让昂贵的大脑只在关键时刻出手,让便宜的大脑处理日常琐事,最终实现了“花小钱,办大事,甚至办成大事”**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →