← 最新论文
💬 NLP

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

本文介绍了进化前置提示优化(Evolutionary Pre-Prompt Optimization, EPPO),这是一种利用进化算法来选择少样本思维链(few-shot chain-of-thought)示例的方法,通过与朴素方法相比,在 GSM8k 和 MathQA 等基准测试上将数学推理性能显著提升了超过 10 个绝对百分点。

原作者: Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个聪明但有些困惑的学生(一个大型语言模型)如何解决复杂的数学问题。你不能重写这个学生的脑回路(你不能重新训练模型),相反,你必须在他们参加测试前给他们一份“小抄”或一组示例题目供其参考。这被称为少样本提示(few-shot prompting)

核心问题在于:哪些例子应该出现在那份小抄上?

大多数人只是随手抓取一些随机的例子,或者挑选看起来“难”的例子。本文认为,有一种更聪明的方法来挑选这些例子,这种方法受到了进化论的启发。

以下是他们发现的拆解,即 EPPO(进化式前置提示优化),使用了简单的类比:

1. 问题所在:“小抄”抽奖

通常,当我们希望 AI 解决数学问题时,我们会先给它几个类似的解题示例。

  • 旧方法: 人们通常只是随机挑选例子,或者手动挑选。这就像试图通过根据生日来挑选数字来赢得彩票一样。这有时会奏效,但并不可靠。
  • 论文的洞察: 示例的具体选择比拥有更多示例更为重要。事实上,给 AI 太多的例子实际上会干扰它(有点像为了准备考试而阅读 50 本不同的教科书,而不是专注于最好的 4 本)。

2. 解决方案:“适者生存”的小抄

作者创建了一个名为 EPPO 的系统。把它想象成一场烹饪比赛,目的是寻找完美的食谱,只不过他们混合搭配的是数学题,而不是食物。

  • 食材: 他们有一个包含数千个数学问题的巨大储藏室(“演示集”)。
  • 竞赛: 计算机挑选出一小组例子(例如 4 道题)放入“小抄”中。
  • 品尝测试: 它让 AI 使用这个特定的“小抄”来解决一系列练习数学题。
  • 进化:
    1. 如果 AI 表现出色,计算机就会保留那份小抄。
    2. 如果 AI 表现糟糕,计算机就会从储藏室中换出其中一两个例子。
    3. 它重复这个过程数千次,始终保留那些“最适应环境”(表现最好)的小抄,并丢弃差的。

随着时间的推移,系统会“进化”出一份精简且完美的示例集,使 AI 的表现显著提升。

3. 令人惊讶的发现:少即是多

论文中最有趣的发现之一是关于需要多少个例子

  • 常识认为: “例子越多 = 理解越好。”
  • EPPO 认为: “事实上,4 个例子通常是最佳平衡点。”

论文发现,当他们尝试使用 8 个、12 个或 16 个例子时,AI 的表现反而变差了。这就像试图通过阅读 20 遍同一篇演讲稿来背诵演讲;你可能会开始感到困惑或厌烦。AI 出现了“过拟合”,这意味着它过度记住了特定的例子,以至于无法将逻辑应用到新的、略有不同的问题上。这种“进化”方法自然地发现,一份由 4 个高质量例子组成的精简列表效果最好。

4. 为什么这很重要

  • 成本低且速度快: 我们不需要重新训练庞大的 AI 模型(这需要耗费巨额的电力和时间),我们只需要优化“小抄”。这就像是调校汽车引擎,而不是制造一辆新车。
  • 它擅长处理难题: 他们在非常困难的数学数据集(如高中和大学水平的数学)上进行了测试。仅仅通过改变小抄上的例子,AI 的得分就提高了 10 分以上。
  • 它具有鲁棒性: 即使例子是由 AI 自己生成的(而不是完美的真人编写),该系统仍然能找到让它们奏效的方法。这就像是发现一个学生的乱涂乱画的笔记其实是备考的最佳方式。

5. “神奇”的组合

论文还发现,当这种方法与**自一致性(Self-Consistency)**结合时,效果会更好。

  • 自一致性就像是要求 AI 将同一个问题解决 8 次,然后取出现次数最多的答案(类似于陪审团投票)。
  • 结果: 当你使用“进化式小抄”(EPPO)加上“陪审团投票”(Self-Consistency)时,AI 就变成了一个数学天才。这两种方法可以叠加使用,产生更出色的结果。

总结

论文表明,我们不需要改变 AI 的大脑来让它更擅长数学。我们只需要使用一种聪明的进化过程,来挑选出那最优秀的 4 个例子展示给它。这种“进化式前置提示优化”(EPPO)防止了 AI 因信息过多而产生困惑,并帮助它更有效地进行复杂问题的推理。

简而言之: 不要只是把随机的例子扔给 AI。让进化论来挑选最完美的几个,然后看着 AI 的数学技能飙升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →