← 最新论文
🤖 machine learning

From Reasoning to Code: GRPO Optimization for Underrepresented Languages

本文提出了一种群相对策略优化(GRPO)框架,该框架通过整合执行驱动反馈,增强了大语言模型在 Prolog 和 Lisp 等代表性不足编程语言中的代码生成与推理能力,从而有效克服了训练数据稀缺的局限。

原作者: Federico Pennino, Bianca Raimondi, Massimo Rondelli, Andrea Gurioli, Maurizio Gabbrielli

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Federico Pennino, Bianca Raimondi, Massimo Rondelli, Andrea Gurioli, Maurizio Gabbrielli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心难题:“稀有语言”的鸿沟

想象一下,你正在教一位天才学生(人工智能)如何编写代码。这位学生在 Python 或 JavaScript 等流行语言方面是大师,因为它们有数百万本书籍和示例供其阅读。

然而,当你要求这位学生用 PrologLisp(较旧的、基于逻辑的语言)编写代码时,他们却感到吃力。为什么?因为这些语言就像稀有的方言。可供 AI 阅读的书籍(训练数据)非常少。如果没有足够的示例,AI 就开始猜测。它可能会写出看起来正确但实际上无法运行的代码,或者编造出不存在的规则。

解决方案:通过“做”来学习(而不仅仅是阅读)

这篇论文的作者决定停止试图给 AI 喂更多的书。相反,他们教导 AI 通过试错来学习,并使用一位能立即检查工作的“教练”。

他们使用了一种名为 GRPO(组相对策略优化)的方法。这就像一场烹饪比赛:

  1. AI 被要求解决一个数学应用题。
  2. 不是只给出一个答案,AI 同时尝试烹饪四种不同的解决方案
  3. 一位“裁判”(计算机解释器)运行所有四个解决方案。
  4. 裁判给出评分:“这个完美运行(+1 分)”,“这个有语法错误(-0.5 分)”,或者“这个给出了错误答案(-1 分)”。
  5. AI 学习哪种“食谱”效果最好,并尝试在下次多制作这类食谱。

秘密武器:“推理收缩”问题

起初,研究人员试图用标准规则来教导 AI。他们告诉 AI:“不要偏离你通常的说话方式太远。”这就像一位严厉的老师告诉一个有创造力的学生:“要死守课本上的例子。”

他们发现了一个他们称之为**“推理收缩”**的问题:

  • 发生了什么:AI 变得不敢深入思考。它开始给出非常简短、简单的答案,这些答案看起来安全,但实际上是错误的。它不再尝试解释其逻辑,因为害怕犯错。
  • 解决方法:研究人员移除了那位“严厉的老师”(一项名为 KL 惩罚的技术规则),并添加了一条新规则:“告诉我你的故事。” 如果 AI 在给出代码之前写出了更长、更详细的思考过程,他们就会给它额外的分数。

结果:从“一般”到“大师”

通过让 AI 思考更长时间,并消除偏离常态的恐惧,结果非常显著:

  • 黑马获胜:一个较小的 AI 模型(70 亿个“脑细胞”)通过这种新方法训练后,在解决逻辑谜题方面变得比更大、更著名的模型(如 700 亿个细胞的模型)更出色。
  • 成功率翻倍:对于最难的逻辑任务,AI 的成功率翻了一番以上。
  • 适用于其他语言:他们在 Lisp(另一种稀有语言)上测试了这种方法,效果同样显著。AI 从“还可以”变成了“卓越”。

类比:“解释器”即老师

通常,AI 从人类编写的示例中学习。但对于稀有语言,没有足够的人类示例。
这篇论文的突破在于使用计算机解释器本身作为老师

  • 想象一下你在学习杂耍。与其观看大师杂耍的视频,不如你一直尝试杂耍。
  • 如果你掉了球,地板(解释器)会告诉你:“哎哟,失败了。”
  • 如果你让球保持在空中,地板会说:“干得好!”
  • AI 不是通过死记硬背一本书来学习语言规则,而是通过感受计算机的“地板”告诉它什么行得通、什么行不通。

总结

这篇论文表明,对于困难且稀有的编程语言,你不需要更大的 AI 或更多的书籍。你只需要一种更聪明的练习方式:让 AI 尝试多种解决方案,让计算机立即评判它们,并鼓励 AI 详细地梳理其步骤。这将一个 struggling 的学生转变为顶尖的优等生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →