← 最新论文
💬 NLP

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR 是一个自我博弈框架,它通过让大语言模型交替扮演教师和学生的角色,在无需外部标注的情况下生成并解决新颖问题,从而使其能够持续提升推理能力,并在数学和通用推理基准测试中实现持续的性能增益。

原作者: Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的学生,他已经背下了图书馆里所有的数学教科书。他非常擅长解决标准问题,但已经遇到了瓶颈。因为他停止了学习新知识,只是在不断练习旧有的练习题,所以他无法再进步了。

这就是 OpenSIR 这篇论文试图解决的问题。

问题所在:“学习的回音壁”

目前的 AI 模型(例如驱动 DeepSeek-R1 或 OpenAI o1 的模型)通常使用带有可验证奖励的强化学习 (RLVR) 进行训练。这就像一个学生在参加标准化考试,由人类教师为每一个答案评分。

  • 瓶颈: 你需要数以千计的人类标注样本(即老师批改试卷)来完成这项工作。
  • 极限: 一旦学生掌握了人类策划的测试内容,他们就会停止进步。他们无法超越“人类水平”,因为他们只能从人类已经记录下来的内容中学习。

一些研究人员尝试了自我博弈 (Self-Play),即 AI 与自己对弈来学习。想象一下一位棋手在与自己的克隆体对弈。

  • 失败原因: 之前的自我博弈方法在面对高级模型时失败了。为什么?因为 AI 会不断生成它已经掌握的同类问题。这就像一个学生只会反复练习乘法表,却从未尝试过代数或微积分。他们陷入了“熟悉概念”的循环中。

解决方案:OpenSIR(“好奇心驱动的师生”)

作者引入了 OpenSIR(开放式自我进化推理器)。这是一个框架,其中单个 AI 模型同时扮演两个角色:教师学生

你可以把它想象成一个人既是健身教练又是运动员,但有一个特别的转折:他不断尝试发明新的锻炼方案,这些方案既要有足够的挑战性,又不至于难到无法完成。

以下是这个循环的步骤:

1. 种子(火花)

你从一个极其简单的问题开始,比如“1 + 1 等于几?”这是你唯一需要的人类输入。

2. 教师的任务(发明新的挑战)

AI(扮演教师的角色)观察这个简单的种子,并尝试发明一个新的数学问题。

  • 陷阱: 如果没有引导,教师只会一遍又一遍地发明“2 + 2 等于几?”和“3 + 3 等于几?”。
  • 解决方法(多样性奖励): OpenSIR 会给教师发放“额外积分”,只要它创造的问题与它之前见过的所有内容都不同。这就像一位厨师,如果能发明出一种使用从未组合过的食材的新菜肴,就会获得奖金。这迫使 AI 去探索新的数学概念(如微积分、概率论或最优化理论),而不是重复算术。

3. 学生的任务(解决挑战)

AI(扮演学生的角色)尝试解决教师发明的新问题。

  • 陷阱: 如果教师发明了一个太难或有缺陷的问题(例如缺少数字),学生就无法解决,从而导致学习无法进行。
  • 解决方法(难度校准): OpenSIR 会检查问题是否“恰到好处”。它使用一个“可解性评分”。如果问题太简单,它就很枯燥;如果问题太难或有缺陷,它就是无用的。系统只奖励那些具有挑战性但可解的问题。

4. 循环(协同进化)

教师和学生共同学习。

  • 随着学生解决问题的能力增强,教师被迫发明更难、更复杂的题目,以获取那些“额外积分”。
  • 随着教师发明复杂问题的能力增强,学生也学会了如何解决它们。
  • 他们互相推动对方进步,创造了一个无需人类进行任何批改的永恒学习循环。

为什么这很重要

论文在七个不同的数学基准测试和三个通用推理测试上进行了测试。结果如下:

  1. 击败了“人类评分”的基准线: OpenSIR 从一个微不足道的问题(“1+1”)开始。尽管它在训练过程中使用了个人类标注数据,但它的表现超过了使用超过 7,000 个人类评分样本进行训练的模型。
  2. 修复了“停滞”的模型: 之前的自我博弈方法实际上会让高级模型变得更差,或者根本没有帮助。OpenSIR 则持续提升了它们的性能。
  3. 泛化能力: 学习到的技能不仅仅局限于数学。因为 AI 被迫去探索多样化的概念,它在通用推理任务(如逻辑谜题)上也变得更加出色。

核心秘诀

论文发现两件事至关重要:

  • 多样性: 如果你移除了“对差异性的奖励”,AI 就会停止学习新事物,性能也会下降。
  • 校准: 如果你不检查问题的可解性,AI 会开始生成乱码,从而导致学习停止。

简而言之

OpenSIR 就像一辆自动驾驶汽车,它不仅仅是在从地图上学到的路线上行驶。相反,它会发明新的道路,检查这些道路是否可以通行,并在这些道路上学习驾驶,最终成为比任何人类教练所能教出的水平都要优秀的驾驶员——而这一切都不需要人类告诉它该往哪转。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →