← 最新论文
💬 NLP

SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks

SCOPE 是一个无需数据的自我博弈框架,通过让挑战者(Challenger)与求解者(Solver)在冻结的自我评判器(self-judge)驱动下进行协同演化,以生成并评分基于文档的任务,从而在无需依赖外部监督或人工策划提示词的情况下,显著提升了多种模型在开放式和短文本问答任务中的性能。

原作者: Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一名学生如何写出一篇优秀的研讨论文,但你既没有老师,也没有教科书,甚至连要问的问题清单都没有。你手里只有一座巨大的图书馆(互联网)和学生自己的大脑。

这就是 SCOPE 这篇论文试图解决的问题。通常情况下,为了训练 AI 执行复杂的、开放性的任务(如深度研究或创意写作),人类必须编写问题并为答案评分。但人类的速度慢、成本高且能力有限。

SCOPE 是一种无需任何人类帮助即可训练 AI 的新方法。它使用了一种“自我博弈”(self-play)的方法,类似于两个棋手通过互相对弈来提高水平,但这里有一个转折:他们玩的是一场关于**信息“捉迷藏”**的游戏。

以下是其运作方式,通过简单的角色进行拆解:

1. 三个角色

该系统创建了三个版本的同一个 AI 模型来扮演不同的角色:

  • 挑战者 (The Challenger - 测验大师): 这个 AI 的任务是根据它刚刚阅读的一份特定文档,创造一个刁钻的问题。它必须让问题足够难,使得另一个 AI 不能仅凭记忆就能猜出答案,但又不能难到完全无法回答。
  • 求解者 (The Solver - 侦探): 这个 AI 的任务是回答挑战者提出的问题。为了做到这一点,它必须回到图书馆,寻找线索,阅读文档,并将信息拼凑起来得出答案。它不能只依赖已有的知识;它必须寻找新的证据。
  • 裁判 (The Judge - 严格的评分员): 这是一个被冻结、不发生变化的原始 AI 副本。它从不学习也不改变。它的唯一工作是查看源文档和问题,然后编写一份特定的“评分标准”(即一份核查清单,说明一份好答案应该具备哪些特征)。随后,它根据这份清单为求解者的回答评分。

2. 游戏循环:它们如何变得更强

这种神奇之处发生在由三个步骤组成的循环中:

  1. 挑战阶段: 挑战者阅读一份文档并发明一个问题。它试图寻找一个“甜点位”:一个难度适中的问题——既要足够难到能难住当前的求解者,又不能太难。如果问题太简单,求解者会立刻拿到 A;如果太难,求解者则会彻底失败。挑战者希望求解者能经历一些挣扎,这样它才能学习。
  2. 调查阶段: 求解者得到问题。它不知道答案。它必须搜索图书馆,阅读多份文档,并综合信息来撰写响应。
  3. 评分阶段: 裁判查看源文档和问题,然后编写一份特定的清单(评分标准)。例如,如果问题是关于一艘沉船,评分标准可能会写道:“答案必须提到船长决定驶入风暴的决定” 以及 “答案必须提到安全管理方面的失败”。裁判随后根据这份清单为求解者的回答评分。

“顿悟时刻”:
关键的技巧在于,挑战者裁判能看到源文档,但求解者却看不到。求解者只能看到问题。这迫使求解者学会如何有效地搜索以找到缺失的信息。

如果求解者变得更擅长搜索,挑战者就必须变得更聪明,从而提出更难的问题。如果挑战者变得更擅长提问,求解者就必须变得更擅长搜索。它们“协同进化”,将彼此推向更高的技能水平,就像两名运动员一起训练一样。

3. 为什么这意义重大

  • 无需人类教师: 大多数 AI 训练依赖于人类编写数以千计的问题和答案。SCOPE 直接从原始文档中生成所有的训练数据。
  • 擅长“模糊”任务: 之前的自我博弈方法仅适用于有唯一正确答案(如 2+2=4)的数学或代码任务。对于开放式任务(如“写一个故事”或“分析一个历史事件”),并没有单一的标准答案。SCOPE 利用裁判的评分标准来为这些模糊的任务评分,从而使 AI 能够改进其创意和重研究型的工作。
  • 行之有效: 论文在三种不同的 AI 模型上测试了这一点。尽管它们仅在这些自生成的开放式任务上进行训练,但在以下方面取得了显著进步:
    • 深度研究: 从多个来源寻找并结合信息。
    • 创意写作: 写出更好的故事和文章。
    • 简短问题: 出人意料的是,它们在从未专门训练过的简单事实核查问题上也表现得更好。

“秘诀”所在

论文发现,为了让这套机制奏效,挑战者必须保持变化。如果你冻结挑战者而只让求解者学习,求解者很快就会掌握那些简单的题目并停止进步。挑战者必须不断发明新的、难度略高的谜题,以保持求解者的警觉。

此外,裁判需要足够聪明,能够编写出一份好的清单(评分标准)。如果清单过于模糊,求解者将学不到任何东西。如果清单基于文档中的事实且非常具体,求解者就能准确知道自己需要寻找什么。

总结

SCOPE 就像是一个 AI 的自动运行健身房。与其由人类教练告诉 AI 该做什么,不如让 AI 自己设计锻炼计划(挑战者)、完成锻炼(求解者),并为自己的动作评分(裁判)。通过不断用恰到好处的难度来挑战自己,AI 学会了如何比仅靠人类策划的数据更好地进行研究、推理和写作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →