← 最新论文
🤖 machine learning

G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero 是一个无需验证器的协同进化框架,它通过利用内在的“提示-δ\delta"奖励来训练提议模型生成具有挑战性的查询和提示,随后生成模型通过直接偏好优化(DPO)从这些内容中学习,从而绕过外部评判者的局限性,实现开放式的语言模型自我改进。

原作者: Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢的学生(即生成器),他渴望变得更聪明,却被困在一个没有老师、没有教科书、也没有答案钥匙的房间里。通常,学生要学习,需要一位老师指出:“错了,试试这个。”如果没有老师,学生可能只会猜测,或者陷入不断重复同样错误的困境。

这篇论文介绍了一种让 AI 模型在没有人类教师或外部“评判者”打分的情况下学习的新方法。他们将此系统称为G-Zero

以下是其工作原理,使用一个简单的类比:

两个角色:“教练”与“学生”

G-Zero 并非只有一位孤独的学生,而是利用两个 AI 模型在循环中协同工作:

  1. 生成器(学生):这是我们要改进的模型。它尝试回答问题。
  2. 提议者(教练):这是第二个模型,其职责是找出学生的薄弱环节,并思考如何帮助他们。

秘密武器:"Hint-δ"(火花)

自学习的最大难题是:如果没有答案钥匙,模型如何知道自己正在进步?

G-Zero 通过一个巧妙的技巧Hint-δ解决了这个问题。其过程如下:

  1. 挑战:教练(提议者)提出一个棘手的问题和一个提示
  2. 测试:学生(生成器)尝试在没有提示的情况下回答问题。我们称之为“挣扎答案”。
  3. 转变:然后,学生再次尝试,但这次带有提示。我们称之为“顿悟答案”。
  4. 测量:系统测量学生大脑中的“冲击”或转变。提示是否让学生突然更好地理解了答案?
    • 如果学生原本就很出色,提示不会带来太大变化。(低分)
    • 如果提示毫无用处,学生也不会产生太大变化。(低分)
    • 最佳点:如果问题很难,提示恰好是学生解锁答案所需的关键,学生的大脑会发生剧烈转变。这将产生高分。

类比:想象你正在尝试解一道谜题。

  • 如果你能轻松解开,提示的帮助不大。
  • 如果提示是胡言乱语,你依然无法解开。
  • 但如果你卡住了,而有人低声说出了恰好缺失的那块逻辑拼图,你的大脑会发出“咔哒”一声!这个“咔哒”声就是Hint-δ。它证明了提示是有价值的,且问题具有挑战性。

训练循环:他们如何变得更好

该系统分两个阶段反复运行:

阶段 1:教练变得更擅长发现弱点。
当教练找到一个难住学生的问题,并提供一个能解决该问题的提示时,它会得到奖励。教练学会不再提出简单的问题,也不再给出糟糕的提示。它学会去搜寻学生的“盲点”。

阶段 2:学生从“顿悟”时刻中学习。
学生被展示成对的答案:“挣扎答案”(被拒绝)和“顿悟答案”(被选中)。学生被训练去偏好使用了提示的那个版本。

  • 魔力:随着时间的推移,学生学会了提示的风格逻辑。最终,学生能够不再需要提示就能生成那些高质量的答案。学生已经将教练的指导内化了。

为什么这很重要

  • 无需外部评判者:通常,AI 需要人类或非常聪明的 AI 来说:“这个答案很好。”这设定了一个上限;AI 永远无法变得比评判者更聪明。G-Zero 完全移除了评判者。AI 根据自己理解的变化程度来自我评判。
  • 适用于创造性任务:以前的方法仅在数学或代码(有明确的对错答案)上有效。G-Zero 适用于开放式任务,如写故事、提供建议或聊天,这些任务没有单一的“正确答案”。
  • 自我提升:论文表明,经过仅仅两轮这样的循环,模型在数学、编程和写作方面都有了显著提升,即使它们最初没有任何外部数据。

潜在问题(局限性)

论文指出,教练与学生之间的这场“军备竞赛”有时会出错。如果教练变得过于刁钻,学生可能会感到困惑,或者系统可能会崩溃(即“坍塌”)。他们还发现,该系统在过滤掉最简单和最难的示例、专注于“难度适中”的示例时效果最佳。

总结

将 G-Zero 想象成一辆自动驾驶汽车,它通过意识到“哇,当我这样看路时,我对转弯的理解要深刻得多”来学习如何开得更好。它不需要驾驶教练;它只需要注意到那些视角的微小变化带来理解大幅提升的时刻。通过追逐这些清晰时刻,AI 自我教导变得更为聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →