← 最新论文
🤖 machine learning

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin 是一个数据高效的半监督强化学习框架,它通过建模全局特征分布来区分正确和错误的展开(rollouts),使其能够通过有效地利用未标记实例,在仅使用 10% 标注数据的情况下超越全监督模型。

原作者: Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名才华横溢但缺乏经验的学生(即 AI)如何解决复杂的数学问题。你手头有一大堆练习题,但你只有其中极少数题目的标准答案。

问题所在:

  • 昂贵的方法: 如果你想让学生完美地学习,你需要每一道题都有标准答案。这就像雇佣一个专家导师团队来批改每一份家庭作业。这种方法很准确,但成本极高且极其耗时。
  • 偷懒的方法: 你可以让学生进行自我批改,规则是:“如果我觉得很有信心,那我就是对的。” 但学生往往会对错误答案过度自信。如果你让他们在没有纠错的情况下练习自己的错误,他们最终会开始相信荒谬的理论。这被称为“模型崩溃(Model Collapse)”——学生会变得越来越差,因为他们只是在不断强化自己的错误。
  • 中间地带(以往的方法): 一些方法尝试利用你拥有的那少量标准答案来引导学生。它们说:“只练习那些看起来与我们已知答案的题目完全一致的题目。” 问题在于,这种方法过于严苛。它丢弃了 87% 的优质练习题,因为这些题目看起来并不与你仅有的几个例子“完全一致”。这就像一位老师拒绝让学生练习一种新的数学题型,仅仅因为这种题型看起来与教科书里的例题略有不同。

解决方案:GeoMin(“几何指南针”)
作者提出了一种名为 GeoMin 的新方法。GeoMin 不仅仅是观察答案,它还观察学生大脑内部思考过程的形状

以下是它的工作原理,使用一个简单的类比:

1. “大脑地图”(几何分布)

想象学生的脑海是一个巨大的房间。每当他们解决一个问题时,都会在房间的特定位置留下一个“脚印”。

  • 正确答案倾向于在特定的区域留下脚印(我们称之为“北”区)。
  • 错误答案则会在另一个区域留下脚印(我们称之为“南”区)。

在最开始时,学生处于困惑状态,脚印在中间乱成一团,杂乱无章。

2. 第一阶段:绘制地图(监督锚定)

首先,GeoMin 提取那小部分带有已知答案的题目(有标签数据),并让学生去解决它们。

  • 它观察脚印落下的位置。
  • 它在“北”区(正确区)和“南”区(错误区)之间画出一条清晰的边界线。
  • 核心秘诀: 它会特别关注那些落在边界线上的脚印(“边界样本”)。这就像教练在喊:“嘿,你刚才离做对就差一点点!让我们针对这个特定的动作进行练习!” 这让正确与错误思维之间的界限变得更加锐利。

3. 第二阶段:指南针(半监督挖掘)

现在,学生开始处理那堆没有答案的庞大题目(无标签数据)。

  • 与其问“这个答案看起来是否像我们已知的那些答案?”,GeoMin 问的是:“这个学生思考过程的‘形状’是符合‘北’区还是‘南’区的?”
  • 即使答案是全新的,如果学生的内在“脚印”与“北”区一致,GeoMin 就会知道:“这是一个好的练习题,尽管我们还没有它的标准答案。”
  • 它使用一个智能过滤器(一种被称为“高斯混合模型”的东西,其实就是一个聪明的分类机器)来自动挑选出最符合“北”区模式的题目,并忽略掉那些看起来像“南”区错误的题目。

结果
通过使用这个“几何指南针”,GeoMin 能够找到并利用其他方法会丢弃掉的 89% 的有价值练习题。

  • 效率: 它取得了比使用所有标准答案进行训练更好的效果,但它仅使用了 10% 的标准答案就达到了这一目标。
  • 速度: 由于它不再浪费时间在坏数据上,也不需要漫长的“预热”阶段来摸索方向,它的训练速度比之前的最优方法快了 两倍

简而言之:
GeoMin 不再试图死记硬背答案,而是开始学习正确思维的几何结构。通过理解正确解法的“形状”,它可以自信地引导 AI 完成数千个新问题,而无需人类为每一个问题进行人工批改。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →