← 最新论文
🤖 machine learning

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

本文提出了 GeoRA(几何感知低秩适配)方法,通过利用 RLVR 更新子空间的各向异性结构并采用 SVD 初始化低秩适配器,在保留预训练几何结构的同时实现了高效训练,从而在数学、医疗和编程等 RLVR 任务中显著优于现有基线模型。

原作者: Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 GeoRA 的新方法,专门用来给大型人工智能(AI)模型“打补丁”,让它们变得更聪明,特别是擅长数学、编程和医疗推理等复杂任务。

为了让你轻松理解,我们可以把训练 AI 模型想象成教一个已经很有学问的“老教授”学习一项新技能(比如解奥数题)。

1. 背景:老教授遇到了什么难题?

现在的 AI 模型(比如 Qwen 或 Llama)就像那位“老教授”,在预训练阶段已经读遍了天下书,掌握了基础常识。现在,我们要用一种叫 RLVR(带可验证奖励的强化学习)的方法,教他做具体的数学题或写代码。

  • RLVR 的特点:它不像传统的“死记硬背”(监督微调 SFT),而是通过“做题 - 给分 - 改错”的循环,让模型自己摸索出解题思路。
  • 痛点
    • 全量微调(Full Fine-Tuning):相当于让老教授把整个大脑重新装修一遍。虽然效果好,但太费钱、太慢,而且容易把老教授原本的知识(比如历史、文学)给忘了(这叫“灾难性遗忘”)。
    • 现有的“小补丁”方法(如 LoRA, PiSSA):为了省钱,大家通常只修改模型里很少一部分参数(就像只给老教授换一副眼镜或改几个笔记)。
      • 问题:现有的方法(如 PiSSA)是专门为“死记硬背”设计的,它们喜欢修改模型里“最重要”的部分(主成分)。但 RLVR 这种“摸索式学习”发现,真正有用的修改往往发生在那些“不起眼”的角落,而且不能破坏老教授原本的知识结构。如果强行修改“重要”部分,就像给老教授换了一副度数不对的眼镜,反而让他看东西更模糊了。
      • 稀疏微调:有些方法试图只改零散的参数,但这在现在的电脑硬件上跑得很慢,就像用一把生锈的剪刀剪布,效率很低。

2. GeoRA 的解决方案:给老教授配一副“智能导航眼镜”

GeoRA 的核心思想是:既要改得准,又要改得稳,还要跑得快。

它用了三个巧妙的比喻:

① 寻找“最佳修改区”(几何感知)

想象老教授的大脑里有一张复杂的地图。

  • 传统方法:直接往地图上最显眼、最拥挤的“市中心”(主成分)动土,结果把交通搞乱了。
  • GeoRA 的做法:它先拿放大镜(数学上的 SVD 分解)仔细扫描地图,发现 RLVR 这种学习方式,其实是在地图上那些**“既稳定又有弹性”的特定区域**(低秩子空间)进行微调。
  • 操作:GeoRA 专门在这些“最佳修改区”里找方向,而不是盲目地乱改。

② “锚定”策略(冻结残差)

这是 GeoRA 最聪明的地方。

  • 传统做法:改完就改完了,老教授可能走着走着就忘了自己是谁。
  • GeoRA 的做法:它把老教授原本的知识(预训练权重)像**“锚”**一样死死固定住(冻结)。
    • 它只允许在“锚”旁边加一个小小的、可移动的“浮标”(低秩适配器)来学习新知识。
    • 好处:无论浮标怎么动,老教授的核心知识(锚)都不会漂移。这保证了模型在学新技能时,不会忘记旧知识(比如学数学时不会忘记怎么聊天)。

③ 硬件友好(密集计算)

  • 稀疏微调的尴尬:就像试图用“点状”的笔在纸上写字,电脑硬件(GPU)不擅长处理这种零散的点,导致速度很慢。
  • GeoRA 的优势:它虽然只改了一小部分参数,但它是整块整块地改(低秩矩阵),就像用“印章”盖章一样。这种操作对电脑硬件非常友好,速度飞快,而且省内存。

3. 实验结果:老教授真的变强了吗?

作者用了很多不同大小的模型(从 15 亿参数到 320 亿参数)做了测试,包括数学、医疗和编程任务。

  • 做题更准了:在数学竞赛(AIME)和编程(HumanEval)测试中,GeoRA 的成绩通常比现有的其他“小补丁”方法都要好,甚至接近“全量微调”的效果。
  • 没忘本:在测试那些它没专门学过的领域(比如让学数学的模型去回答常识问题),GeoRA 表现得非常稳定,没有像其他方法那样出现“学新忘旧”的情况。
  • 更稳更快:GeoRA 在训练过程中不容易“发疯”(崩溃),而且对超参数的设置不那么挑剔,就像给老教授配了一副更稳的眼镜,不用天天调焦。

总结

GeoRA 就像是给 AI 模型设计了一套“智能导航系统”:

  1. 它知道哪里该改(利用几何结构找到最佳学习区,避开雷区)。
  2. 它知道怎么保护(用“锚”锁住核心知识,防止遗忘)。
  3. 它跑得快(利用硬件友好的计算方式,省钱省力)。

这项研究告诉我们,在让 AI 学习复杂推理能力时,“怎么改”比“改多少”更重要。GeoRA 通过尊重模型原本的结构,实现了既高效又稳定的进化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →