EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
本文介绍了 EvoLM,这是一种自监督后训练方法,它使语言模型能够通过交替生成实例特定的判别性评分标准并利用这些标准作为奖励来优化策略性能,从而在不依赖外部人工或模型监督的情况下实现更优越的结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一名学生(即策略模型)如何写出完美的文章。在旧方法中,你需要一位严格的老师(人类或超级智能 AI)来阅读每一篇文章、打分,并告诉学生他们哪里做错了。这种方法昂贵、缓慢,且受限于那位老师的智能水平。
EVOLM 是一种新方法,它让学生成为自己的老师,但有一个巧妙的转折。学生不再只是猜测什么是“好”文章,而是学会为每一篇他们写出的文章制定一份具体的检查清单(称为评分细则,Rubric)。
以下是该过程的运作方式,分解为简单的步骤:
1. 两个角色:撰写者与清单制定者
在这个系统中,同一个 AI 模型同时扮演两个角色:
- 撰写者(策略): 这部分负责生成问题的答案。
- 清单制定者(评分细则生成器): 这部分审视问题,并写出一套具体的规则(评分细则),用于评判答案。
这就像一位厨师,不仅烹饪菜肴,还在烹饪完成后写下食谱卡片,精确解释这道菜为何好或为何坏。
2. “时间旅行”反馈循环
系统如何知道检查清单是否有效?它不需要人类说“干得好!”相反,它利用时间旅行。
- 步骤 A: AI 今天写下一个答案。
- 步骤 B: 它回看几天前自己写下的答案(即“早期版本”的自己)。
- 步骤 C: 它假设新答案更好,因为 AI 一直在学习。
- 步骤 D: 清单制定者创建一套评分细则,用于评判这两个答案。
目标很简单:评分细则必须能够清晰地区分“新的、更好的”答案和“旧的、较差的”答案。 如果评分细则模糊,它就无法发现差异。如果评分细则敏锐且具体,它会给新答案打高分,给旧答案打低分。
3. 协同进化之舞
魔法就发生在这里。这两个角色轮流在循环中互相提升:
- 撰写者变得更强: 利用这些检查清单,撰写者学会生成更好的答案以获得更高的分数。
- 清单制定者变得更敏锐: 随着撰写者变得更强,旧答案相比之下显得更差。为了继续区分“好”与“卓越”,清单制定者必须编写更具体、更详细的规则。它不能只说“语法好”;它必须说“句子必须在引导性短语后使用逗号”。
随着时间的推移,检查清单从“让它有趣”这样模糊的标签,演变为“答案必须包含源自周长 48 的数字 144"这样具体、可验证的指令。
4. “小裁判”技巧
通常,你需要一个巨大、超级聪明的 AI 来给复杂的文章打分。但 EVOLM 使用一个微小的、冻结的 AI(一个小裁判)来进行实际评分。
因为清单制定者已经学会了编写如此具体、明确的规则(例如“检查单词‘创新’是否出现了两次”),即使是微小、简单的 AI 也能完美地遵循这些指令。这就像给一个小孩子一张非常具体的藏宝图:他们不需要成为侦探;他们只需要跟随地图即可。
为什么这很重要?
- 无需外部教师: 该系统不需要人类来批改成千上万篇文章,也不需要支付昂贵的 AI API 费用。它从自身的过往表现中创造自己的训练信号。
- 突破天花板: 如果你依赖人类教师,AI 永远无法超越那个人类。如果你依赖特定的 AI 教师,AI 就会停滞在那个教师的水平。而使用 EVOLM,AI 的“教师”(评分细则)会随着 AI 一起进化,因此天花板会不断升高。
- 行之有效: 论文表明,这种自学的 AI(使用一个小型的 80 亿参数模型)实际上超越了使用 GPT-4(一个更大、更昂贵的模型)来生成规则的系统。
简而言之: EVOLM 是一个自我改进的循环,AI 在其中学会编写自己详细的评分细则。通过不断将现在的自己与过去的自己进行比较,它迫使自己编写越来越精确的规则,进而帮助它学会写出更好的答案,整个过程无需人类介入。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。