DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution
该论文介绍了 DIVE,这是一个多样性驱动的框架,它使冻结的大型语言模型能够通过从任务经验和验证器反馈中演化并选择互补的自然语言技能,实现快速、无参数的自我改进,从而在不同模型规模间实现有效迁移,并超越现有的推理与优化方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它几乎了解世界上的一切。你可以让它解决棘手的数学问题或逻辑谜题,它通常都能做对。但问题在于:一旦你关掉机器人再重新启动,它就会忘记从你的特定问题中学到的所有东西。这就像拥有一个每天醒来都带着空白大脑的天才,无法记住昨天犯过的错误或发现的巧妙技巧。通常,为了让机器人变得更聪明,你必须重构它的脑回路(这个过程被称为“训练”),这既昂贵又缓慢,而且需要许多人并不具备的特殊权限。
因此,科学家们一直在问一个大问题:一个“冻结”状态的机器人能否在不重构大脑的情况下进行学习?答案在于一种叫做“提示词工程”(prompting)的技术。与其改变机器人的大脑,不如改变你给它的指令。这就像是给一位厨师一张新的食谱卡。如果卡片上写着“记得给汤加盐”,厨师可能会做得更好;但如果厨师一直犯同样的错误,简单的笔记可能还不够。你需要一种方法,让厨师能写下为什么失败,思考出更好的策略,并将这种策略转化为一条永久性的规则,写在他们的食谱卡上,而无需改变他们实际的烹饪技能。这就是人工智能“自我进化”的前沿领域:教导一个静态模型通过与自己对话并从自身经验中学习来变得更聪明。
于是,DIVE(多样性驱动的技能进化,Diversity-Driven Skill Evolution)诞生了,它像是一个为这些冻结机器人准备的、充满智慧且富有活力的创意工作坊。研究人员发现,与其试图寻找一套唯一的“完美”指令,不如运行一整支由不同“版本”机器人组成的团队,让它们以略微不同的方式进行学习。
以下是 DIVE 的运作方式,请想象一群正在试图破解谜团的不同侦探。在过去,研究人员可能会只要求一名侦探去破案,让他犯错,然后尝试修复他的笔记。但 DIVE 说:“让我们让十名侦探同时开展工作吧!”每位侦兵最初都带着一套略有不同的笔记(即“种子技能”)。随着工作的进行,他们会收到关于哪里出错的反馈。
DIVE 不仅仅是让一名侦探尝试修复笔记,它使用了一个包含不同“修复策略”的工具箱。其中一位侦探可能会尝试反思性修复(Reflective Repair),这就像是在审视一个错误时说:“噢,我漏掉了这里的线索,让我把这条记录补上去。”另一位可能会尝试探索性修订(Exploratory Revision),这就像是扔掉旧地图并画一张全新的地图,因为旧路径已经走不通了。第三位可能会尝试压缩(Compression),这就像是将一本杂乱的 50 页笔记本浓缩成一份精炼的 5 页参考手册,只保留最重要的规则。
DIVE 的魔力在于它并不只是选出“最强”的侦探然后停止。它让所有十名侦探并行工作。它会观察哪位侦探在处理哪类问题时进步最快,并给予他们更多工作时间。如果某位侦探陷入僵局,系统可能会引入一种全新的策略来帮助他们。这防止了整个团队陷入同一种错误想法(即“过拟合”问题)。
一旦侦探们完成了学习和进化的过程,DIVE 也不仅仅是挑选得分最高的那一个。相反,它会观察整个团队,并挑选出一支互补的小队。也许侦探 A 非常擅长识别数字模式,而侦探 B 则擅长识破逻辑陷阱。通过将他们各自进化出的独特“技能卡”组合成一个单一的工具包,机器人可以解决以前无法解决的问题。
论文显示,这种方法效果极佳。在测试了高难度数学竞赛(如 HMMT)和复杂的逻辑谜题(如数独)后,DIVE 让小型、冻结的模型实现了快速的学习和进步。事实上,一个使用 DIVE 进化技能的小型模型,其表现竟然超越了使用标准指令的更大、更强大的模型。研究人员发现,与那些试图改变模型大脑或仅微调一次提示词的方法相比,DIVE 能以更少的尝试次数(或称“展开次数/rollouts”)实现如此巨大的提升。
至关重要的是,论文认为这种方法优于寻找单一的“神奇提示词”或依赖单一的学习路径。通过保持一组多样化且不断进化的技能,并融合各自最优秀的组成部分,DIVE 创建了一个稳健的自我进化系统,而无需重构大脑。它表明,对于冻结的模型而言,变得更聪明的秘诀不在于一条完美的指令,而在于一个多样化、不断进化的策略库,让模型可以从中汲取力量来解决任何问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。