💬 NLP
Can Large Language Models Generalize Procedures Across Representations?
本文表明,一种将大型语言模型先在符号数据(代码/图)上进行训练、随后再进行自然语言训练的两阶段强化学习课程,能够实现程序化任务的有效跨表示泛化,使一个 1.5B 的小模型能够达到 GPT-4o 的零样本规划性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何烤蛋糕。你有三种方式来给它下达指令:
- 自然语言: 一本写着食谱的书(“混合面粉,然后加入鸡蛋……”)。
- 代码: 一个列出步骤和时长的计算机程序。
- 图表: 一个用箭头表示哪些步骤必须发生在下一个步骤之前的流程图。
核心问题是:如果你用流程图(图表)或代码来教机器人,它是否会自动学会如何遵循书面食谱(自然语言)?
研究人员发现,答案大多是否定的。
问题所在:“语言障碍”
作者发现,大语言模型(LLMs)就像是非常擅长记忆指令“格式”但并不擅长理解其背后“逻辑”的学生。
- “单一格式”陷阱: 如果你只用流程图训练一个机器人,它会成为流程图大师。但如果你随后要求它用书面食谱来解决问题,它就会感到困惑。它没有意识到流程图中“步骤 A 必须在步骤 B 之前发生”与句子中“首先做 A,然后做 B”是完全相同的规则。
- “偷懒”的捷径: 当机器人尝试在一种新格式中猜测答案时,它往往会采取偷懒的捷径。它不会去计算复杂的步骤顺序(关键路径),而是直接把所有的时长加在一起。这就像有人试图通过把所有可能的道路时间相加来计算上班最快的路线,而不是寻找真正的最短路径。
解决方案:两阶段训练营
由于机器人无法仅靠自己“悟出”其中的奥秘,作者设计了一个特殊的训练课程(教学计划)来解决这个问题。这就像学习乐器:
- 第一阶段:数学课(符号化训练): 首先,他们使用“硬性”格式(代码和流程图)来教机器人。这迫使机器人学习程序的严格逻辑规则,而不被花哨的词汇所干扰。这就像在尝试演奏歌曲之前先学习音乐理论。
- 第二阶段:即兴演奏会(自然语言适配): 一旦机器人理解了逻辑,他们就切换到使用自然语言(食谱)进行教学。因为机器人已经从第一阶段掌握了“规则”,它现在可以将这些规则应用到新的语言中。
结果: 这种两步法效果显著。一个采用这种方式训练的小型机器人(15 亿参数)表现得几乎与从未见过这种特定训练的大型、超智能机器人(GPT-4o)一样出色。
秘密成分:“生成式类比”
为什么这行得通?论文指出,机器人学会了使用生成式类比。
- 频率 vs. 类比:
- 频率 就像因为看到了 100 万次而记住“国王 + 女王 = 王室”。
- 类比 是理解词语之间的关系,从而将其应用于新事物(例如:“医生 + 护士 = 医院团队”)。
- 研究人员发现,成功的机器人不仅仅是在记忆模式,它们还在构建一座心理之桥。它们意识到:“哦,这个流程图结构与这个句子结构是类比的。” 两阶段训练迫使它们搭建了这座桥梁。
难点:目前还不是魔法
论文对机器人和人类做了重要的区分:
- 人类 像是天才,看一眼流程图就能立即明白如何编写食谱。我们能瞬间实现泛化。
- 机器人 像是勤奋的学生,需要在一个格式下长时间练习逻辑,才能成功将其应用到另一种格式。它们需要那份“额外的作业”(两阶段训练)来建立这种联系。
总结
论文证明了,仅仅在代码或图表上训练 AI 并不会自动让它擅长自然语言任务。然而,如果你先用代码/图表训练它的逻辑,然后再教它语言,它就能学会将这些逻辑规则转化为人类语言。这让 AI 从一个模式记忆者转变为真正的解题者,使其能够理解步骤背后的“为什么”,而不仅仅是“是什么”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。