Learning to Extrapolate to New Tasks: A Relational Approach to Task Extrapolation
本文介绍了关系任务外推器(RTE),这是一种算法,它通过学习已知锚定任务与目标任务之间的关系变换,实现了对未见任务的系统性泛化,从而在涉及超范围参数、深度增加或新颖组合的功能与序列预测场景中优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一台机器人向目标发射炮弹。
问题:“安全区”陷阱
目前,大多数 AI 模型就像那些只为考试而死记硬背特定题目的学生。如果你问它们一个以前见过的、或者非常相似的问题,它们能得 A。但如果你问它们一个略有不同的问题——比如让它们射击一个比它们练习过的任何目标都远 10% 的目标——它们往往会彻底失败。
即使是当今最聪明的 AI(比如那些写代码或与你聊天的模型)也受困于此。它们擅长“插值”(填补已知知识之间的空白),却不擅长“外推”(猜测训练边界之外会发生什么)。它们依赖的是死记硬背的模式,而非理解世界运作的底层规则。
解决方案:“关系任务外推器”(RTE)
这篇论文的作者提出了一种训练 AI 的新方法,称为RTE。RTE 不是试图死记硬背每一个可能的目标,而是教导 AI 理解任务之间是如何相互转化的。
可以这样理解:
- 旧方法(归纳式): AI 试图死记硬背以 30 英里/小时、40 英里/小时和 50 英里/小时发射炮弹的确切轨迹。当被要求以 65 英里/小时发射时,它会惊慌失措,因为它没有该速度的数据。
- 新方法(RTE/关系式): AI 学习速度之间的关系。它意识到:“如果我将速度增加 10 英里/小时,炮弹就会飞远 20%。”
- 在测试时,当被要求击中 65 英里/小时的目标时,AI 不会凭空猜测。相反,它会说:“好的,我知道如何击中 60 英里/小时的目标(这是我的锚点)。我也知道将 60 英里/小时的射击转化为 65 英里/小时射击的变换(规则)。我将把这一规则应用到我关于 60 英里/小时的知识上,从而解决 65 英里/小时的问题。”
工作原理:“锚点与偏移”策略
论文将这一机制分解为三个主要场景,并使用了简单的类比:
参数外推(改变设置):
- 类比: 假设你知道如何用 1 杯糖烤蛋糕。你想用 1.5 杯糖烤一个。
- RTE 方法: AI 不是从头重新学习烘焙,而是将"1 杯糖蛋糕”(锚点)作为基础,应用“加 0.5 杯糖”的规则(变换)来预测新结果。
长度外推(使其变长):
- 类比: 你知道如何写一个 5 个单词的句子。你需要写一个 9 个单词的句子。
- RTE 方法: AI 将 5 个单词的句子(锚点)作为基础,学习“再加 4 个单词”的规则(变换)来扩展它,而不是试图死记硬背每一个可能的 9 个单词的句子。
组合外推(混合与匹配):
- 类比: 你知道如何削苹果,也知道如何切香蕉。但你从未见过有人切苹果或削香蕉。
- RTE 方法: AI 意识到任务仅仅是“削皮” + “切片”。它将“削皮”技能(锚点)作为基础,并将“切片”规则(变换)应用到苹果上,即使它从未做过这种特定的组合。
秘密武器:"Task2Vec"(地图)
为了实现这一点,AI 需要一张地图来找到正确的“锚点”任务。论文使用了一种名为Task2Vec的工具。
- 想象每一个可能的任务(每一种蛋糕、每一种句子长度、每一串字母)都是地图上的一个城市。
- 相似的任务彼此靠近;不同的任务相距甚远。
- 当 AI 面临一个全新的、困难的任务时,它会查看地图,找到它已经访问过的最近的城市(锚点),并计算出通往新城市的方向和距离(变换)。
他们的发现
研究人员在以下领域测试了这种方法:
- 数学函数: 预测超出 AI 训练数字范围的曲线。
- 多项式: 利用低阶方程预测高阶方程。
- 语言模型(LLM): 使大型语言模型在处理比训练期间所见更长或更复杂的逻辑谜题和代码生成方面表现更好。
结果
在每一项测试中,RTE 方法都显著优于标准 AI 模型。
- 当任务与训练内容差异过大时,标准模型会撞上“墙壁”并失败。
- RTE 模型通过利用“锚点 + 变换”的技巧,成功穿越了这堵墙。
重要局限性(论文所述)
论文谨慎地指出,RTE 并非万能。它仅在以下条件下有效:
- 新任务必须与旧任务相关(你不能要求 AI 利用其训练数据中完全不存在的、完全异质的物理规律来解决问题)。
- AI 必须能够找到一个良好的“锚点”任务作为起点。
总结
这篇论文介绍了一种方法,旨在阻止 AI 仅仅死记硬背过去,转而帮助其理解变化的规则。通过教导 AI 说:“我知道如何做 X,我也知道 X 如何转化为 Y",该系统就能解决它从未见过的难题,前提是这些难题是由它已知的那些构建模块组成的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。