Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners
本文提出了一种利用大语言模型生成难度递增的关系推理基准测试的自动化框架,从而提升了诸如 Edge Transformer 等神经模型的评估与泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何破解一个家族谜题。你给它展示了一些简单的故事:“鲍勃是爱丽丝的父亲”,“爱丽丝是查理的姐姐”。机器人学会了推导出:“鲍勃是查理的叔伯。”
到目前为止,一切进展顺利。但如果给你一个更难的故事呢?一个答案不仅仅是从 A 到 B 的直线路径,而是需要跳过隐藏的循环、忽略红鲱鱼(干扰信息),并连接那些看似毫无关联的点?
这篇名为**《Project Auto-World》**的论文,讲述了如何构建这样一个系统,自动创建这些“超难”的谜题故事,以此来测试我们的 AI 机器人是真的拥有智能,还是仅仅在记忆模式。
以下是他们实现这一目标的详细分解,使用了日常生活的类比:
1. 问题所在:“难度盲区”
目前,当研究人员测试 AI 时,他们试图通过增加步骤(比如让家族树变得更深)来增加问题的难度。但作者意识到,这就像只在直路上测试驾驶员一样。仅仅因为一辆车能处理长直路,并不意味着它能处理复杂的环岛或突如其来的绕行。
问题在于:我们实际上并不知道什么才算是一个让 AI 感到困难的逻辑谜题。 我们有一些猜测(比如“步骤太多了”),但 AI 失败的原因可能完全是我们尚未想到的其他原因。
2. 解决方案:“邪恶导师”(LLMs)
为了解决这个问题,作者使用了大语言模型(LLMs)——即那种可以写诗和编写代码的 AI——来充当“邪恶导师”。
作者并没有让研究人员去猜如何愚弄 AI,而是让 LLMs 进行一场“进化搜索”游戏。想象一下这是一个电子游戏,其中:
- 玩家: AI 机器人(具体是一个被称为“Edge Transformer”的模型)尝试解决谜题。
- 关卡设计师: LL 型 LLM 试图设计一个玩家无法战胜的关卡(谜题)。
3. “邪恶导师”是如何工作的
LLM 并不会随机向机器人投掷事实。它使用两种主要策略来提升自己迷惑机器人的能力:
策略 A:遗传育种者(FunSearch)
想象 LLM 是一个谜题构思的育种者。它从一些基础的谜题设计开始。它要求机器人解决这些谜题。如果机器人轻松解决了,LLM 就会说:“太简单了!”然后将失败谜题中最好的部分进行混合与匹配,从而创造出一个新的、稍微难一点的版本。它重复这个过程数千次,不断进化谜题,直到它们变得极其困难。- 类比: 这就像一位教练观察跑步者的失败,然后微调赛道设计(增加坡度、急转弯),程度恰好能让跑步者再次踉跄,从而精准掌握破坏跑步者节奏的方法。
策略 B:自主研究员(Auto-Research)
在这里,他们给了 LLM 一个编程环境,并告诉它:“你是一名研究员。你的唯一任务是编写一个程序,生成机器人无法解决的谜题。不断尝试、阅读你自己的代码并修复它,直到你获胜为止。”- 类比: 这就像给一个学生一本空白笔记本和一个目标:“写一道老师解不出来的数学题。”学生不断重写自己的题目,直到他们最终难倒了老师。
4. 发现:隐藏的陷阱
当他们运行这些实验时,他们发现了一些非常迷人的现象。LLMs 发现了全新的难度类型,而这些类型是人类研究人员从未想到的。
- “偏离路径”陷阱: AI 感到困难并不是因为谜题很长,而是因为它必须忽略一个“红鲱鱼”(看起来很重要但并不在通往答案的直接路径上的事实)。
- “推导循环”陷阱: 最难的谜题涉及必须先进行“推导”(基于规则进行推测)才能使用的事实。AI 会被这些隐形的循环搞糊涂。
作者发现,通过将这些“邪恶导师”生成的谜题加入到机器人的训练数据中,机器人实际上变得聪明得多。他们创造了一个超级机器人(称为 SUPERET),它处理这些棘手循环的能力比以前强得多。
5. 终极目标:自我进化的实验室
这篇论文最令人兴奋的部分是整个过程是可以自动化的。
- LLM 发明一个带有新规则的新世界(比如一个有着奇怪法律的新家族树)。
- LLM 为该世界发明谜题。
- LLM 测试机器人。
- 机器人从失败中学习。
- LLM 再次尝试让难度升级。
论文表明,我们不需要人类不断地提出新的测试。我们可以构建一台机器,让它自动发明挑战、测试自己的极限,并教导自己如何变得更聪明。
总结
简单来说,这篇论文关于如何通过使用另一个 AI 来不断发明越来越难的逻辑谜题,从而教导 AI 自我教学。他们发现,通过这样做,我们可以揭示当前 AI 模型的隐藏弱点,并训练它们成为更稳健、更具系统性思维的模型。这实现了从“用人类设计的测试来测试 AI”到“用 AI 制造的测试来测试 AI”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。