← 最新论文
🤖 machine learning

Multi-Perspective Transformers in ARC-AGI-2 Challenge

本文提出了一种基于 TinyLM 的方法,通过引入测试时训练和专家乘积等测试时微调技术来解决 ARC-AGI-2 视觉谜题,在评估集上实现了 21.7% 的准确率。

原作者: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你被交给一系列视觉谜题。每个谜题向你展示几张彩色网格的“之前”和“之后”图片,你的任务是猜出将“之前”转变为“之后”的规则。然后,你必须将这一规则应用到一张新的、从未见过的图片上。这就是ARC-AGI-2挑战,一项旨在测试计算机是否能像人类一样思考的测试:从极少的示例中学习,并即时适应新情境。

以下是团队(Caleb、Seun、Weiwen、Fariha、Vedant 和 Xinyu)如何以简单明了的方式应对这一挑战的说明。

团队策略:“多眼”方法

团队没有只查看一次谜题,而是构建了一个从多个不同角度审视谜题的系统。这就像试图通过询问五个人描述同一个犯罪现场来解开谜团,但每个人都是从不同的窗户观察,或是举着镜子去观察。

  1. 翻译器(Tokenization):首先,计算机将彩色网格转换为简单的文本字符串,就像食谱一样。它会说诸如“从这里开始,宽度为 5,高度为 5,颜色为红色”之类的话。
  2. 变形者(Data Augmentation):系统利用该谜题生成数十种“视图”。它旋转网格、像翻煎饼一样翻转它、交换颜色(例如将所有红色变为蓝色),并进行转置。其目标是找到一种谜题版本,使隐藏的规则对计算机而言显而易见。
  3. 小大脑(TinyLM):他们使用了一个非常小且高效的 AI 模型,称为TinyLM。可以将其想象为一个聪明但紧凑的学生,它没有死记硬背世界上所有可能的谜题,但非常擅长快速发现模式。
  4. 专家之积(PoE):这是他们的投票系统。模型审视谜题的所有那些不同“视图”。如果模型在所有不同视图(旋转、翻转、颜色交换)中对其答案都很有信心,该答案就会获得高分。这就像一个陪审团,只有当每一位陪审员都达成一致时,裁决才会被接受。
  5. 快速学习者(Test-Time Training):在解决特定谜题之前,模型会利用该特定谜题中提供的少量示例,接受一次微小而迅速的“速成课程”。这就像一位厨师在端上菜肴之前立刻品尝酱汁,并加一点点盐以匹配这道特定的菜,而不是依赖通用的食谱。

结果:两组数据的对比

团队在两组谜题上测试了他们的系统:

  • 练习集(Training):这些是模型在“速成课程”期间见过的谜题。
  • 期末考试(Evaluation):这些是模型从未见过的全新谜题。

成绩单

  • 在练习集上:模型表现出色,正确率达到96.1%。它掌握了所展示的规则。
  • 在期末考试上:得分降至21.7%

哪里出了问题?(“过拟合”问题)

论文指出,“快速学习”方法(Test-Time Training)实际上使期末考试的表现变得更糟。

想象一下,你通过死记硬背作业中的具体数字来准备数学考试。当考试来临时,数字变了,但逻辑是一样的。由于模型在特定的作业数字上如此刻苦地学习,当考试数字发生变化时,它便感到困惑。它“过拟合”了——它过于完美地记住了练习示例,以至于无法适应新的示例。

同样,“多眼”(PoE)策略也没有达到预期的效果,因为模型主要被训练为按一种特定顺序(逐行)阅读谜题。当系统试图从不同角度(例如逐列)观察谜题时,模型无法理解这种新视角,导致这些额外的视图变得毫无用处。

结论

团队构建了一个巧妙的系统,利用多视角和快速学习来解决视觉谜题。事实证明,它几乎可以完美地学会它所练习过的谜题的规则。然而,它难以将这些规则应用到全新的、从未见过的谜题上。

论文总结道,虽然他们的“快速学习”和“多眼”技巧很有趣,但该模型需要更大,需要在更多样化的示例上进行训练,并且需要被教导去理解谜题的逻辑,而不仅仅是死记硬背特定的练习示例。他们尚未解决挑战中最困难的部分,但他们为理解小型 AI 模型如何尝试推理奠定了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →