← 最新の論文
🤖 machine learning

Multi-Perspective Transformers in ARC-AGI-2 Challenge

本論文は、Test-Time-Training や Products of Experts といったテスト時微調整技術を強化した TinyLM ベースのアプローチを提示し、ARC-AGI-2 の視覚パズルを解決し、評価セットにおいて 21.7% の精度を達成した。

原著者: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが一連の視覚パズルを渡されたと想像してください。各パズルには、色とりどりのグリッドの「前」と「後」の画像がいくつか示されており、あなたの仕事は「前」を「後」に変えるルールを推測することです。その後、そのルールを新しく、未見の画像に適用しなければなりません。これがARC-AGI-2チャレンジです。これは、コンピュータが人間のように思考できるか、つまりごく少数の例から学び、瞬時に新しい状況に適応できるかを試すテストです。

以下は、チーム(ケイレブ、ショーン、ウェイウェン、ファリハ、ヴェダント、シンユー)がこの課題にどのように取り組んだかを、簡潔に説明したものです。

チームの戦略:「多くの目」アプローチ

チームは、パズルを一度見るだけでなく、さまざまな角度からパズルを見るシステムを構築しました。まるで、ある犯罪現場を説明するために、異なる窓から眺めたり、鏡を持って照らしたりする5人の異なる人に同じ現場を説明させるようなものです。

  1. 翻訳者(トークナイズ):まず、コンピュータは色とりどりのグリッドを、レシピのような単純な文字列に変換します。「ここから開始、幅は5、高さは5、色は赤」といった具合です。
  2. 変身者(データ拡張):システムはそのパズルを取り、数十の「視点」を作成します。グリッドを回転させ、パンケーキのようにひっくり返し、色を入れ替えます(すべての赤を青に変えるなど)、転置します。目標は、隠れたルールがコンピュータにとって明瞭になるようなパズルのバージョンを見つけることです。
  3. 小さな脳(TinyLM):彼らはTinyLMと呼ばれる非常に小さく効率的なAIモデルを使用しました。これは、世界中のあらゆるパズルを暗記しているわけではありませんが、パターンを素早く見つけるのが得意な、賢くコンパクトな学生のようなものです。
  4. 「専門家の積」(PoE):これが彼らの投票システムです。モデルはパズルのそれらの異なる「視点」すべてを調べます。モデルがすべての異なる視点(回転、反転、色入れ替え)において答えに自信を持っている場合、その答えは高いスコアを獲得します。陪審員全員が合意した場合のみ評決が承認されるようなものです。
  5. 速習生(テスト時学習):特定のパズルを解く前に、モデルはその特定のパズルに含まれるごく少数の例を用いて、小さく迅速な「集中講座」を受けます。これは、一般的なレシピに頼るのではなく、料理を盛り付ける直前にソースを味見し、その特定の料理に合わせて塩をひとつまみ加えるシェフのようなものです。

結果:二つのセットの物語

チームは、システムを2つのグループのパズルでテストしました。

  • 練習セット(トレーニング):これらはモデルが「集中講座」で見たパズルです。
  • 最終試験(評価):これらはモデルがこれまで一度も見たことのない新しいパズルです。

成績表

  • 練習セットにおいて:モデルはスター選手となり、**96.1%**の正解率を記録しました。提示されたルールを完全に習得しました。
  • 最終試験において:スコアは**21.7%**まで低下しました。

何がうまくいかなかったのか?(「過学習」の問題)

論文は、「速習生」手法(テスト時学習)が実際には最終試験において状況を悪化させたことを説明しています。

宿題の特定の数字を暗記することで数学のテストの勉強をすると想像してください。テストが来ると、数字は異なりますが、論理は同じです。モデルが特定の宿題の数字を非常に熱心に勉強したため、テストの数字が変わると混乱しました。それは「過学習」しました。つまり、練習例をあまりにも完璧に暗記してしまい、新しい例に適応できなかったのです。

同様に、「多くの目」(PoE)戦略は期待ほどうまく機能しませんでした。なぜなら、モデルは主にパズルを特定の順序(行ごと)に読むように訓練されていたからです。システムがパズルを異なる角度(列ごとなど)から眺めようとすると、モデルはその新しい視点を理解できず、それらの追加の視点は無用なものとなりました。

結論

チームは、複数の視点と迅速な学習を用いて視覚パズルを解く巧妙なシステムを構築しました。それは、練習したパズルのルールをほぼ完璧に学習できることを証明しました。しかし、それらのルールを完全に新しく、未見のパズルに適用することには苦労しました。

論文は、彼らの「速習生」と「多くの目」というトリックは興味深いものの、モデルはより大きく、より多様な例で訓練され、特定の練習例を単に暗記するのではなく、パズルの論理を学ぶように教える必要があると結論付けています。彼らはまだこの課題の最も難しい部分を解決していませんが、小さなAIモデルがいかに推論を試みるかを理解するための堅固な基盤を築きました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →