The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark
KnotBench は、約 86 万枚の結び目図を用いた厳密なベンチマークを導入し、現在の視覚言語モデルが「思考」モードによる性能向上にもかかわらず、視覚的な結び目の構造を実用的な記号的推論に変換する際に根本的に困難を抱えており、図式的操作を要するタスクにおいてしばしばランダムな基準を上回れないことを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いロボットが、絡み合った糸の写真を見て、それを完璧に記述できると想像してみてください。それは「赤い輪が青い輪の上を-cross-し、その青い輪が緑の輪の下を通っている」と言うことができます。それは優れた視覚を持っています。
しかし、ここに落とし穴があります。同じロボットに糸を「ほどく」よう頼んだり、2 枚の異なる結び目の写真が、実は単に描き方が異なるだけで同じ結び目なのかを判断するよう頼んだりすると、それは完全に失敗します。結び目を記述することはできても、頭の中でそれと「対話」することはできないのです。
この論文「VLM のためのゴルディアン・ノット」は、現代の AI モデルにおける「見る」ことと「行う」ことの間の隔たりがどれほど大きいのかを証明するため、KnotBenchという新しいテストを導入します。
設定:デジタルな結び目の庭
研究者たちは、858,000 枚の結び目の写真からなる広大な庭園を作成しました。
- 源泉: 彼らは 1,951 個の基本的な「原型」結び目(結び目理論の最も単純な構成要素)から始めました。
- 魔法: 彼らは数学的な規則(Reidemeister 移動と呼ばれる)を用いて、これらの結び目を何千回もねじり、回転させ、描き直しました。
- 結果: 3 つの交点を持つ単純な「三つ葉の結び目」の写真と、20 個の交点を持つ全く同じ結び目の写真があり、それらは全く異なって見えるかもしれません。あるいは、ほぼ同じように見える 2 枚の写真が、実際には異なる結び目(左利きの手袋と右利きの手袋のように)である場合もあります。
コンピュータは、人間の見当違いではなく数学を用いて生成したため、すべての結び目の「真の正体」を知っています。これにより、テストは完全に公平になります。
テスト:14 の行き詰まり方
研究者たちは、利用可能な最も賢い AI モデル 4 つ(Claude Opus 4.7 や GPT-5 などを含む)に、14 の異なるタスクを実行させました。AI がどこで破綻するかを見るために、タスクを 2 つのグループに分けました。
- 「画像」グループ: AI は結び目の写真を見ます。
- 「テキスト」グループ: AI は結び目を記述する数字と文字のリスト(コード)を見ます。
以下は、彼らが AI に求めた、簡単な比喩を用いた内容です。
「同じか異なるか?」テスト(ファミリー A): 「これら 2 枚の写真は同じ結び目ですか?」
- 罠: 時には写真が全く異なって見えても同じ結び目であることがあります。また、ほぼ同じに見えても異なる結び目であることがあります。
- 結果: テキストコードを与えられた場合、AI はこれに優れていました。写真を与えられた場合、それはダーツを投げる猿のようにランダムに推測しました。
「何が起こったか?」テスト(ファミリー B): 「私はあなたに結び目を見せ、その後 1 つの小さな動き(ループを追加するなど)を行いました。私はどの動きをしましたか?」
- 罠: これには、AI が頭の中で動きをシミュレートする必要があります。「もしここでこの糸を引っ張ったら、写真はどのように見えるか?」
- 結果: テキストコードを与えられた場合、AI はそれを解明できました。写真を与えられた場合、それは惨めに失敗しました。あるモデル(GPT-5)は、答えを暗記したが数学を学んでいない学生のように、最も一般的な答え(「R3」)を繰り返し推測し始めました。
「数え上げ」テスト(ファミリー C): 「糸は何回交差していますか?」
- 結果: AI は 8 回の交差を簡単に数えることができました。しかし、結び目が複雑になると(17 回以上の交差)、AI の数え上げは完全に混乱しました。それは自分が眺めているものを数えることさえできませんでした。
「翻訳」テスト(ファミリー D): 「これが写真です。それに対応する秘密のコードを書き出してください。」
- 結果: ゼロです。どのモデルもこれをできませんでした。「思考」モードをオンにしても、視覚的な写真を数学的なコードに変換することはできませんでした。
大発見:「知覚 - 操作の隔たり」
この論文は、失敗点を**「知覚 - 操作の隔たり」**と呼んでいます。
次のように考えてみてください。
- 知覚とは、地図を見て「川と橋が見える」と言うことです。
- 操作とは、同じ地図を見て「もし私がこの橋を渡れば、向こう側に着くだろう」と言うことです。
AI モデルは知覚において驚異的です。彼らは結び目を記述できます。しかし、操作においてはひどく劣ります。彼らは自分が見たものを頭の中で操作して問題を解決することができません。
「思考」は役立ちますか?
研究者たちは AI の「思考モード」(モデルが回答する前に自分自身と会話するモード)をオンにしました。
- 役立ちましたか? はい、しかしわずかにのみです。
- どこで役立ちましたか? AI がテキストコードを与えられた場合のみです。AI がまず写真を見なければならない場合、「思考」は問題を解決しませんでした。それは画面の数字を読めない人に電卓を与えても、電卓は無駄であるのと同じです。
結論
この論文は、現在の AI モデルは写真家でありながらメカニックにはなれない存在であると結論付けています。彼らは結び目の完璧な写真を撮り、すべての詳細を記述できますが、人間が物体を頭の中でねじったり回転させたりしてその仕組みを理解するために使用する内部的な「シミュレーター」を持っていません。
彼らは結び目を見ることができますが、それに対して行動することはできません。AI がこの内部的な「精神的シミュレーター」を構築するまで、どれだけ多くの写真を見ても、図の論理に対して盲目であり続けるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。