Self-Evolving Code-with-Image Reasoning
本論文は、マルチモーダルモデルが複雑な画素レベルのタスクを解決するためにコード内で視覚的アルゴリズムを実装し、実行可能なリフレクションループを用いて推論スキルを反復的に洗練させることで、CwI-Benchにおいて大幅な性能向上を実現する、トレーニングフリーの自己進化フレームワーク「Code-with-Image」を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
探偵のジレンマ:見るだけでは不十分なとき
あなたは謎を解こうとしている探偵だと想像してください。しかし、手がかりを探す代わりに、あなたは一枚の高解像度の写真を見つめています。人工知能の世界において、これは「マルチモーダルモデル」が行っていることです。彼らは画像を見て、それに関する質問に答えようとします。長い間、これらのAI探偵は「ツール」を使うことを学ぶことで進化してきました。もし手がかりが小さすぎて見えないなら、ズームインすることを学びます。もしテキストがぼやけているなら、画像を明るくすることを学びます。これは「画像を使って考える」と呼ばれます。それは、探偵に虫眼鏡と懐中電灯を与えるようなものです。
しかし、落とし穴があります。単に目を凝らして見るだけでは解決できない謎があるのです。例えば、特定のパターンの中に正確に何ピクセルあるかを数えたり、隠れた指輪が正確に何度回転しているかを突き止めたりしなければならないパズルを想像してみてください。いくらズームしたり明るさを調整したりしても、目で見ることによって答えを「見る」ことはできません。あなたはそれを「計算」しなければならないのです。ここで、従来の思考法は壁に突き当たります。AIはパズルを解くための手順を言葉で説明することはできますが、言葉は画像に対して数学を行うことはできません。この論文はその隙間に踏み込み、シンプルながらも深遠な問いを投げかけます。「もしAIが解決策を記述するだけでなく、その解決策を『実行』するためのコンピュータプログラムを実際に書けるとしたらどうだろうか?」と。
この論文の大きなアイデア:思考としてのコーディング
この論文は、AIが視覚的なパズルを解くための新しい方法であるCode-with-Imageを紹介しています。AIに画像を見て答えを推測させるのではなく、あるいは「クロップ(切り抜き)」や「回転」といった既製のツールのリストを使わせるのではなく、研究者たちはAIに空白のキャンバスとPythonインタープリタ(コンピュータコードを実行するツール)を与えます。AIの仕事は、答えを見つけ出すために画像のピクセルを直接操作するプログラムを書くことです。
このように考えてみてください。従来の方法では、もしAIに「この写真の中に赤い点はいくつありますか?」と尋ねたら、AIは点について説明したり、それらを強調するツールを使おうとしたりしたでしょう。Code-with-Imageでは、AIは「すべてのピクセルを走査し、それが赤色かどうかをチェックし、カウントし、合計を出力せよ」というスクリプトを書かなければなりません。プログラムこそが「推論」なのです。コードが正しければ、答えも正しくなります。コードが間違っていれば、答えも間違っています。これは、課題を「答えを見る」ことから「答えを構築する」ことへとシフトさせています。
問題点:AIは説明できるが、実行できない
研究者たちは、非常に賢いAIモデルでさえこれに苦戦することを発見しました。彼らは、30種類の視覚的パズルを含むCwI-Bench(Code-with-Image Bench)という大規模なベンチマークでテストを行いました。これらのパズルは、単に「見る」だけでは答えに辿り着けないように設計されています。つまり、ピクセルに対して多段階の計算を行わなければならないのです。
AIが(たとえ「思考モード」をオンにしていても)言葉だけでこれらのパズルを解こうとすると、惨敗しました。例えば、トップクラスのモデルであるGPT-5.6-lunaは、正解率が**30%**にも満たない結果でした。モデルは手順を完璧に説明できました(「画像を回転させてピクセルを数える必要がある」など)。しかし、実際に数学を行うことはできなかったのです。それは、完璧な詳細さでレシピを説明できるが、実際に料理を作ることができないシェフのようなものでした。
しかし、研究者がPythonインタープリタを与え、問題を解くためのコードを書くよう指示すると、スコアは跳ね上がりました。GPT-5.6-lunaの精度は**43%**に上昇しました。オープンソースモデルのQwen3.5-27Bは、**12.6%から32.6%**へと向上しました。コードによって、AIは画像データを実際に処理できるようになり、推測ゲームを計算へと変えたのです。
秘訣:自らデバッグする方法を学ぶ
しかし、ここからが肝心なところです。コードを書く能力を与えられたとしても、AIは依然として間違いを犯しました。見た目は正しそうに見えても、一つ余分にピクセルを数えたり、回転の数値を変えたりといった、目に見えない小さなエラーを含むプログラムを書いてしまうのです。AIはコードを実行し、間違った答えを得て、そして単に新しいプログラムを書き直そうとしますが、しばしば同じ間違いを繰り返してしまいます。
これを修正するために、著者たちはSelf-Reflection over Executable Reasoning(実行可能な推論による自己内省)と呼ばれる「自己進化」ループを作成しました。これは、この物語の中で最も遊び心のある部分です。AIがテストを受けている学生だと想像してください。間違った答えを出したとき、単に次に進むのではなく、AIは以下のプロセスを強制されます:
- 失敗したテストを見る: 自分が書いたコードと、得られた間違った答えを読み返す。
- シミュレーションを実行する: コードがどこで壊れたのかを正確に把握するために、安全な「サンドボックス」内でコードを再実行する。
- バグを修正する: 間違いを直すためにコードを編集する。
- 教訓を保存する: 修正が成功したら、その修正されたコードを「スキル」(テキストの断片)としてライブラリに保存する。
これは、AIを再学習させたり、脳を書き換えたりすることなく行われます。AIは自らの失敗から学ぶのです。論文は、この「自己学習」ループがいかに強力であるかを示しています。
- GPT-5.6-lunaモデルの場合、これらの自己進化させたスキルを使用することで、精度が**43%から67%**へと向上しました。
- Qwen3.5-27Bモデルの場合、**32.6%から55.9%**へと跳ね上がりました。
なぜこれが重要なのか:コピー&ペーストできるスキル
最も興味深い発見の一つは、これらの「スキル」がただのプレーンテキストであるということです。それらはAIの脳の中に閉じ込められているわけではありません。研究者たちは、巨大で強力なモデル(270億パラメータのモデルなど)が学習したスキルを、はるかに小さく弱いモデル(90億パラメータのモデル)に貼り付けることができると示しました。
その小さなモデルは、単独では問題を解くことができませんでしたが、大きなモデルが書いた「リファレンスガイド」を読むだけで、突然劇的に改善しました。
- 9Bモデルは、27Bモデルによって進化させたスキルを使用することで、精度が**11.1%から34.5%**へと向上しました。
- さらに驚くべきことに、これらのスキルは異なる種類のAIモデル間でも機能しました。あるモデルのファミリーが学習したスキルは、全く異なるモデルのファミリーの向上を助けたのです。
この論文が否定していること
この論文は、何がうまくいかないのかについても明確に述べています。単にAIにツールのリスト(「ズーム」、「クロップ」、「検索」など)を与えるだけでは、これらの特定の種類の問題には不十分であると主張しています。AIは、ゼロから独自のアルゴリズムを書く必要があります。また、単に言葉でより深く「考える」だけでは不十分であることも示しています。ボトルネックはアイデアの欠如ではなく、実行力の欠如なのです。AIはアルゴリズムを説明することはできますが、コードを実行しない限り、パズルを解くことはできません。
結論
この論文は、精密な計算を必要とする視覚的問題において、AIにとっての最善の思考法はコードを書くことであることを示唆しています。しかし、真のブレイクスルーは、これらのAIモデルが、自らの間違いをデバッグすることで、そのコードを書く能力を自ら高めていけるという点にあります。彼らはコードを直してもらうための人間の教師を必要としません。ただ、コードを実行するためのサンドボックス、どこで失敗したかを見るための鏡、そして何度もやり直すための少しの忍耐があればよいのです。
結果は測定可能で具体的です。30のタスクファミリーのベンチマークにおいて、自己進化させたスキルは、トップモデルの性能を(正解率の)40代前半から60代後半へと押し上げました。この論文は、これがあらゆる視覚的問題を解決すると主張しているわけではありませんが、答えが「目の検査」ではなく「ピクセルの数学」にあるタスクにおいては、コーディングこそが鍵であり、自己内省こそがマスターキーであることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。