← 最新の論文
💻 computer science

Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing

本論文は、視覚的なGUIの症状を実行可能なコンテキストへと変換するImage2Codeと、視覚的なフィードバックを通じて修正を検証するCode2Imageコンポーネントを統合することで、マルチモーダルな自動プログラム修復を強化するクロスモーダル推論フレームワークであるGUIRepairを導入し、SWE-bench Mベンチマークにおいて最先端の性能を達成している。

原著者: Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に特殊で厄介な車のトラブルを修理しようとしている熟練のメカニックを想像してください。通常、車のオーナーはあなたに電話して、「エンジンから変な音がするんです」と言います。そして、あなたは、その説明に基づいて修理を行います。これが、現在のほとんどのAI「プログラム修復(program repair)」ツールの仕組みです。彼らはバグのテキストによる説明を読み、コードを見て修正を行います。

しかし、もし問題が「視覚的」なものだったらどうでしょう?例えば、オーナーが「ダッシュボードのライトが間違った色で点滅している」と言い、その写真を送ってきたとしたら?現在のほとんどのAIメカニックは混乱してしまいます。彼らはテキストを読むことはできますが、その写真がエンジンの部品とどのように結びついているのかを理解することができません。写真を見ただけで、どのボルトを締めればよいのかを判断することに苦労します。

この論文は、GUIRepairという新しいAIメカニックを紹介しています。これは、ウェブサイト上の壊れたボタンやアプリの不具合のあるマップのような、「視覚的な」ソフトウェアバグを扱うために特別に設計されています。

GUIRepairがどのように機能するかを、2つの主要なスーパーパワーに分けて説明します。

1. 「写真から設計図へ」の翻訳機 (Image2Code)

人間の開発者が写真を見てバグを見つけるとき、単にピクセルを眺めているのではありません。「ああ、これはダイアログボックスの設定のせいで、カレンダー・コンポーネントがうまく動いていないんだな」と考えるのです。彼らは頭の中で、写真をコードのロジックへと翻訳しています。

AIは通常、これをうまく行うことができません。GUIRepairは、ミニチュアモデルを構築する探偵のように振る舞うことで、この問題を解決します。

  • プロセス: AIはバグ報告(写真とテキスト)を読み込み、ルールを理解するためにプロジェクトの取扱説明書(ドキュメンテーション)を検索します。
  • 魔法: 次に、その写真の場面を正確に再現する、ごく小さな一時的なコードを書き上げます。それは、まるでAIが、点滅するライトを自分自身で確認するために、車の「テストドライブ用」バージョンを組み立てているようなものです。
  • なぜ役立つのか: これにより、AIは写真を推測するのではなく、動作するモデルを手に入れます。AIは、「なるほど、どのコードの行がそのライトの点滅を引き起こしているのか、正確に分かったぞ」と理解できるのです。これにより、修正すべき正しい場所を見つけることができます。

2. 「修正と確認」の鏡 (Code2Code)

AIが修正案を思いついたとしても、それが本当に機能したかどうかを知る必要があります。通常のテキストベースのコーディングでは、実行して「合格」か「不合格」を判定します。しかし、視覚的なバグの場合、テキストによるテストだけでは不十分です。ライトが正しい色になっているかどうかを「見る」必要があるのです。

GUIRPariには、これを処理するための2つ目のスーパーパワーがあります。

  • プロセス: AIは、先ほど作成した「ミニチュアモデル」に、今書いた修正を適用します。
  • 魔法: コードを実行し、その結果の新しいスクリーンショットを撮ります。そして、この新しい画像と、元の「壊れた」画像を比較します。
  • なぜ役立つのか: AIは2つの画像を並べて見て、「よし、最初の写真ではカレンダーが間違った場所に浮いていた。この新しい写真では、正しい場所にある。修正は成功だ!」と判断します。これにより、AIは修正が成功したかどうかを、単なる推測ではなく「見て」判断することができるのです。

結果:より優れたメカニック

研究者たちは、視覚的な問題を含む実世界のソフトウェアバグの膨大なリスト(SWE-bench Mと呼ばれます)を用いて、この新しいメカニックをテストしました。

  • 競争: 彼らはGUIRepairを、既存の最高レベルのAIシステム(無料および商用の有料システムの両方)と比較しました。
  • スコア:
    • 標準的な強力なAIモデルを使用した際、GUIRepairは157の問題を解決し、次に優れたオープンソースツールを大幅に上回りました。
    • さらに賢い「推論型」AIモデル(o4-miniと呼ばれます)を使用した際、GUIRepairは175の問題を解決し、トップの商用システムを22件の修正数で上回りました。

まとめ

この論文は、AIに写真をコードに翻訳させること(問題を理解するため)、そしてコードを再び写真に戻させること(解決策を確認するため)を教えることで、現在の手法よりもはるかに上手く視覚的なソフトウェアバグを解決できると主張しています。それは、メカニックに、修理しようとしている問題をようやく「見る」ためのメガネを与えたようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →