← 最新の論文
💻 computer science

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

本論文は、モデルの出力をレンダリングし、ドメイン固有のルーブリックで評価することで画像からコードへの生成を評価する、参照コード不要のマルチドメインベンチマークおよび評価フレームワーク「Vision2Code」を導入し、空間的および複雑な視覚ドメインにおいて顕著な性能格差が明らかになる一方で、フィルタリングされた出力がモデルの訓練を効果的に改善し得ることを示している。

原著者: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な図面、例えば家の設計図、化学の模式図、あるいは金融チャートを想像してみてください。次に、その画像を見て、それをゼロから再び描くために必要な正確な指示(コード)をコンピュータに書かせてみることを想像してください。

これが論文「Vision2Code」の主題です。これは、AI モデルが画像を編集可能なコードに変換する能力を評価するための新しい「テスト(ベンチマーク)」です。

以下に、この論文の主要なアイデアを簡単なアナロジーを用いて解説します。

1. 課題:「ピクセル対設計図」のギャップ

画像をケーキの「写真」と考えてみてください。写真を見るだけではケーキはわかりますが、アイシングの味を変えたり、チェリーを移動させたりするのは、ピクセルを編集する必要があるため容易ではありません(結果は messy になります)。

しかし、「レシピ(コード)」があれば、アイシングをチョコレートに変えたり、チェリーを移動させたりするのは簡単です。

  • 従来のテスト: 過去の AI 向けテストは、「この写真のように見えるケーキを描けますか?」と問うものでした。これらは狭いトピック(チャートのみなど)に焦点を当てていたり、AI が比較対象として元のレシピを持っていることを前提としていたりしました。
  • 新しいテスト(Vision2Code): このテストは、「このケーキの写真を見て、その通りに実行すれば元のケーキと見た目も動作も全く同じになるような、新しいレシピを書けますか?」と問います。重要なのは、このテストは AI に元のレシピを与えず、写真のみを与える点です。

2. 課題:単一の図面タイプではないこと

著者らは、棒グラフを描くことと、3D の部屋や回路基板を描くことは非常に異なることに気づきました。

  • アナロジー: 地図を描くテストを想像してください。
    • チャート/グラフ: 地下鉄の路線図を描くようなものです。線がつながっている必要があり、駅名も正確でなければなりません。
    • 化学: 分子を描くようなものです。一つの原子を別の原子に置き換えると、全体が誤りになります。
    • ドキュメント: 密集した新聞ページを写し取るようなものです。すべての単語とコラムが重要です。
    • 3D シーン: 奥行きのある部屋を描くようなものです。テーブルが浮いているように見えたり、平面的に見えたりすれば、その図面は失敗です。

Vision2Code は、これら 6 つのカテゴリーにまたがる15 種類の異なる画像タイプを網羅しています。これは、特定の画像タイプのみを対象としたスプリントではなく、AI 描画のための「マルチスポーツ」オリンピックのようなものです。

3. 評価システム:「厳格な芸術批評家」

AI の描画をどのように採点するのでしょうか。

  • 従来の方法: 一部のテストは、新しい画像と古い画像をピクセル単位で比較するだけでした(2 枚の写真が同一かどうかをチェックするようなもの)。これは良くありません。なぜなら、線がわずかにずれているだけで、人間には完璧に見えても、ピクセルチェックでは不合格になる可能性があるからです。
  • Vision2Code の方法: 彼らは、厳格な芸術批評家のように振る舞う**VLM 評価者(AI ジャッジ)**を使用します。
    • AI がコードを生成します。
    • そのコードを実行して新しい画像を作成します。
    • 「批評家」が新しい画像と元の画像を比較します。
    • 捻り: 批評家は、タスクに応じて異なるルールブックを使用します。
      • 化学の模式図の場合、ルールブックはこう言います。「原子が間違っていれば、色が綺麗でもゼロ点です」。
      • チャートの場合、ルールブックはこう言います。「軸の数値が間違っていれば不合格です」。
    • また、「ガードレール」も用意されています。AI が巨大で明らかな間違い(例えば、分子を逆さまに描くなど)を犯した場合、スコアは自動的に低い値に制限されます。これにより、AI は美しくても誤った描画でシステムを欺くことができません。

4. 結果:AI は一部のことは得意だが、他のことは苦手

この論文では、9 つの異なる AI モデル(無料のものも有料のものも)をテストしました。

  • 良いニュース: 最良のモデルは、チャートやグラフを描くことに非常に上手になっています。棒グラフを見て、それをほぼ完璧に再現するコードを書くことができます。
  • 悪いニュース: モデルは複雑で特定のタスクに苦戦しています。
    • 3D シーン: 3D 物体を 2D に平坦化し、奥行き感を失うことが多いです。
    • 化学と回路: 記号や接続を混同してしまいます。
    • ドキュメント: テキストを見落としたり、レイアウトを崩したりします。
  • 教訓: AI が単純なグラフを描くのが得意だからといって、回路図の深い構造を理解しているわけではありません。そのスキルは「ドメイン依存」です。

5. 「自己学習」のトリック

この論文では、より多くの人間の教師を必要とせずに AI を改善するための巧妙なトリックも試されました。

  • アイデア: AI が画像を描こうとします。「批評家」がそれを採点します。
  • フィルタリング: もし AI が最初の試みで良い評価を得たものの、その後、その「自分の描画」を再度描くように求められたときに失敗した場合、それは AI が運良く当たったか、パターンを暗記しただけで、構造を真に理解していないことを意味します。
  • 結果: 初回で良いスコアを得たが、2 回目でつまずいた事例のみで AI を訓練することで、モデルが「難しい」部分を学ぶ手助けをしました。これにより、より小さなモデル(Qwen3.5-9B)のパフォーマンスが大幅に向上し、この「批評家」が AI により良い描画方法を教えることができることが証明されました。

まとめ

Vision2Code は、AI に対する新しく、公平で、包括的なテストです。これは「これは写真に似ていますか?」と問うのをやめ、「このコードは実際に画像の構造を再構築していますか?」と問うように変わりました。それは、AI が単純なチャートを描くことには長けている一方で、複雑な科学図、3D シーン、あるいは密集したドキュメントを完璧に再構築するには、まだ長い道のりがあることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →