Vector-Bench: Can Models Surgically Edit SVG Code?
本論文は、指示に基づくベクター編集を評価するために設計された40個のSVG修復タスクからなる厳格なベンチマークであるVector-Benchを紹介し、最強のモデルであっても、要求された変更を未要求の要素を変更することなく外科的に適用することには苦戦し、完全な仕様への成功率はわずか15.0%にとどまることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットにデジタルアーティストになるよう教えていると想像してください。あなたは、コードで作られた画像――絵の具ではなく指示によって構築されたデジタル図画のようなもの――をロボットに与え、こう言います。「ねえ、この絵の太陽が大きすぎるよ。小さくして。でも、雲や山には触れないでね」。これがベクターグラフィックスの世界です。標準的な写真とは異なり、ベクター画像は単なる色の点のグリッドではなく、生きたプログラムなのです。それは、コンピュータに線、形、色を描く方法を伝えるコマンドのリストです。コードであるため、もしロボットが間違った行を変更してしまうと、単に絵が変になるだけでなく、ファイル全体を壊してしまい、後で開いたり編集したりすることが不可能になるかもしれません。
科学者たちが投げかけている大きな問いは、「これらのスマートなAIモデルは、ファイル全体を台無しにすることなく、特定のパーツのコードを修正するという指示を実際に実行できるのか?」ということです。これは、スープの中の塩分を、温度や鍋、あるいは横にあるパンのレシピを変えずに置き換えるようシェフに頼むようなものです。もしAIがスープの味を正しくしたとしても、パンを焦がしてしまったら、たとえスープが美味しくても、それは失敗です。これが**指示に基づく編集(instruction-based editing)**の課題です。つまり、指示されたことだけを、正確に、かつ「それだけ」を行う一方で、コードの目に見えない構造を完璧に保つことです。
そこで登場するのが、AIモデルが本当に外科手術のような編集ができるかどうかを試すための、新しくトリッキーなテスト、Vector-Benchです。研究者たちは、SVG画像が「破損」している40個の特定のパズルを作成しました。例えば、電車のドアが間違った場所に浮いていたり、クラゲが触手を失っていたりするようなケースです。彼らはAIモデルに対し、「琥珀色の信号が消えました。それを直し、駅には触れないでください」といった、単純な人間言語による指示を与えました。モデルは、列車を動かしたり、駅のプラットフォームを削除したり、ファイル形式を壊したりすることなく、信号を修正するためにコードを書き換えなければなりませんでした。
結果は、少し厳しい現実を突きつけるものでした。研究者たちは、安価で小さなモデルから、利用可能な最も強力な「フロンティア」モデルに至るまで、34種類の異なるAIモデルをテストしました。最も優れた性能を示したモデルであるClaude Sonnet 5でさえ、エラーを修正し、他のすべてを安全に保ち、有効なファイルを作成するという「全工程」を完璧にやり遂げられたのは、わずか**15.0%**でした。そうです、最も賢いAIでさえ、10回中8回以上は指示を完全には遂行できなかったのです。
しかし、物語は失敗だけではありません。彼らが「どのように失敗したか」についても物語は続いています。論文によると、モデルは「修正」の部分については実はかなり優れていました。平均して、依頼された修理に対して目に見える進展を見せたのは**43.7%**の時でした。彼らは信号を明るくしたり、ドアを近くに動かしたりすることはしばしばできました。しかし、「他の部分には触れない」という部分については非常に不得意でした。彼らは頻繁に触れるべきではないものの名前を変えたり、無関係な物体を動かしたり、あるいはコードの構造を壊してファイルを無効にしてしまいました。
この研究は、「見た目が良いこと」と「正しく機能すること」は同じではないという考えを明確に否定しています。モデルが人間の目には修正されたように見える画像を作成したとしても、その背後のコードが書き換えられたり損傷したりしていれば、それは失敗です。研究者たちは、絵だけでなくコード自体もチェックする厳格なコンピュータ・ジャッジを用いることで、これを証明しました。彼らは、モデルがいくらかの修理はできるものの、副次的被害を出さずにコードを外科的に編集する能力は、依然として大きな障壁であることを明らかにしました。
要するに、この論文は、AIは絵を描いたり直したりすることは上手くなっているものの、それらの絵を機能させるコードの精密で注意深いエディターになることには、依然として苦戦していることを示唆しています。「変更を加えること」と「他のものを壊さずに正しい変更を加えること」の間には、依然として大きな隔たりがあります。著者たちはすべてのデータ、コード、および結果を公開しており、最も高価で強力なモデルでさえ、現在は、精密な外科医というよりも、問題を解決しようとして誤って本棚を倒してしまうような、熱心なインターンに近い状態であることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。