MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification
本論文は、領域の再構成および局所的な修正を伴う現実的なマルチターン型のウェブUIタスクにおいて、コーディングエージェントを評価するために設計された初のマルチモーダル・ベンチマークであるMT-Web2Codeを紹介し、反復的なターンを通じて忠実性を維持しエラーの蓄積を防ぐという現在のエージェントの能力における重大な限界を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにウェブデザインの達人になってもらうよう教える場面を想像してみてください。かつて、私たちはこれらのロボットに対し、白紙のキャンバスとウェブサイトの画像を渡し、一度にすべてを一から構築させるというテストを行っていました。それはまるで、シェフにフルコースの食事を瞬時に作り上げるよう頼むようなものでした。しかし、現実の世界において、ウェブデザインがそれほど劇的な展開になることは滅多にありません。通常、開発者は既存のウェブサイトを開き、壊れたボタンを見つけたり、変なフォントを直したり、足りない写真を追加したりします。その際、ページ全体の他の部分を誤って削除しないように注意しながら作業を進めます。それは、何度も繰り返される「間違い探し」や「グリッチ(不具合)修正」のようなゲームに近いものです。これは「反復的コーディング(iterative coding)」の世界であり、ロボットは5分前に自分が何をしたかを記憶し、新しい問題を解決しながら、元の状態を壊さないようにしなければなりません。研究者が問いかけている大きな疑問は、「私たちの最も賢いAIロボットたちは、この乱雑でステップ・バイ・ステップの現実に適応できるのか、それとも、きれいな白紙の状態を与えられた時だけうまく機能するのか?」ということです。
これこそが、論文「MT-Web2Code」が調査している内容です。著者らは、AIコーディングエージェントがこの「走りながら直していく」スタイルの作業にどれほど長けているかを検証するために、全く新しい、非常に困難なテストである「MT-Web2Code」を作成しました。AIにページ全体を構築させる代わりに、彼らは16の異なるカテゴリ(ショッピング、ニュース、政府系サイトなど)からなる102の異なるウェブページを与え、複数のターンにわたって2つの特定のタスクを実行させました。最初のタスクは「リージョン再構築(Regional Reconstruction)」です。これは、ロボットに対して「おい、このページのセクション全体が欠落している。これが本来あるべき姿の画像だ。他の部分には触れずに、その部分だけを再構築してくれ」と命じるようなものです。2つ目のタスクは「局所的修正(Localized Modification)」で、これはさらにトリッキーです。「3つの小さな箇所が間違っている(例えば、ボタンの色が違う、あるいは線の太さが適切でないなど)。その小さな箇所だけを修正してくれ」という指示です。
このテストを公平で回避不可能なものにするために、研究者たちは巧妙な「逆・破損(Reverse-Corruption)」エンジンを考案しました。想像してみてください。彼らが完璧で黄金のようなウェブサイトを用意し、その後、特定の方法で意図的に壊した(セクションを隠したり、フォントをめちゃくちゃにしたりした)とします。そして、どのように壊したかを正確に記録しました。AIの仕事は、そのプロセスを逆転させることです。つまり、壊れたページを見て、何が間違っているのかを判断し、それを完璧な状態へと戻すのです。研究者はページがどのように壊されたかを正確に把握しているため、AIの成功を極めて精密に測定することができます。彼らは、AIロボットは向上してはいるものの、このマルチターン(複数回のやり取り)のゲームにおいては依然として苦戦していることを発見しました。
結果は、一種の現実を突きつけるものでした。AIが欠落したリージョンを再構築しようとすると、新しい部分についてはまともな仕事を行うこともありましたが、周囲のコンテンツを誤って壊してしまうことがよくありました。例えば、メニューだけを直すべきなのに、ページ全体の背景色を変えてしまうといった具合です。精密な編集を求められた際、ロボットはしばしば視覚的な修正とコードを完璧に一致させることができず、微細な制御能力が欠けていることを示しました。おそらく最も懸念すべき点は、論文が「エラーの雪だるま現象(error snowball effect)」を発見したことです。もしAIが最初のターンで小さなミスを犯した場合、そのミスが次のターンへと引き継がれ、増幅され、最終的な結果が、毎回ゼロから始めた場合よりもはるかに悪化してしまうのです。興味深いことに、研究者たちは、壊れた部分がどのような見た目であるかという文章による説明をAIに与えても、必ずしも役に立たないことを発見しました。時には、それがロボットを混乱させ、実際の画像よりも言葉に頼りすぎてしまうこともあったのです。
要するに、この論文は、AIがゼロからウェブサイトを構築することには長けているものの、注意深く、反復的なエディター(編集者)になるためにはまだ学習の過程にあることを示唆しています。それは、あることに長けていることが、自動的に別のことにも長けていることを意味しないことを示しています。著者らは、修正された部分と修正されていない部分の両方をチェックする、彼らの新しい超精密なスコアリングシステムを用いることで、将来のAIが、窓を一つ直そうとして家全体を壊してしまうようなことがない、より信頼できるステップ・バイ・ステップのウェブデザイナーになれるよう支援したいと考えています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。