あなたは、たった一枚の巨大な豪邸の写真をもとに家を建てる、才能ある建築家を雇っていると想像してください。
問題点:
これまで、AI「建築家」(ビジョン・ランゲージ・モデルと呼ばれます)に対するほとんどのテストは、小さな一間だけのコテージを作ることを求めるだけでした。それらのテストは、玄関のドアが正しく見えるか、あるいは塗装の色が合っているかといった点を確認するものでした。しかし、実際のウェブサイトは、数十の部屋、複数のフロア、そして複雑な配線を持つ巨大な豪邸のようなものです。もしAIに写真から豪邸全体を建てるよう頼んだら、正面玄関は正しく作れても、階段を2階へとつなげる方法を忘れてしまったり、見た目はリアルだが蛇口から水が出ないキッチンを作ってしまったりするかもしれません。
解決策:LongWebBench
この論文の著者たちは、より過酷な新しいテストであるLongWebBenchを作成しました。彼らは、単に家が写真と「見た目が似ているか」をチェックするのではなく、次の2つのことをチェックします。
- 設計図(構造): 建物全体として理にかなっていますか? 部屋の順序は正しいですか? 屋根は壁に接続されていますか?
- 配管と電気(機能): 蛇口をひねったら水が出ますか? スイッチを入れれば電気がつきます?
テストの構築方法:
彼らは、現実世界の「豪邸の写真」(長いウェブページ)の2つの巨大なコレクションを集めました。
- 490件の「見た目一致」テスト: 彼らは非常に長いウェブサイト(底を見るまでに30画面分ほどスクロールしなければならないものもあります)の写真を取り上げました。そして、AIモデルにこれらのページを再現するためのコードを書かせました。テストでは、AIがページの最上部から最下部まで一貫したレイアウトを維持できるかどうかを検証しました。
- 507件の「実行」テスト: 彼らは129のウェブサイトを選び、「東京への航空便を探す」「商品をカートに追加する」「検索結果をフィルタリングする」といった具体的なタスクをAIに与えました。AIは、単にそれらが動作しているふりをするのではなく、実際のウェブブラウザ内でそれらを実際に実行できるコードを書かなければなりませんでした。
結果:「リアリティ・ギャップ」
この新しいテストで最高のAIモデルを実行したところ、驚くべきことが判明しました。
- 「ロングスクロール」問題: ウェブサイトが長くなるにつれて、構造を正しく維持するAIの能力は低下しました。これは、1階は完璧に設計できるものの、2階とのつなぎ方を忘れてしまう建築家のようなものです。
- 「偽物の家」問題: 多くのAIは、美しくリアルなウェブサイト(映画のセットのようなもの)を構築しましたが、ボタンをクリックしたりフォームを入力したりしようとすると、何も起こりませんでした。「配管」が壊れていたのです。
- 入力の問題: 研究者がAIにとって見やすくするために、長い写真を小さな断片に分割した場合でも、AIはそれらの断片を組み合わせて機能する一つの全体へと作り上げることに依然として苦戦しました。
テイクアウェイ(要点)
この論文は、AIを単にその描画がいかに美しいかで判断してはいけないと結論付けています。真に有用であるためには、AIは、操作したときに実際に機能する、長く複雑なウェブサイトを構築できなければなりません。LongWebBenchは、彼らが使用している新しい「物差し」であり、AIが描画には長けていても、完全に機能するデジタルの家を建てるまでには、まだ長い道のりがあることを示しています。
技術要約:LongWebBench
問題提起
近年のビジョン・ランゲージ・モデル(VLM)の進歩は、ウェブページのスクリーンショットのような視覚的入力からフロントエンド・コード(HTML、CSS、JavaScript)を生成する能力を示している。しかし、既存の評価ベンチマークは主に短尺で、単一画面かつ静的なウェブページに焦点を当てており、局所的な視覚的類似性を通じて成功を測定している。これにより、複数の画面にわたる、コンポーネントの反復、離れたセクション間でのスタイルの一貫性、そして複雑なマルチステップのユーザーインタラクションを必要とする実世界のウェブページに適用した際、重大な「リアリティ・ギャップ」が生じる。現在の評価では、モデルが長いコンテキストにおいてグローバルな構造を保持できるか、あるいは目標指向のタスクを実行可能なロジックを生成できるかを評価できていない。
手法
このギャップに対処するため、著者らは、構造的および機能的な両方の観点から長大なホライゾンのウェブページ生成を評価するために設計されたベンチマークであるLongWebBenchを導入する。このベンチマークは、2つの補完的なタスクで構成されている。
ウェブページ視覚忠実度複製 (W-VFR):
- 目的: モデルが長大なウェブページのグローバルな視覚構造を再現できるかどうかを評価する。
- データセット: 7つの構造的カテゴリ(情報記事、製品ページ、政府機関のページなど)にわたる、490個の実世界の長大なウェブページ(1920×1080解像度において3ビューポート高を超えるものと定義)。
- 評価プロトコル: 多次元的なVLMベースのメトリック(GPT-4oを使用)を用い、生成されたレンダリングをリファレンス・スクリーンショットに対して、ページスケール/スクロールの一貫性、グローバルレイアウト、セクション階層、ローカル視覚スタイル、および情報密度の5つの次元にわたり0〜10のスケールでスコアリングする。ローカルスタイルは、DINOベースの特徴量類似性によってさらに拡張される。
- 入力設定: 解像度の制約と長コンテキスト推論を区別するために、シングルイメージ(フルスクリーンショット)とマルチイメージ(ビューポートサイズのタイルに分割されたもの)の両方をサポートする。
ウェブページ機能忠実度実現 (W-FFR):
- 目的: 特定のユーザー目標をサポートする実行可能なウェブページをモデルが生成できるかどうかを評価する。
- データセット: 129のウェブページに分散された507個の目標指向型インタラクション・タスク(eコマース、旅行、データ可視化などの13の機能カテゴリを網羅)。
- 評価プロトコル: DOM拡張エージェント・ベースのパイプラインが、ブラウザ環境内で生成されたコードを実行する。コントローラーが「アクター」エージェントを調整して規定のアクションを実行させ、「クリティック(批評家)」エージェント(Gemini-3-Proを搭載)が、結果としてのDOMおよびページ状態がタスク仕様を満たしているかを検証する。
- 指標: ステップ成功率 (SSR)、タスク成功率 (TSR)、およびページ成功率 (PSR)。
主な貢献
- ベンチマークの構築: 長距離の構造的一貫性と実行可能なマルチステップ・インタラクションを共同で評価する初のベンチマークであるLongWebBenchを導入した。
- データセットの作成: レイアウト、コンテンツ密度、インタラクションの複雑さの多様性を確保した、構造的忠実度のための490個の長大なウェブページと、機能検証のための507個のインタラクション・タスクをキュレーションした。
- 評価プロトコル: 構造的忠実度のためのVLMベースのメトリックと、機能検証のためのエージェントベースの実行パイプラインという、補完的なプロトコルを設計し、人間との一致分析およびクロスジャッジの堅牢性チェックを通じて検証した。
- 実証分析: シングルイメージおよびマルチイメージ設定の両方において、最先端のオープンソースおよびプロプライエタリなVLMに対する包括的な評価を行った。
実験結果
GPT-5.2、Gemini-3-Pro、Claude-Opus-4.5、および様々なオープンソースモデル(例:GLM-4.6V、Qwen3-VL)を用いた実験により、以下のことが明らかになった。
- 構造的忠実度: ウェブページの長さが増すにつれて、パフォーマンスは一般的に低下する。マルチイメージ入力は解像度の制約を緩和するものの、グローバルなレイアウト計画やセグメント間の統合における課題を完全には解決しない。最も優れた性能を示すモデルであっても、非常に長いページでは中程度の構造的忠実度スコアしか達成できない。
- 機能的忠実度: 実行可能なインタラクションは、視覚的な再構築よりも大幅に困難である。高いステップ成功率 (SSR) を示すモデルであっても、タスク成功率 (TSR) やページ成功率 (PSR) は著しく低くなることが多く、これはマルチステップのワークフローにおけるエラーの蓄積を示唆している。例えば、トップモデルは86%以上のSSRを達成したが、TSRは約58〜59%であり、PSRは22%未満にとどまった。
- 長さへの感受性: 構造的忠実度と機能的成功率の両方が、ビューポート数(構造の場合)またはインタラクション・ステップ数(機能の場合)が増加するにつれて低下しており、長いホライゾンにおける状態維持とロジック保持の難しさを浮き彫りにしている。
- 評価の信頼性: 自動評価プロトコルは、人間による判断と強い一致を示し(W-VFRについてはピアソン相関係数 r=0.83、W-FFRについては一致度 >0.89)、異なるジャッジモデル間で高い堅牢性を示した。
意義と主張
本論文は、LongWebBenchが現在のVLMの能力における決定的な限界を浮き彫りにしていると主張している。それは、構造的に一貫しており、かつ機能的に実行可能な長いウェブページを生成する能力の欠如である。著者らは、ウェブページ生成を静的な視覚的類似性のみに基づいて評価することは不十分であると論じている。代わりに、実行可能なインタラクションを中核となる基準として扱う必要がある。このベンチマークは、モデルが視覚的に妥当な出力を生成できても、実世界のウェブアプリケーションに求められる複雑なマルチステップのユーザー目標をサポートすることには頻繁に失敗するという事実を明らかにするための、診断用テストベッドとして機能する。本研究は、将来のモデルが長距離の構造的推論とインタラクション・ロジックの合成を改善する必要があることを強調している。
限界
著者らは、LongWebBenchは安定したレンダリング済みのフロントエンドに焦点を当てており、認証、パーソナライゼーション、ライブ・バックエンド・サービス、および無制限の無限スクロールを除外していることを述べている。したがって、本ベンチマークは、外部データベースやサーバーサイド・ロジックを伴うデプロイされたウェブアプリケーションの全容ではなく、フロントエンドの構造と観察可能な振る舞いを評価するものである。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録