← 最新の論文
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBenchは、フロントエンドのアーティファクトのインタラクティブで多様かつ急速に進化する性質に対処するため、専門化された役割を伴う動的で協調的なレビュープロセスへとウェブ生成の評価を再定義する、自動化されたエージェント型フレームワークを導入し、それによって人間の専門家の判断との整合性を実現します。

原著者: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単にあなたとチャットするだけでなく、実際に物を作り上げる世界を想像してみてください。人工知能、特に大規模言語モデル(LLM)の領域において、私たちは、これらのデジタルな精神が単なる一文を作るだけでなく、ウェブサイト全体を作成するためのコードを書けるという地点に到達しました。LLMを、超高速で驚くほど知識豊富な「見習い建築家」だと考えてみてください。もしあなたが「ツリーハウスを作って」と頼めば、それは設計図を引き、木を切り出し、壁にペンキを塗ることさえできます。しかし、ここからが厄tricな部分です。そのツリーハウスが、実際に登っても安全かどうか、どうすればわかるのでしょうか?長い間、私たちはこれらのAIビルダーを、彼らの設計図(コード)を見たり、完成した家の写真を一枚撮ったりすることでテストしてきました。しかし、ウェブサイトは静止した写真ではありません。ボタンがクリックされ、アニメーションが跳ね、ユーザーが歩き回る、生き生きとした呼吸をする遊び場なのです。もし設計図だけをチェックしていたら、グラグラの梯子や、開かないドアを見逃してしまうかもしれません。これが、研究者たちが取り組んでいる大きな問いです。「AIが、単に紙の上で見た目が良いだけでなく、実際に『機能』し、使い心地の良いウェブサイトを構築できるかどうかを、どうやってテストするのか?」

そこで、まさにこの問題を解決するために設計された、新しく巧妙なフレームワークであるLiveEvalBenchが登場します。著者たちは、従来のテスト方法――まるで教師が静的なエッセイを採点するようにすること――は、インタラクティブなウェブプロジェクトには不十分であると主張しています。その代わりに、彼らは、AIの創造物を徹底的に調査するために、それぞれ異なる役割を持つ専門の検査チームのようなシステムを構築しました。

彼らの「検査チーム」は次のように機能します:

  1. ビルド・エンジニア(建設技師): 家を実際に組み立てようとする建設現場のフォアマン(現場監督)を想像してください。このエージェントは、AIのコードを受け取り、ウェブサイトを起動しようと試みます。もしウェブサイトがクラッシュしたり、指示が分かりにくかったりすれば、このエンジニアがそれを検知します。
  2. コード・エンジニア(コード技師): これは、家に触れることなく設計図(ソースコード)を見る品質管理検査員です。彼らは、材料が整理されているか、構造が健全か、そしてAIがあなたの与えた特定のルール(例えば「青いペンキを使う」や「Reactアプリにする」など)に従っているかをチェックします。
  3. UIテスター(UIテスター): これは、遊び場を駆け回る好奇心旺盛な子供です。このエージェントはコードを一切見ません。ただボタンをクリックし、画像の上にマウスを重ね、人間と同じようにウェブサイトを使おうとします。アニメーションがスムーズか、テキストが読みやすいか、そしてサイトが実際に依頼した通りに動作するかどうかをチェックします。

LiveEvalBenchが特別なのは、それが**適応型(アダプティブ)**であることです。過去のテストは、正解が一つしかない多肢選択式のクイズのように硬直的でした。しかし現実の世界では、素晴らしいウェブサイトを作る方法は無数にあります。LiveEvalBenchは、AIが「実際に何を作ったか」を見て、その特定のバージョンに対するカスタムチェックリストを作成します。もしAIがドロップダウンメニューの代わりにスライドアウトメニューを作った場合、テストはドロップダウンでないことを理由に不合格とするのではなく、そのスライドアウトメニューが正しく機能するかどうかをチェックするために適応します。それは、ピザが正方形でも円形でも、美味しく食べられる限りは良しとする審判のようなものです。

研究者たちは、この新しいシステムを100件の実世界の要求(単純なタスクから複雑なマルチページ・アプリケーションまで)に対してテストし、11の最もスマートなAIモデルにそれらを構築させました。結果は啓発的なものでした。多くのモデルは、コードを書き、ウェブサイトを起動させることには長けていましたが、実際のユーザー体験に関してはつまずくことがよくありました。「UIテスター」は、ユーザーがサイトを操作しようとしたときに、ボタンがクリックできなかったり、アニメーションがフリーズしたり、レイアウトが崩れたりといった問題が最も多く発生することを突き止めました。

彼らがこのAI検査官を人間の専門家と比較したところ、結果は非常に近く、この自動化されたチームがAIビルダーを判断するための信頼できる方法であることを示唆していました。研究によると、最高のモデルは約90点満点中70点を獲得しており、トップのパフォーマー(Claude Opus 4.7のようなモデル)は強力なスキルを示した一方で、他のモデルはインタラクティブな部分で大きく苦戦しました。論文は、AIは構築することについては上手くなっているものの、「楽しい」部分――生き生きとしていて反応の良いものを作ること――が依然として最大の挑戦であることを示唆しています。LiveEvalBenchは、AIが構築することに長けていくにつれて、それらの建物が安全で楽しく、世界に送り出せる準備ができていることを確認するための適切なツールを確保するための、新しい柔軟な測定方法を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →