← 最新の論文
🤖 AI

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

HTMLCure は、決定論的な相互作用軌跡を通じてインタラクティブな HTML を評価・修復する状態誘導型ブラウザ体験フレームワークを導入し、シードコーパスを高品質なデータセットへと大幅に拡張することで、27B モデルが Kimi-K2.6 や GPT-5.4 などの最先端システムと同等の性能をインタラクティブな Web ベンチマークで達成することを可能にします。

原著者: Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、HTMLCURE 論文の説明を、日常的な比喩を用いたシンプルな概念に分解したものです。

大きな問題:「見た目だけ良く、実際は壊れている」

あなたが非常に才能のある芸術家(AI)に、おもちゃの車を組み立てるよう頼んだと想像してください。芸術家は美しいモデルをあなたに手渡します。写真で見れば完璧に見えます。しかし、あなたがそれを押そうとすると車輪が外れ、ハンドルを操作しようとするとハンドルが無意味に空回りします。

これが現在の AI 生成 Web ページ(HTML)が抱える問題です。単一のスナップショット(スクリーンショット)では美しく見えても、実際の人がボタンをクリックしたり、スクロールしたり、ウィンドウサイズを変更したり、ゲームを遊んだりしようとすると、ページが壊れてしまいます。

  • 従来の方法: 研究者たちは以前、ページの写真を見て、それが美しく見えるか確認し、「良い」かどうかを判断していました。これでは、外れた車輪などの欠陥を見逃していました。
  • 結果: 実際には修正可能な数千のページを捨ててしまったり、見た目だけ良く機能しないページをそのまま残したりしていました。

解決策:HTMLCURE(「試乗」メカニック)

著者たちは HTMLCURE というシステムを構築しました。単に写真を見るのではなく、HTMLCURE は車を試乗するメカニックのように機能します。

以下がその仕組みをステップごとに説明したものです。

1. 試乗(ブラウザ体験)

単に写真を撮るのではなく、HTMLCURE は Web ページを実際のブラウザに読み込みます。ただ待っているのではなく、積極的に相互作用します:

  • 上下にスクロールします。
  • ウィンドウサイズを変更します(まるで、小さなガレージに車が入るか確認するかのように)。
  • ボタンをクリックし、リンクにカーソルを合わせ、ゲームをプレイしようとします。
  • 何が起こったかを正確に記録します。「ボタンが機能しなかった」「ゲームがフリーズした」「モバイル版でレイアウトが崩れた」など。

比喩: これは車の運転テストのようなものです。塗装の美しさを見るだけでなく、エンジンがかかるか、ブレーキが効くか、変速が滑らかかを確認するために実際に運転します。

2. 診断(状態信号)

試乗後、システムはページに「健康スコア」と診断を与えます。医師が患者をトリアージ(優先度付け)するように、ページを 3 つのグループに分類します:

  • 低スコア(廃車): ページはぐちゃぐちゃです。構造の大きな部分が欠けています。
    • 対策: 完全書き換え。 パッチを当てようとするのではなく、ゼロから新しい車を組み立てます。
  • 中スコア(ボロ車): ページは概ね機能していますが、特定の破損部分があります(例:ラジオが動かない、ドアノブが固着しているなど)。
    • 対策: 標的修理。 特定の破損部分を診断し、その部分だけを修理します。
  • 高スコア(スポーツカー): ページはすでに素晴らしい状態です。
    • 対策: 磨き上げのみ。 エンジンには触れないでください。おそらく塗装をワックスかける程度に留めます。「壊れていない」ものを「修理」しようとすると、逆に壊してしまう可能性があります。

重要な洞察: 論文は、すべてのページに同じ修理方法を使用することは誤りであると主張しています。ページが実際にどの程度壊れているかによって、異なる戦略が必要です。

3. 修理ループ(フィードバックサイクル)

システムが戦略(書き換え、パッチ、磨き上げ)を決定すると、AI にページを修正するよう依頼します。

  • 重要なステップ: システムは AI の言葉をただ信じるわけではありません。新しいバージョンのページを取得し、試乗を再度実行します。
  • ゲートキーパー: 新しいバージョンが改善されていれば、それを採用します。もし新しいバージョンが悪化した場合(「回帰」)、それを捨てて再度試みます。
  • 目標: ページが高品質の基準(100 点満点中 97 点)をクリアするまで、これを繰り返します。

比喩: 料理人がスープを味見していると想像してください。塩辛すぎれば、水を追加します。そして再度味見します。水で直ったと単に想定するのではなく、確認します。もし水を入れすぎて味が薄くなりすぎたら、止めて別のレシピを試します。

結果:より良いライブラリの構築

著者たちは、97,000 件の AI 生成ページという膨大なコレクションに対してこのシステムを使用しました。

  • 彼らは「完璧」なページの小さな山から始めました。
  • HTMLCURE を使用して「壊れた」ものを修正しました。
  • その結果、63,000 件の高品質で検証済みのページ(元の小さなセットから増加)を手にしました。

彼らはその後、この新しくクリーニングされたライブラリを使用して、新しい AI モデル(HTMLCure-27B と呼ばれる)をトレーニングしました。

結果:

  • 新しいモデルは、機能する Web ページを作成する能力が大幅に向上しました。
  • HTMLBENCH という厳格なテストで 50.6 というスコアを記録し、Kimi-K2.6 や GPT-5.4 などのトップクラスの商用モデルと同等の性能を示しました。
  • 別のテスト(MiniAppBench)では、未トレーニングのバージョンと比較して 15 ポイント 向上しました。

一文で要約

HTMLCURE は、AI が Web ページが機能するかどうかを単に「推測」するのをやめさせるシステムです。代わりに、AI にすべてのページを試乗させ、何が壊れているかを正確に診断し、適切な戦略で修理し、修正が実際に機能したかを確認するために再テストさせ、高品質で機能するコードの膨大なライブラリを作成します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →