← 最新の論文
🤖 machine learning

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

本論文は、観測可能なテキストと色の証拠を選択的にグラウンディングしてJSXを直接生成することで、スクリーンショットからのコード生成における忠実度と効率性のトレードオフを改善する、軽量なツールグラウンディング・フレームワークであるWidgetGenを紹介しており、これは直接的なプロンプティングや構造化されたパイプラインの両方を凌駕すると同時に、オープンウェイトモデルの効果的なファインチューニングも可能にするものである。

原著者: Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに写真を見て家を描く方法を教えようとしていると想像してみてください。これは「スクリーンショット・トゥ・コード(screenshot-to-code)」という、コンピュータサイエンスの一分野の世界です。そこでは、人工知能がウェブサイトやアプリの静止画像から、それを構築するための実際のプログラミング指示(コード)へと変換しようと試みています。長い間、科学者たちはこのための最善の方法について議論してきました。一つのアプローチは、教科書なしでテストを受ける学生のように、ロボットに一度に絵全体を推測させることです。これは速くて柔軟ですが、ロボットは細部を幻覚(ハルシネーション)として作り出してしまい、存在しない窓を描いたり、色を間違えたりすることがよくあります。もう一つのアプローチは、厳格で承認済みの設計図に従って、ロボットにレンガを一つずつ積み上げるように強制することです。これはロボットが独自のルールを作ることができないため正確ですが、遅くて硬直しており、もし家が変な形をしていて設計図がカバーしていない場合、ロボットは行き詰まってしまいます。

大きな疑問は、研究者たちが問いかけていることです。私たちは両方の良いところを取ることができるのでしょうか?ロボットが突拍子もない推測をしないように、ちょうど適切な量の「参考資料」を与えつつ、厳格で退屈な設計図に従わせることもなくできるのでしょうか?これこそが、論文「From Visual Widgets to UI Code: Efficient Tool-Grounded Generation」が取り組んでいる内容です。この論文は、「ウィジェット(widgets)」、つまりスマートフォンの画面やコンピュータの至る所で見られる、天気カード、音楽プレーヤー、株価チャートのような、小さく自己完結したブロックに焦点を当てています。これらは、小さくてもテキスト、色、形状が密集しているため、たった一つの小さなミスが全体を台無しにしてしまうという、非常にトリッキーなものです。著者たちは、複雑でカスタムメイドのルールでロボットを遅らせることなく、より賢く、より正確にできるかどうかを知りたいと考えています。

研究者たちは、WidgetGenと呼ばれる新しい手法を紹介しています。これは、ロボットが描き始める前に、いくつかの特定のヒントを渡すスマートなアシスタントのように機能します。ロボットがテキストや色をゼロから推測する(そして、それを間違えることが多い)代わりに、WidgetGenは特別なツールを使用して、スクリーンショットからテキストを「読み取り」、色を直接「測定」します。これは、ロボットに虫眼鏡とカラー見本帳を与えるようなものです。これらの確かな事実を手に入れた後、ロボットは自分の脳を使ってレイアウトを考え、コードを直接書き出します。

論文によれば、この「選択的なツール・グラウンディング(selective tool grounding)」は驚くほどうまく機能します。WidgetGenを1,000種類の異なるウィジェットに対して6つの異なるAIモデルでテストしたところ、ほとんどのカテゴリーにおいて、「推測」による手法と「硬直した設計図」による手法の両方に打ち勝ちました。具体的には、WidgetGenが生成したコードは、元の画像にMuch(ずっと)近く、テキストの読みやすさ、色の正確さ、そして元のウィジェットのサイズや形状にほぼ完璧に一致するレイアウトにおいて優れた結果を示しました。実際、「ジオメトリ(幾何学)」スコア(形状がどれだけ一致しているか)において、WidgetGenはテストしたすべてのモデルで完璧な100.00を叩き出しましたが、他の手法は90を超えるのに苦労することがよくありました。

著者たちはまた、この手法が効率的であることも発見しました。硬直した設計図による手法は、特別なルールをコンパイルするために多くの追加ステップと時間を必要としましたが、WidgetGenはより速く、より安価に実行でき、それでいてより高品質な結果を生み出しました。彼らはさらに、WidgetGenが生成したコードを、他のより小さなAIモデルにその仕事をより良く行う方法を教えるための「学習データ」として使用できることを示し、ロボット自身の成功した絵を、その弟分たちのための教科書へと効果的に変えることができると証明しました。

しかし、論文は慎重にその限界についても述べています。結果は単一のデータセットからの1,000個の特定のウィジェットに基づいているため、この方法が世界中のあらゆる種類のアプリやウェブサイトで機能するかどうかはまだ分かっていません。また、テストは最終的な絵が正しく見えるかどうかを確認しただけであり、ボタンが実際に機能するか、あるいはコードが人間にとって読みやすく修正しやすいかどうかについてはテストしていません。しかし、小さなウィジェットのスクリーンショットを動作するコードに変換するという特定のタスクにおいて、WidgetGenは、AIに少数の信頼できる事実を与えることが、厳格で柔軟性のないルールブックに従わせるよりもはるかに優れた戦略であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →