← 最新の論文
🤖 AI

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

本論文は、マルチモーダルLLMをビルド、ナビゲーション、視覚的忠実度、保守性、および効率性の観点から評価する、マルチスクリーン・モバイルアプリ生成のための初のプロジェクトレベルのベンチマークであるMobileForgeを紹介し、現在のモデルはアプリのコンパイルやナビゲーションは可能であるものの、信頼性の高いインタラクションやコードの品質には依然として課題があることを明らかにしている。

原著者: Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スマートフォンの写真が入ったフォルダをコンピュータに見せるだけで、そのアプリを構築するために必要なプログラム全体を即座に書き上げてくれる世界を想像してみてください。これは「デザイン・トゥ・コード(design-to-code)」と呼ばれる分野の約束であり、人工知能が視覚的な画像を、ソフトウェアを機能させるための実用的な指示へと翻訳しようとする試みです。長年、研究者たちはウェブページの画像を一枚見せ、その一つの画面を再現するためのコードを要求することで、これらのシステムをテストしてきました。これは単純で孤立したページに対しては目覚ましい成果を上げてきましたが、現実世界のソフトウェアの複雑さを見落としています。真のモバイルアプリケーションは単一の画像ではありません。それは多くの画面が繋がり、ある場所から別の場所へと移動させるボタンが存在し、体験全体を通じて一貫性を保たなければならない共有のデザイン要素が存在する、接続された世界なのです。果たして、人工知能は実際のアプリのスクリーンショットの完全なセットを見て、人間が実際に使用できるような、動作するマルチページプロジェクトを構築できるのでしょうか。

ある研究チームが、「MobileForge」という新しいテストを用いて、この問いに答えるべく立ち上がりました。モデルに単一のページを作らせるのではなく、アプリ全体を一から構築させるのです。研究者たちは、ソーシャルメディアから金融、ナビゲーションに至るまで、人々が日常的に使用している29種類の実際の人気モバイルアプリからスクリーンショットを集めました。これらのアプリには、合計309個の異なる画面が含まれていました。そして、これら最も高度な6つの人工知能モデルに対し、これらの画像を見てアプリの完全なソースコードを生成するよう求めました。テストを公平かつ厳格なものにするため、チームは各画面がどのように相互接続されるべきかの詳細なマップを作成し、生成されたアプリが実際に機能するかどうかを確認するための数百もの特定のテストを作成しました。彼らは、コードがコンパイル可能かどうかだけでなく、ナビゲーションボタンが正しい場所に誘導するか、視覚的なデザインが元の写真と一致しているか、そしてコードが後のエンジニアによるメンテナンスに適したクリーンなものであるかまでをチェックしました。

結果は、これらのモデルができることと、依然としてできないことの間の明確な境界線を明らかにしました。肯定的な側面として、すべてのモデルが、動作するプロジェクトへとビルド可能なコードを生成することができました。最も強力なモデルは、生成されたアプリ内をナビゲートし、約92パーセントの確率で正しいページに到達することさえできました。しかし、動作するアプリから完璧なアプリへの道のりは、まだ長いものです。コードは実行可能でしたが、視覚的な詳細は元の写真から逸脱することがよくありました。モデルは、異なる画面間で色やレイアウトの一貫性を保つことに苦戦し、単一の共有コンポーネントを使用する代わりに、ページごとに少しずつ異なる方法でナビゲーションバーを再作成してしまうことが頻繁にありました。この不一致により、アプリはオリジナルに似てはいるものの、プロフェッショナルに設計された製品のような洗練された統一感を欠いていました。

おそらく最も驚くべき発見は、視覚的に正確であることが、必ずしもコードが上手く書かれていることを意味しないということでした。最も視覚的に忠実なアプリを生成したモデルは、他のモデルが生成したコードよりも2倍長く、2倍も乱雑なコードを生成していました。そのモデルは多くの未使用の部分を作り出し、共通の要素を効率的に再利用することに失敗していました。対照的に、別のモデルは、視覚的な出力はわずかに完璧さに欠けるものの、人間にとって編集やメンテナンスが容易な、より短くクリーンなコードを生成しました。これは、現在の世代の人工知能が、アプリの外観と、その基礎となるコードのエンジニアリング品質とのバランスを取る方法をまだ学習していないことを示唆しています。また、研究者たちは、モデルが予測可能な方法で失敗することも発見しました。時にはボタンが画面上に表示されているもののクリックしても何も起きなかったり、またある時には画面がロードされるものの完全に空白のままとなり、ユーザーが行き詰まってしまうこともありました。これらの失敗はランダムな不具合ではなく、視覚的な要素とその機能の間のつながりに関するモデルの理解における、具体的な崩壊でした。

このテストを実施するために、研究者たちは単純な視覚的比較を超えた、成功を測定するための新しい方法を考案しなければなりませんでした。彼らは、コンピュータがアプリ内を連鎖的に彷徨うのではなく、各テストを特定の固定された地点から開始することで、ナビゲーションをテストする方法を開発しました。これにより、一つのミスが評価全体を台無しにすることを防ぎました。また、生成された画面を元の写真と比較する人工知能の判定役となるシステムも作成しましたが、そこには判定役が実際に注意を払っているのか、単に推測しているだけなのかを確認するためのセーフティチェックも組み込まれました。この厳格なアプローチにより、古いテストでは見逃されていたであろうモデル間の微妙な違いを捉えることができました。研究は、人工知能が画像をコードに変換することにおいて大きな飛躍を遂げたものの、複雑なマルチスクリーンプロジェクトにおいて人間のデザイナーやエンジニアに取って代わる準備はまだ整っていないと結論付けています。テクノロジーはアプリの骨格を構築することはできますが、アプリケーションをリアルで信頼できるものにするための、ナビゲーションの筋肉の記憶やデザインの一貫性という細部においては、依然として苦戦しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →