← 最新の論文
💻 computer science

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design

StepX-Edgeは、UI特化型アーキテクチャ、相乗的な5段階のトレーニングカリキュラム、および高精度な量子化戦略の新規な共同設計を通じて、最先端のUI理解とモバイルチップへの効率的なリアルタイムデプロイを実現する0.9Bパラメータのオンデバイス・ビジョン言語モデルです。

原著者: Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、本を読み、写真を見て、それらについて質問に答えることができる超スマートなロボットの脳を持っていると想像してみてください。これが**視覚言語モデル(VLM)**の世界です。長い間、これらの脳は、膨大な電力とメモリを必要とするため、巨大なサーバーを備えたクラウド上の巨大なデータセンターの中に住んでいました。しかし、もしその脳をスマートフォンの内部に収まるほど小さくできたらどうでしょう? それが夢なのです。インターネット接続なしで、あなたのスマートフォンの画面を見て、あなたが何をしているかを理解し、正しいボタンをタップするのを手助たくしてくれるAIを持つことです。

問題は、古典的なトレードオフです。画面上の小さなテキストを読んだり、特定のアイコンを見つけたりできるほど脳を賢くするには、通常、大量の「ニューロン」(パラメータ)が必要であり、それがモデルを重く、遅くしてしまいます。しかし、あなたのスマートフォンには、バッテリー、メモリ、および処理能力に関する厳しい制限があります。脳を小さくしすぎると、モデルは愚かになり、「閉じる」ボタンを「保存」ボタンだと勘違いするような間違いを犯し始めます。もし大きく保てば、数分でバッテリーを消耗させてしまいます。科学者たちは、この「精度 vs 効率」というパズルを解こうと試みてきましたが、多くの場合、賢いが遅いモデルか、速いが愚かなモデルかのどちらかを選ばざるを得ませんでした。

そこで登場したのが、このコードを解いたと主張する新しいプロジェクト、StepX-Edgeです。研究者たちは、モバイルフォン上で直接動作する、わずか0.9ビリオン(9億)パラメータ(この種のタスクとしては非常に小さなサイズ)を持つ極小のAIモデルを構築しました。彼らは単に既存の巨大なモデルを縮小したのではなく、設計そのものをゼロから作り直しました。これは、トラックに小さなエンジンを載せ替えるのではなく、カスタム・レーシングカーをゼロから組み立てるようなものです。

第一に、彼らはアーキテクチャ(車のフレーム)を再設計しました。彼らは、モデルのために、スマートフォンの画面特有の形状(正方形の写真とは異なり、縦長で細長いことが多い)に執着する特別な「目」を作り、そして「目」が見ているものと脳の言語スキルを結びつけ、詳細を失わないための「架け橋」を作りました。彼らは、スマートフォンがうまく扱えない派手で複雑なパーツを避け、モバイルチップ上でスムーズに動作する、標準的で信頼性の高いパーツを採用しました。

第二に、彼らはトレーニング(ドライバーの学校)を変更しました。モデルをあらゆる種類のデータの混沌とした混合物に投げ込む代わりに、彼らは「カリキュラム」アプローチを使用しました。彼らは、テキストを読む(OCR)、画面レイアウトを理解する、質問に答える、そして特定のボタンを指し示すという4つのスキルを同時に教えることが、実際にはそれらすべてを共に向上させることを発見しました。それは、ピアノとチェスの両方を学ぶ学生のようなものです。一方への集中力が、もう一方の助けとなるのです。彼らは、単純なアライメント(整合)から始まり、徐々に複雑で現実世界の画面操作へと移行する5つのステージでモデルを訓練し、4つのスキルが注意を奪い合うのではなく、互いに補強し合うようにしました。

最後に、彼らはデプロイメント(エンジンのチューニング)を極めました。モデルをスマートフォンに収めるために、彼らは大幅な圧縮を行う必要がありましたが、これは通常、知能を損なわせます。チームは、巧妙な2段階の圧縮テクニックを使用しました。彼らは「目」(視覚部分)と「脳」(言語部分)を別々に扱い、脳を極小の4ビットサイズに圧縮する一方で、目の精度をより高く保ちました。そして、圧縮された脳が詳細の喪失をどのように補うかを「教える」ための特別なトレーニング手法を用い、精度の低下を1%未満に抑えました。

結果はどうでしょうか? 高性能なスマートフォン用チップ(Snapdragon 8 Gen 2)において、この小さなモデルは安定して動作します。スクリーンショットを見て、それを理解し、質問への回答を開始するのに約0.84秒かかり、98トークン/秒の速度でテキストを生成し、メモリはわずか1.4 GBしか使用しません。テストでは、この0.9Bモデルは、画面上の中国語テキストの読み取りやディスプレイ上の内容に関する質問への回答といったタスクにおいて、より大きなモデル(2〜2.3ビリオンのパラメータを持つものもある)に匹敵するか、あるいはそれらを上回りました。著者らは、アーキテクチャ、トレーニング、およびデプロイメントを注意深く共同設計することで、速度のために精度を犠牲にすることなく、非常に有能なオンデバイスAIを持つことが可能であり、あなたのスマートフォン内で完全に完結するスマートアシスタントへの扉を開くことができると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →