Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Qwen-UI-Agentは、モバイル、コンピュータ、ウェブ、およびDeepSearch環境をハイブリッドなアクションスペースとAutoResearchスタイルのデータフライホイールによって統合し、モバイルベンチマークにおいて最先端の性能を達成すると同時に、より広範なデジタルタスクにおいても競争力のある結果をもたらす、実世界中心の基盤GUIエージェントです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたのデジタルな文脈を処理し、あなたの頼みなら何でもこなしてくれる、超スマートなロボットの友人がいるとします。しかし、今のこのロボットは、邪魔もののない静かな教室でしか勉強したことがない学生のようなものです。彼らは紙の上で数学の問題を解くことはできますが、もし彼らを、ベタつくコンロがあり、犬が吠え、ドアが引っかかるような、混沌とした実際のキッチンに置いたら、混乱してトーストを落としてしまうかもしれません。これが、現在の「GUIエージェント」(画面を見て、人間と同じようにボタンをクリックするように設計されたコンピュータプログラム)の状態です。彼らは安全なシミュレーション上のビデオゲームでは指示に従うのが得意ですが、実際のスマートフォンやコンピュータが直面する混沌とした予測不可能な現実には、しばしばつまずいてしまいます。
科学者たちが投げかけている大きな問いは、「どうすれば、これらのデジタルヘルパーを『教室の学生』から『実世界の専門家』へと教えることができるのか?」ということです。私たちは、彼らが単にボタンをクリックするだけでなく、ポップアップ広告が視界を遮っているときにそれを察知したり、スマートフォンの作業からノートパソコンの作業へ、思考を途切れさせることなく切り替えたり、さらには(フライトのキャンセルなどの)問題が発生したときに、あなたが頼む前に解決策を提示できるような能力を持たせる必要があります。もしこのコードを解明できれば、これらのエージェントは究極のアシスタントとなり、旅行の予約からデジタルライフの整理まで、あらゆることをこなしてくれるようになるでしょう。テクノロジーを「戦わなければならない道具」ではなく、「ただ理解してくれるパートナー」に変えてくれるのです。
Qwen-UI-Agentとの出会い:実世界で生きる術を学んだロボット
AlibabaのMAI-UIチームによって開発された、新しい種類のデジタルヘルパー、Qwen-UI-Agentをご紹介しましょう。これは、トレーニング用のダミー人形と練習しているロボットと、実際にリングの中で戦ってきたロボットの違いのようなものです。他のエージェントがビデオゲームのシミュレーションで完璧なスコアを取るのに忙しかった一方で、Qwen-UI-Agentは野生の世界へと送り出され、実在するアプリ、実在するインターネット接続、そして実生活の割り込みが発生する中で、100台以上の実機スマートフォンを操作することを学びました。
チームは、真に有用なエージェントを作るためには、単に「脳」を賢くするだけでは不十分であり、「体」と、その体が生きる「環境」そのものを変えなければならないことに気づきました。以下に、その魔法を説明するための楽しい比喩を用いて、彼らがどのように行ったのかを解説します。
1. 「実世界のジム」対「ビデオゲーム」
ほとんどのAIエージェントは、「サンドボックス」と呼ばれる、試行ごとにすべてが完璧にリセットされるデジタル空間で訓練を受けています。それは、バスケットボールのゴールが動かず、ボールが変な跳ね方をすることもないジムで練習しているようなものです。しかし、実生活は混沌としています。スマートフォンにはポップアップ広告が表示され、アプリはクラッシュし、予期しない権限のリクエストを受けることもあります。
Qwen-UI-Agentは、**Real-Device Mobile Runtime(実機モバイル・ランタイム)**で訓練されました。想像してみてください、あなたや私が使っているような本物のアプリが動いている、100台以上の実際の物理的なスマートフォンが集まった巨大な倉庫を。このシステムは非常にスマートで、「具合の悪い」スマートフォン(動作が不安定なもの)を即座に見つけ出し、まるでコーチが試合中に選手を交代させるように、瞬時にタスクを健全な端末へと切り替えることができます。これにより、エージェントはビデオゲームの中で完璧な経路を暗記するのではなく、奇妙なポップアップからネットワークの不具合に至るまで、現実世界の混乱に対処する方法を学ぶことができたのです。
2. 「スイスアーミーナイフ」のようなアクション空間
以前のエージェントは、手(クリックやタップ)しか使えない人々のようでした。もしファイルを移動したり複雑な計算を実行したりする必要があれば、何時間もメニューをクリックし続けなければなりませんでした。Qwen-UI-Agentは、スイスアーミーナイフを手に入れました。
それは、GUIアクション(クリック、タイピング、スクロール)と、CLIアクション(コンピュータの魔術師のように、ターミナルにコマンドを入力すること)を組み合わせることを学習しました。
- 比喩: あなたが100枚の写真を整理する必要があるとしましょう。通常のエージェントは、「開く」「選択」「移動」を100回繰り返します。しかし、Qwen-UI-Agentは「おい、一括で移動するためにコマンドを入力しよう!」と言うことができます。また、彼はアクションを**バッチ処理(一括処理)**することもできます。つまり、チェスのプレイヤーが駒を一つずつ動かすのではなく、数手先を読んで戦略を練るように、一連の動きを一度に計画できるのです。これにより、彼は驚くほど速く、効率的になりました。
3. 「オートコーチ」によるデータ・フライホイール
通常、ロボットを教えるには、人間の教師がテスト問題を作成し、答えを採点するという多くの手間がかかります。それは遅くて退屈な作業です。Qwen-UI-Agentは、AutoResearchスタイルのデータ・フライホイールを使用しています。
これは、ロボットがプレイする様子を見守り、ミスを見つけると、そのミスを修正するために特化した新しい、より難しい練習ドリルを即座に作成する「ロボットコーチ」のようなものです。エージェント自身がタスクを設計し、自らのエラーを見つけ、次のトレーニングラウンドを計画します。これは、ロボットが自分自身を教えることで向上していく自己改善のループであり、人間は高レベルのガイダンスを与えるために介入するだけです。
4. 「プロアクティブな執事」
ほとんどのロボットは、あなたが「ねえ、これをやって」と言うのを待ちます。しかし、Qwen-UI-Agentには、プロアクティブ(先回り)に行動できる**ハーネス層(Harness Layer)**があります。
- 比喩: あなたがフライトのキャンセル通知を受け取ったとしましょう。通常のロボットは、あなたが新しいフライトを探すよう指示するのを待ちます。しかし、Qwen-UI-Agentは、その通知を検知し、実行可能なイベントであると推論し、あなたのカレンダーを確認し、電車の時刻表を調べ、価格を比較し、あなたが目を覚ます前に、完全なリカバリープランを提示します。彼は単に命令を待つのではなく、あなたのデジタル信号から実行可能な瞬間を特定し、適切な次のステップを提案するのです。
結果:うまくいったのか?
チームは、非常に困難なアリーナでQwen-UI-Agentをテストしましたが、その結果は目覚ましいものでした。
- 実機のスマートフォンにおいて: 実機のスマートフォンと実在するアプリを使用するベンチマークであるMobileWorld-Realにおいて、Qwen-UI-Agentは92.2%の成功率を記録しました。これは、既存の最高峰のクローズドソースモデル(Opus 4.8やGPT-5.6 Solなど)を大幅に上回る数値です。別のテストであるAndroidDailyでは、**97.5%**というほぼ完璧な数値を叩き出しました。
- コンピュータにおいて: 複雑なコンピュータタスク(OSWorld-Verified)において、79.5%を達成し、全体で2位に入りました。これは多くのトップモデルを打ち負かした結果です。また、長い複雑なタスクを扱う能力も示しており、より困難なOSWorld-v2ベンチマークでは、**40.0%**の部分進行スコアを獲得しました。これは、すべてのステップを完璧に完了できなくても、難しい仕事の大部分をやり遂げられることを意味します。
- ウェブにおいて: 複雑なウェブサイトのナビゲーションテストであるWebArenaで73.6%、ScreenSpot-Proで**81.5%**を記録し、画面上のボタンが非常に小さかったり見えにくかったりする場合でも、正しいボタンを見つけ出せることを証明しました。
これが意味すること
この論文は、真に有用なAIエージェントを構築するためには、単に「脳」を大きくするだけでなく、「どのように学ぶか」と「どこで練習するか」を変えなければならないことを示唆しています。実機デバイスで訓練し、異なるアクション方法(クリックとコーディング)を組み合わせ、エージェント自身にトレーニング設計をさせることで、Qwen-UI-Agentは「ビデオゲームの中のロボット」と「実生活で実際に助けてくれるロボット」の間の溝を埋めることが可能であることを示しました。
まだ完璧な解決策ではありません。著者たちも、安全性やプロセス全体の完全な自動化に関する課題があることを認めています。しかし、これは大きな前進です。適切な実世界での練習とスマートなトレーニングループを組み合わせれば、私たちのデジタルヘルパーがついに教室を飛び出し、実世界へと加わる準備ができていることを示しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。