← 最新の論文
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

本論文は、マルチティーチャー・オンポリシー蒸留と新たに構築されたUni-GUIデータセットを活用することで、デスクトップとモバイルの専門知識を効果的に統合し、データの希少性や相互作用の慣習の相違に関連する課題を克服する、統一されたクロスプラットフォームGUIエージェントを学習させる新しいフレームワークであるUI-MOPDを提案する。

原著者: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのデジタルアシスタントが熟練のシェフである世界を想像してみてください。しかし、ここにひねりがあります。そのシェフは、全く異なる2つのキッチンで同時に料理を作らなければなりません。一つは、巨大なスクリーン、マウス、キーボードを備えたハイテクなデスクトップコンピュータのキッチンです。もう一つは、タッチスクリーンを備え物理ボタンのない、洗練されたポケットサイズの携帯電話のキッチンです。コンピュータのキッチンでは、「戻る」ことはウィンドウを閉じることを意味するかもしれません。一方、携帯電話のキッチンでは、それは小さな「戻る」矢印をタップすることを意味します。もし、レシピをすべて混ぜ合わせて、うまくいくことを期待しながら、シェフに両方の場所での料理を教えようとしたら、結果は悲惨なものになります。シェフは混乱し、マウスの使い方を忘れ、キーボードをスワイプしようとしてしまうのです。これは、私たちのデジタルライフの中でタスクを遂行するために、クリック、タイピング、スワイプを行うように設計されたスマートなコンピュータプログラムである「GUIエージェント」に関して、科学者たちが直面しているまさにその問題です。

長い間、これらのエージェントはスペシャリストのような存在でした。あるものはコンピュータに優れ、別のものはスマートフォンに優れていましたが、両方を扱うことはできませんでした。研究者たちは、これら2つのスペシャリストを単に叩き合わせ、その結合された知識がスーパーエージェントを生み出すことを期待することで、これを修正しようとしました。しかし、この新しい研究が示唆しているように、その「ミックス・アンド・マッチ」のアプローチは、しばしば境界線を曖昧にし、エージェントを両方の仕事においてより悪化させてしまいます。誰もが抱く疑問はこうです。「どうすれば、精神を崩したりスキルを失ったりすることなく、デスクトップとモバイルの間をシームレスに切り替えられる、単一の統合されたエージェントを構築できるのか?」

ここで、清華大学、Xiaomi、およびその他のトップ機関の研究者によって提案された、巧妙な新手法「UI-MOPD」が登場します。UI-MOPDを、ミキサーではなく、独自のトレーニング戦略を持つ優れたコーチだと考えてください。新しい統合エージェント(学生)に、濁った混ざり合った指示を暗記させるのではなく、コーチは2人の専門家メンター、「デスクトップ・グルー(デスクトップの達人)」と「モバイル・グルー(モバイルの達人)」を備えたダイナミックなトレーニングキャンプを設定します。

魔法がどのように起こるのかを説明しましょう。学生エージェントは、自力でタスクを解決しようと試み、自身の「ロールアウト(実行の試行)」を生成します。学生がコンピュータのタスクに取り組んでいるとき、コーチは即座にデスクトップ・グルーを呼び出し、具体的で高品質なアドバイスを与えます。学生が携帯電話のタスクに切り替えると、コーチはモバイル・グルーと入れ替わります。これは「マルチプラットフォーム・オンポリシー蒸留(Multi-Platform On-Policy Distillation)」と呼ばれます。鍵となるのは、学生が違いを平均化しようとするのではなく、適切なタイミングで、適切な専門家から学ぶことです。デスクトップ・グルーは学生にスワイプの仕方を教えようとはしませんし、モバイル・グルーはマウスの使い方を教えようともしません。彼らは「行動のアンカー(行動の錨)」として機能し、学生の行動を現在いる環境の特定のルールに忠実なものに保ちます。

研究者たちは、これを可能にするために「Uni-GUI」と呼ばれる大規模で高品質なデータセットを構築しました。彼らは、コンピュータと携帯電話の両方でタスクが行われている、10,000件近い高品質で動作する例を収集するための特別なツールを作成しました。彼らは失敗した試行を排除し、実際に機能したものだけを残すことで、教師が学生に示すための完璧な例を確保しました。

この新しいアプローチをテストしたところ、結果は有望でした。OSWorldと呼ばれる困難なコンピュータ・ベンチマークにおいて、この新しいエージェントは38.2%の成功率を記録しました。MobileWorldと呼ばれるモバイル・ベンチマークでは、12.0%の成功率を達成しました。これらの数字は、単にデータを混ぜたりモデルを統合したりしようとした従来のメソッドよりも、UI-MOPDが大幅に優れていることを示唆しています。例えば、他のメソッドは一方のプラットフォームを改善する一方で、もう一方を台無しにする可能性がありますが、UI-MOPDは両方の側面で同時にパフォーマンスを向上させることができました。この研究は、この「スペシャリスト・コーチ」方式が、エージェントが特定のデバイスの癖を学習しながらも、その一般的な知能を維持するのを助け、初期のモデルを混乱させた「平均化」の罠を回避することを明らかにしています。

要するに、論文はこう示唆しています。もし、あなたのノートパソコンとスマートフォンの両方を扱えるスマートなエージェントが欲しいのであれば、単にそれらを混ぜ合わせるのではなく、どの画面を見ているかに応じて、どの専門家の意見を聞くべきかを正確に知っているスマートなシステムを与えなさい、ということです。これは、あなたのデジタルアシスタントが、単なる一つの領域の達人ではなく、真にすべてのデジタル領域の達人となる未来への一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →