← 最新の論文
🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

PhoneWorld は、34 のアプリにわたる実際のモバイル GUI 軌跡を制御可能で検証可能なトレーニング環境に自動的に変換するスケーラブルなパイプラインを導入し、手動によるベンチマーク構築から電話使用環境の大量生産へと焦点を移すことで、複数のベンチマークにおけるエージェントのパフォーマンスを大幅に向上させます。

原著者: Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Huawen Shen, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Pen
公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Huawen Shen, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Rui Yan, Ji-Rong Wen, Chengquan Zhang, Han Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スマートフォンをロボットに使い方を教えると想像してみてください。ロボットは画面を見て、ボタンの機能を理解し、フライトの予約や食事の注文、メッセージの送信といったタスクを達成する方法を把握する必要があります。

この論文によると、大きな問題はロボットが「無能」だからというだけではありません。問題は、ロボットが学習するための「練習場」が十分にあるわけではないということです。実際のスマートフォンアプリは複雑で、常に変化し、初期状態に戻すのが難しく、安全な訓練環境として整備するにはコストがかかります。まるで、事故が起きたら一時停止や巻き戻しができない本物の混雑した高速道路だけで、運転の練習をさせているようなものです。

「PhoneWorld」は、著者たちが構築した解決策です。これは単一のテストではなく、練習場を構築する「工場」と考えてください。

以下に、簡単な比喩を用いてその仕組みを説明します。

1. 設計図(実生活からの学習)

アプリがどのように見えるかを推測するのではなく、チームは実際の人が実際のアプリを使っている様子を観察しました。人々がどの画面を見て、どの経路をたどったか(ホーム画面から検索バーへ、そして商品ページへ移動するなど)を記録しました。

  • 比喩: 料理教室のために人気レストランの完璧な複製を作りたいと想像してください。メニューを推測するのではなく、何百人もの実際の客がどのテーブルに座り、何を注文し、ウェイターがキッチンとダイニングルームの間をどのように移動するかを観察します。PhoneWorld はアプリに対してこれを行います。

2. 「モック」アプリの構築

これらの観察結果を用いて、PhoneWorld は実際のアプリ(偽の QQ、偽のショッピングアプリ、偽の旅行アプリなど)の「偽バージョン」を自動的に構築します。

  • 魔法: これらの偽アプリは、実際のものと同じ見た目と操作性を持ちますが、「リセット可能」です。ロボットが間違えれば、「リセット」を押すだけで、アプリは正確に開始状態に戻ります。
  • データベース: これらの偽アプリの内部には、隠された「スコアボード」(データベース)があります。ロボットがメッセージを送信したり、カートに商品を追加したりして成功すれば、スコアボードは自動的に更新されます。これにより、人間が監視する必要なく、コンピュータが即座に「はい、ロボットは正しく行いました」と判断できます。

3. 訓練ループ

これらの環境は安全でリセット可能であるため、ロボットは何千回も練習できます。

  • プロセス: ロボットはタスクを完了しようとします(例:「映画を探してチケットを購入する」)。成功すれば、その成功はレッスンとして保存されます。失敗すれば、再度挑戦します。
  • 規模: チームは、ショッピング、ソーシャルメディア、旅行など 16 の異なるカテゴリを網羅する 34 の異なる偽アプリを構築しました。これにより、ロボットは学習するための多様な「運転レッスン」を提供されます。

発見した点(結果)

チームは、この「練習場の工場」が実際にロボットを賢くするかどうかを実験で検証しました。古いデータで訓練されたロボットと、新しい PhoneWorld データで訓練されたロボットを比較しました。

  • 「ミックス&マッチ」テスト: 強力なロボットを取り出し、その古い訓練データの一部(10,000 ステップ)を新しい PhoneWorld の練習データに置き換えました。
    • 結果: ロボットはすべての面で「著しく」向上しました。偽のアプリだけでなく、実世界でのテストでも性能が向上しました。静かなトラックでの数時間の運転練習を、混雑した都市のシミュレーションでの数時間の運転練習に置き換えたようなもので、ロボットは実際の交通状況への対応をより上手に学びました。
  • 「より多くはより良い」テスト: 単に PhoneWorld の練習を「増やす」ことが役立ったことがわかりましたが、「アプリの種類をより多く追加する」ことがさらに役立ちました。
    • 比喩: 単一の直線道路で 100 時間運転を練習するだけではありません。高速道路、砂利道、雨の日の通り、駐車場など、多様な場所で練習することです。環境の「多様性」が秘密のソースでした。

大きな教訓

この論文は、スマートフォンを使うロボットを賢くするためには、より大きなモデルを構築したり、より多くの静的なデータを収集したりするだけでは不十分だと主張しています。代わりに、練習環境の供給を「拡大」する必要があります。

PhoneWorld は、実世界の利用を再利用可能で、リセット可能かつ自動的なトレーニングジムに変えるツールです。これにより、私たちは素早く多くの異なる「電話の世界」を構築でき、ロボットが本物をマスターするために必要な多様で安全かつ無限の練習を提供できます。

要約すると: PhoneWorld は、実際のスマートフォンアプリの安全でリセット可能なビデオゲーム版を構築する工場であり、AI ロボットが数百万回も練習できるようにし、最終的にはクラッシュすることなく実際のスマートフォンを使えるようにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →