← 最新の論文
🤖 AI

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUIは、LoRAを介したタスク固有のポリシーの適応と、エージェント自身の相互作用からの転移可能なワークフローコンテキストの洗練を共同で行うことにより、未知のアプリケーションに対するモバイルGUIエージェントの汎化性能を向上させ、ベースライン手法に対して大幅な性能向上を実現するテスト時適応フレームワークである。

原著者: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)
公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットにデジタル世界を航行する方法を教えていると想像してください。このロボットは「GUIエージェント」であり、スマートなアシスタントです。スマートフォンの画面を見て、そこに見えるものを読み取り、「航空券を予約して」や「テキストを送信して」といったあなたの指示に従ってボタンをタップすることができます。しばらくの間、これらのロボットは、後で使用するアプリと全く同じアプリで練習する場合に限っては、かなり上手になってきました。それは、特定の数学のテストの答えを暗記したものの、新しい教科書を見た瞬間に固まってしまう学生のようなものです。本当の課題は、ロボットが一度も見聞きしたことのないアプリ、つまり認識できないボタンやメニューを持つアプリに出会ったときに起こります。これが「未知のアプリケーション」問題です。科学者たちは、毎回人間にやり方を教わらなくても、わずか数回の試行だけで新しいアプリの仕組みを理解できるように、ロボットに即座に学習する方法を教える方法を模索しています。

この論文は、これらのロボットエージェントが以前よりもずっと上手く未知のアプリに適応できるようにする、CoAdapt-GUIと呼ばれる巧妙な新システムを紹介しています。ロボットの脳を、タップやスワイプの直感である「ポリシー(方策)」と、仕事を完了させるための手順やルールのメンタルチェックリストである「ワークフロー」の2つの部分に分けて考えてみてください。ロボットが新しいアプリを学習するのを助けるこれまでの試みは、主に彼らの直感(ポリシー)を微調整しようとするものでしたが、チェックリストを無視していました。著者たちは、これだけでは不十分であることを発見しました。もしロボットのチェックリストが、以前知っていたアプリに特化した詳細(例:「ホーム画面にある青いボタンを探す」など)で満たされていると、新しいアプリに赤いボタンが別の場所に配置されていた場合に、ロボットは混乱してしまうからです。

CoAdapt-GUIは、これによって2つのことを同時に行います。第一に、ロボットのチェックリストに対して厳格な編集者のように振る舞います。ロボットが知っている一般的なルール(例:「行き詰まったら、戻る操作を試す」など)は残しますが、古いアプリに関する具体的な詳細(例:「戻るボタンは左上隅にある」など)を削ぎ落とします。これにより、どこでも通用する「クリーンな」ガイドが作成されます。第二に、ロボットに新しいアプリで練習させ、何がうまくいき、何が失敗したかに基づいてその直感(ポリシー)を更新させます。魔法は、これら2つの部分が互いに助け合うことで起こります。クリーンなチェックリストがロボットのより良い練習を助け、練習の結果がチェックリストの洗練を助けるのです。

研究者たちは、AndroidWorldと呼ばれるデジタルプレイグラウンドでこのシステムをテストしました。あるテストでは、ロボットが馴染みのあるタスクの新しいバージョンを扱う必要がありましたが、CoAdapt-GUIは**45.0%**の確率で成功しました。これは、**37.5%しか達成できなかった従来の最高の手法と比較して、大幅な飛躍でした。より困難なテスト、つまりロボットが一度も見聞きしたことのない全く新しい種類のタスクを学習しなければならないテストでは、システムは成功率を38.6%から52.9%**へと向上させました。この論文は、「何をすべきか(ワークフロー)」と「どのように行うか(ポリシー)」を分離し、使用前に指示をクリーンアップすることで、ロボットがより柔軟になり、アプリが常に変化する現実世界への準備を整えられるようになることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →