Qwen-CUA: Native Computer Use for (almost) Everything
本論文は、DOMツリーに依存せずスクリーンショットと入力イベントのみを通じて動作する、397BのMixture-of-Expertsバックボーン上に構築されたネイティブなコンピュータ使用エージェントであるQwen-CUAを紹介しており、大規模なクラウド展開トレーニング、検証可能な報酬最適化、およびスケーラブルなアーキテクチャを通じて、コンピュータ使用ベンチマークにおける最先端の性能を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのコンピュータが、単にあなたがボタンをクリックするのを待つのではなく、あなたの行動を実際に「観察」し、それを代わりに行う方法を学習する世界を想像してみてください。これは、「AIエージェント」という、コンピュータにデジタル世界で人間のように振る舞うことを教える科学の刺激的な最前線です。長い間、これらのエージェントは、教科書(コード)を読んだり、厳格な取扱説明書(API)に従ったりすることしかできない優秀な学生のようなものでした。彼らは数学や論理には長けていましたが、もし使い古された複雑なプログラムや、リフレッシュするたびに変化するウェブサイトを使うよう頼まれたら、途方に暮れてしまいました。彼らは、人間のように画面を「見る」ことができなかったのです。ボタンがどこにあるかを知るために、ウェブサイトの構造に関する特別な設計図を必要としていました。しかし、私たちのデジタルライフの大部分は、そのような設計図を持たない画面の上で行われています。この論文は、AIに真の「デジタル・アプレンティス(デジタルの弟子)」になる方法を教えるという課題に取り組んでいます。つまり、特別なショートカットや隠された地図を必要とせず、画面を見て、人間と同じようにクリックしたりタイピングしたりする方法を理解する存在です。
この研究のチームは、ネイティブなコンピュータユーザーとなるよう設計された新しい種類のAIエージェント、Qwen-CUAを紹介しています。これは、ロボットに車の運転を教えるようなものです。ロボットに、あらゆる道路や信号機の完璧なデジタルマップ(多くの古い、あるいは複雑なソフトウェアには存在しません)を与える代わりに、窓の外を見て、道を確認し、見たものに基づいてステアリングホイールを回す方法を教えたのです。Qwen-CUAは、コンピュータ画面のスクリーンショットのみを「見て」、キーボードとマウスのコマンドを送信することによってのみ「行動」します。エンジンの下を覗き込んでコードを確認したり、ソフトウェアに助けを求めたりすることはありません。ただ、見て、学ぶのです。
このロボットを現実世界のタスクをこなせるほど賢くするために、研究者たちは大規模なトレーニング・ジムを構築する必要がありました。彼らは、10万個近い仮想CPU(何千台ものコンピュータが同時に働く都市のようなもの)を備えたクラウドベースのフリートを作成し、約4万種類の異なるタスクを用意して、AIに練習させました。これらのタスクは、ファイルの整理のような単純なものから、プロフェッショナルなソフトウェアにおける複雑で多段階のワークフローまで多岐にわたります。AIは単に最後に「よくできました」や「やり直し」と言われるだけではありませんでした。システムは、タスクが実際に正しく完了したかどうかを検証するように設計されており、これによりAIは間違いから何度も学び直すことができました。
結果は目覚ましいものです。8つの異なるベンチマークにわたるテストにおいて、Qwen-CUAは以前のバージョンであるQwen3.7を一貫して上回り、現在利用可能な最も強力で高価なAIシステムの中には、これに匹敵するものさえあります。例えば、日常的なデスクトップタスクをどれだけうまく扱えるかを測定するOSWorld-Verifiedというテストにおいて、Qwen-CUAは86.2を記録しましたが、以前のモデルは73.3でした。これをさらに大きなモデルであるQwen-CUA-Max(1兆以上のパラメータを持つ)へとスケールアップしたところ、スコアは87.6に上昇しました。
この論文の最も素晴らしい点の一つは、長く複雑なタスクへの対処法です。想像してみてください、新しい章を書いている間に、一週間前に読んだ物語を思い出そうとする場面を。AIは、タスクの途中で自分がどこにいるのかを知るために、多くのステップ前の画面がどのような状態であったかを覚えておく必要がありました。研究者たちは、AIに直近20枚のスクリーンショットを保持する「視覚的メモリ」を与え、古いスクリーンショットを巧みに「折り畳んで」要約することで、情報過多にならないように解決しました。これにより、AIは物語の始まりを忘れることなく、長いワークフローの間も冷静さを保つことができました。
論文では安全性についても調査しました。彼らは、画面内に隠された偽の指示によってAIが騙される挑戦、RedTeamCUAに対してAIをテストしました。新しいモデルはこれらのトリックを無視することに非常に優れており、自身のタスクを遂行しながら、攻撃の成功率を**36.6%から16.4%**へと低下させました。
最後に、研究者たちは「ハイブリッド」なアプローチを探求しました。AIに(ファイル操作のためのテキストベースの魔法の杖のような)コマンドラインツールを、マウスやキーボードのスキルと併用させることで、タスクをより速く完了できることが分かりました。しかし、AIは時として誤ったタイミングでツールを切り替えてしまうこともあったため、高速ではあるものの、まだ完璧とは言えませんでした。著者らは、さらなるトレーニングを積めば、この視覚的な観察とテキストベースのコマンドの組み合わせが、AIエージェントを真に効率的なものにする鍵になると示唆しています。
要約すると、この論文は、AIを私たちのコンピュータに接続するための特別な架け橋は必要ないということを示しています。AIに単に画面を見て、人間のように振る舞うことを教えることで、最新のアプリから最も古いプログラムに至るまで、あらゆるソフトウェアに対処できる準備が整ったエージェントを構築できるのです。そしてそれは、膨大な量の現実世界の練習を通じて学習していきます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。