← 最新の論文
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

本論文は、4つの役割特化型エージェントと、ルールベースの監督に匹敵またはそれを上回る性能を持つ蒸留された9Bバックボーンを活用した実用的なモデルベース報酬フレームワークであるSeekJudgeを紹介しており、これは、ステップレベルの判定、低コスト、および長期的なタスクに対するスケーラビリティを提供しながら、コンピュータ使用エージェントのトレーニングを実現するものである。

原著者: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにビデオゲームの世界をナビゲートする方法を教えていると想像してみてください。ただし、コントローラーのボタンを押す代わりに、ロボットは人間と同じように、本物のコンピュータ画面上でクリック、タイピング、スクロールしなければなりません。これが「コンピュータ使用エージェント」の世界です。長い間、科学者たちは、「ホテルを予約する」といった目標を示し、ロボットが成功したかどうかを確認することで、これらのロボットを教えようとしてきました。従来の見極め方は、厳格なチェックリストのようなものでした。もしロボットが正しいタイミングで正しいボタンをクリックすれば得点を与え、間違ったボタンをクリックすればゼロ点とするというものです。しかし、コンピュータは混沌としており、常に変化しています。チェックリストが「失敗」と判定してしまうことがあります。例えば、ロボットが完璧に仕事を完了したとしても、チェックリストにあるボタンと見た目がわずかに異なるボタンをクリックしたという理由だけでです。これは、エッセイの内容が素晴らしくても、「color」と書いたために「colour」と書かなかったとして教師が学生を落第させるようなものです。

これを解決するために、研究者たちはAIモデルを「審判」として使い始めました。AIが厳格なルールではなく、タスクの「精神(本質)」を理解することを期待したのです。しかし、これらのAI審判は、ロボットの行動を記録した一本の長い映画を一度にすべて見ようとすると、混乱してしまうことがよくあります。それは、500ページの小説の中から特定の誤字を見つけ出すために、一瞬で本全体を読み通そうとするようなものです。重要な詳細はノイズの中に紛れてしまいます。大きな疑問はこうでした。「人間の目標を理解できるほど賢く、ロボットが学習する間、何千回も実行できるほど安価で、そして頭痛を起こさないほど高速に、長い複雑な物語を処理できる審判をどうやって構築するか?」

そこで、SeekJudgeが登場します。これは、一つのことをすべてこなそうとする働きすぎの探偵一人ではなく、協力して謎を解く4人の専門特化した探偵チームのように機能する新しいフレームワークです。研究者たちは、AIに大量のコンピュータ画面のスクリーンショットを同時に見せると、AIが幻覚(ハルシネーション)を起こしたり、最も重要な手がかりを見逃したりすることを発見しました。それは、100人の群衆の中から容疑者を特定するように頼まれたとき、派手な帽子をかぶった見知らぬ人に気を取られて、実際の犯人を見逃してしまうようなものです。しかし、容疑者の写真一枚だけを見せられたなら、彼らは即座に特定できるはずです。

SeekJudgeはこの問題を「分割」することで解決します。まず、2人の「偵察員」(CondenseおよびGroundエージェント)が、ロボットの長い道のりを素早くスキャンし、何が起きたのかをステップごとに書かれた短くて読みやすい要約を作成します。次に、「探偵」(Seekエージェント)がこの要約を読み、「ふむ、確信を持つためにはステップ42の画像を見る必要があるな」と判断します。そして、彼は4人目のエージェントであるAnalyzeエージェントを呼び出し、その特定の1枚のスクリーンショットだけを見せて、それに関する正確な質問に答えさせます。この「探し出し、分析する」というループが、探偵が最終的な判定を下すのに十分な自信を持てるまで繰り返されます。

論文によれば、この「シーク・アンド・アナライズ(探索と分析)」のアプローチはゲームチェンジャーとなります。テストを行った際、SeekJudgeは、ロボットに新しいタスクを教える上で、従来の厳格なルールチェック方式と同等、あるいはそれ以上の性能を示す最初のAIベースの審判となりました。実際、SeekJudgeを用いてロボットを訓練すると、ロボットは従来の方法よりも速く学習し、より高い成功率を収めました。

本当に素晴らしいのは、その効率性です。AIは大量の画像をスタックとして見るのではなく、一度に一つの画像だけを見るため、実行するために超高価で巨大なコンピュータを必要としません。研究者たちは、このシステムが他のAI審判と比較して、極めて低コストであることを発見しました。クローズドソースの巨大なモデルを使用する場合よりも、数百倍も安価なのです。これは、事件の全ファイルを一度に読むために多額の費用を請求するセレブリティ探偵を雇うのと、それぞれが数ドルで一つの手がかりを見る地元の専門家チームを雇うことの違いのようなものです。

チームはまた、CUASiteBenchと呼ばれる新しい「訓練場」も構築しました。これは、人間がロボットの旅のあらゆるステップを丁寧にラベル付けした、278種類の異なるコンピュータタスクのコレクションです。これにより、彼らの「探偵」チームを非常に鋭いものへと訓練することができました。彼らは、問題を「正しい瞬間を見つけること(ローカライゼーション)」と「詳細を読み取ること(抽出)」に分解することで、従来の手法よりも長く複雑なタスクを扱えることを証明しました。

要するに、SeekJudgeは、すべてを見通す超知能の目になろうとするのではなく、いつ最も重要な手がかりにズームインすべきかを正確に知っている、スマートで効率的なチームとして機能します。これにより、画面が変化し、厳格なルールブックが通用しない現実世界のコンピュータ作業において、コンピュータ使用ロボットを訓練することが可能になります。この論文は、このアプローチこそが、スーパーコンピュータを使わずに、航空券の予約からファイルの整理まで、私たちの日常的なコンピュータ作業を実際に手助けできるAIアシスタントを実現するための鍵となる可能性を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →