Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
原著者: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
原著者: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:コンピュータ操作エージェントにおける不確実性定量化(Uncertainty Quantification)
問題提起
コンピュータ操作エージェントは、視覚言語モデル(VLM)の予測を、実行可能なGUIアクション(具体的には単一ステップのクリック座標)へと変換する。受動的な分類とは異なり、この文脈における誤った予測は、ホストシステム上で意図しないアクションを誘発する。したがって、エラー拒絶、キャリブレーション、ミス・深刻度ランキング、および空間的安全領域の定義といったクリティカルなデプロイメント・メカニズムのために、信頼性の高い不確実性定量化(UQ)が不可欠である。
しかし、これらのエージェントに対するポストホック(事後的な)UQに関する既存の知見は断片的である。先行研究は通常、孤立したモデルとデータセットのペアや、特定のUQファミリーのみを評価しており、エージェントのアーキテクチャ、ベンチマークの幾何学的構造、または観測可能なインターフェース(例:オープンウェイトの内部情報 vs クローズドソースのAPI)が変化した際に、UQ手法のランキングが安定して維持されるかどうかは不明なままである。本研究が取り組む中心的な問いは、**「いつ、コンピュータ操作エージェントにおいてUQは汎化するのか?」**である。
手法:ARGUSベンチマーク
著者らは、ポストホックUQ手法の転移性を評価するために設計された、統一されたクロスレジーム・ベンチマークであるARGUS(Assessing Regime-wise Generalization of Uncertainty Scoring)を導入する。
実験設定
- レジーム(Regime): レジームは、エージェント、データセット、および観測可能なモデルインターフェースの組み合わせによって定義される。
- モデル:
- オープンウェイト・パネル: 4つのVLMエージェント(Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B)。
- クローズドソース・パネル: 3つのフロンティア・ベンダー(GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro)をAPI経由でのみ利用。
- データセット: 4つの単一ステップGUIグラウンディング・ベンチマーク(SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG)。
- UQ手法:
- オープンウェイト用: 7つのファミリー(Logit, Sampling, Hybrid, Density/Probe, Attention, Verbalised, VLM-native)にわたる27の手法。これらはロジット、隠れ状態、アテンションマップなどの内部信号を利用する。
- クローズドソース用: APIのみのインターフェースと互換性のある、調和された8手法のサブセット(内部状態を必要とする手法を除外)。
- 評価指標:
- エラー検出: AUROC(誤ったクリックをポジティブとして扱う)。
- 選択的実行: PRR(オラクル正規化された拒絶品質)およびAURC。
- キャリブレーション: ECEおよびBrierスコア(アイソトニック回帰後)。
- 段階的深刻度: AUSE(正規化された距離におけるミス限定のスパース化誤差)。
- 転移: 異なるレジーム間でのUQ手法ランキング間のスペアマン順位相関係数(ρ)。
- 空間的カバレッジ: コンフォーマル・クリック・ディスクの半径およびカバレッジ・ギャップ。
プロトコル
ベンチメントは、50個のシードにわたって繰り返される厳格な80/20のキャリブレーション/テスト分割を使用する。学習されたプローブおよび密度推定器は、キャリブレーション分割のみで訓練される。すべての主要な指標は、保持されたテストレコード上で計算される。クローズドソースモデルについては、公平な比較を確保するため、利用不可能な内部信号を必要とする手法は、プロキシ(代用)を用いるのではなく除外される。
主な結果
1. UQランキングの選択的転移
主要な発見は、UQランキングが選択的な汎化を示すことである:
- 固定されたモデル内での安定性: ランキングは、固定されたモデルに対してデータセット間で非常に安定している。例えば、POINTS-GUI-Gモデルでは、クロスデータセット転移においてスペアマン ρ=0.969 に達した。全120のオープンウェイト・ペアの平均転移は ρ=0.705 であった。
- モデルクラス間での不安定性: ランキングは、モデルクラス間(例:バニラなVLMから特化型GUIエージェントへ)を移動する際に著しく低下する。
- インターフェース間での不安定性: オープンウェイトモデルからクローズドソースAPIへの転移は、統計的にゼロと区別がつかない。共有された8手法の交差部分において、平均クロスティア転移は ρ=+0.08(95%信頼区間にゼロを含む)であった。これは、オープンウェイトモデルのためのUQの推奨事項を、クローズドソースのベンダーに外挿することはできないことを意味している。
2. レジーム依存の信頼性
単一のUQファミリーがすべてのレジームで支配的になることはない。「最良」のファミリーは、特定の構成に依存する:
- オープンウェイト: Density/Probe 手法(例:SAPLMA, SEP, Mahal-RMD)が、モデルおよびデータセット間で最も安定したファミリーである。
- クローズドソース: Verbalised 自己評価(例:Verbalised-1S/2S)および Hybrid 手法(例:CCP)が最も優れた性能を示す。特に、Verbalised-1Sは、鋭い二峰性のスコア分布により、SCREENSPOT-V2におけるGeminiに対して0.966のAUROCを達成した。
- モデル遷移: バニラなモデルから特化型エージェントへ移行すると、Attention、Verbalised、および VLM-native ファミリーは、すべてのデータセットにおいてAUROCを失う。対照的に、Density/Probe 手法は比較的安定している。
3. 目的の乖離
バイナリのエラー検出(AUROC)と段階的なミス・深刻度ランキング(AUSE)は、しばしば異なるトップ手法を選択する。オープンウェイト・パネルにおいて、AUROCとAUSEでトップの手法が一致したのは、16セル中わずか2セルであった。これは、エラーが発生した「か」を識別することに優れたスコアが、必ずしもエラーが「どの程度深刻か」をランク付けすることに優れているとは限らないことを示している。
4. 空間的カバレッジの限界
スコアレベルの識別だけではデプロイには不十分である。コンフォーマル・クリック・ディスク(プラグインUQスコアを使用)は、固定のベースラインと比較して半径を40–60%縮小できるが、キャリブレーション・テストまたはインターフェースの不一致によってカバレッジが低下することがある。例えば、クローズドソースのカバレッジは特定のベンダーで系統的なアンダーカバレッジを示しており、これは、わずかに有効なコンフォーマル予測には交換可能性の仮定の慎重な検証が必要であることを示唆している。
貢献
- クロスレジーム・ベンチマーク: ARGUSは、オープンウェイトおよびAPIのみのインターフェースにわたる、実行可能なGUIグラウンディングのためのポストホックUQの、初の統一された評価を提供し、27の手法と4つのデータセットをカバーしている。
- ランキング転移分析: UQ手法のランキングがどこで汎化し(固定モデル、変動データセット)、どこで崩壊するか(モデルクラスまたはインターフェースの変化)を定量化している。
- 調和されたプロトコル: 利用不可能な内部信号に対してプロキシ置換を行わない、APIのみの比較のための厳格なプロトコルを用い、公平なクロスティア評価を保証している。
- レジーム依存の信頼性: モデルクラス、APIの観測可能性、および空間的な失敗の幾何学が、どのUQファミリーが信頼できるかを根本的に変えるという証拠を提示している。
- デプロイメント評価: 拒絶、キャリブレーション、深刻度ランキング、およびコンフォーマル空間カバレッジのための包括的な評価を行い、各アイテムのレコードと分析スクリプトを備えたPythonパッケージ(
argus-uq)を公開している。
意義と主張
本論文は、**「不確実性の質は、UQ手法の固有の特性ではなく、手法、モデル、データセットの幾何学、観測可能なインターフェース、およびデプロイメントの目的によって共同で決定される」**と主張している。
著者らは、「選択的転移」が支配的な原則であることを強調している:
- 外挿しないこと: オープンウェイトモデルのためのUQの推奨事項を、クローズドソースのベンダーに外挿すべきではない。それらは、ターゲットとなるキャリブレーション分割上で再ランキングされなければならない。
- 普遍性を仮定しないこと: あるGUIエージェントに対してエラーをうまくランク付けする手法が、別のエージェントでは失敗する場合がある。
- スコアのみに頼らないこと: 高いAUROCは空間的カバレッジを保証しない。コンフォーマル領域は、カバレッジ・ギャップについて検証されなければならない。
本研究は、デプロイメントには単一の普遍的なスコアではなく、レジームを意識したUQパネル(候補となる手法の小さなセット)が必要であり、最終的な選択は特定のターゲット・キャリブレーション分割によって検証されるべきであると結論付けている。著者らは、このレジーム認識型の選択を促進するために argus-uq を公開している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。