Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
원저자: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
원저자: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: 컴퓨터 사용 에이전트를 위한 불확실성 정량화 (Uncertainty Quantification)
문제 정의
컴퓨터 사용 에이전트는 시각-언어 모델(VLM)의 예측을 실행 가능한 GUI 동작, 구체적으로는 단일 단계 클릭 좌표로 변환합니다. 수동적인 분류와 달리, 이 문맥에서의 잘못된 예측은 호스트 시스템에 의도하지 않은 동작을 유발합니다. 따라서 오류 거부(error rejection), 보정(calibration), 미스-심각도 순위 지정(miss-severity ranking), 그리고 공간적 안전 영역 정의와 같은 핵심적인 배포 메커니즘을 위해서는 신뢰할 수 있는 불확실성 정량화(UQ)가 필수적입니다.
그러나 이러한 에이전트에 대한 사후(post-hoc) UQ에 관한 기존 연구들은 파편화되어 있습니다. 선행 연구들은 대개 고립된 모델-데이터셋 쌍이나 특정 UQ 제품군만을 평가하며, 에이전트 아키텍처, 벤치마크 기하 구조, 또는 관측 가능한 인터페이스(예: 오픈 웨이트 내부 정보 vs. 폐쇄형 소스 API)가 변할 때 UQ 방법의 순위가 안정적으로 유지되는지 여부를 명확히 밝히지 못하고 있습니다. 본 연구가 다루는 핵심 질문은 다음과 같습니다: 언제 컴퓨터 사용 에이전트에서 UQ가 일반화되는가?
방법론: ARGUS 벤치마크
저자들은 UQ 방법의 전이 가능성(transferability)을 평가하기 위해 설계된 통합 교차 레짐(cross-regime) 벤치마크인 ARGUS(Assessing Regime-wise Generalization of Uncertainty Scoring)를 소개합니다.
실험 설정
- 레짐(Regimes): 레짐은 에이전트, 데이터셋, 그리고 관측 가능한 모델 인터페이스의 조합으로 정의됩니다.
- 모델:
- 오픈 웨이트 패널: 4개의 VLM 에이전트 (Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B).
- 폐쇄형 소스 패널: API를 통해서만 접근 가능한 3개의 프런티어 벤더 (GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro).
- 데이터셋: 4개의 단일 단계 GUI 그라운딩 벤치마크 (SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG).
- UQ 방법:
- 오픈 웨이트: 7개 제품군(Logit, Sampling, Hybrid, Density/Probe, Attention, Verbalised, VLM-native)에 걸친 27개 방법. 이들은 로짓(logits), 은닉 상태(hidden states), 어텐션 맵과 같은 내부 신호를 활용합니다.
- 폐쇄형 소스: 내부 상태를 필요로 하는 방법을 제외하고 API 전용 인터페이스와 호환되는 조화된 8개 방법의 하위 집합.
- 평가 지표:
- 오류 탐지(Error Detection): AUROC (잘못된 클릭을 양성으로 간함).
- 선택적 실행(Selective Execution): PRR (오라클 정규화된 거절 품질) 및 AURC.
- 보정(Calibration): ECE 및 Brier score (Isotonic regression 적용 후).
- 등급별 심각도(Graded Severity): AUSE (정규화된 거리에 대한 miss-only sparsification error).
- 전이(Transfer): 서로 다른 레짐 간의 UQ 방법 순위에 대한 스피어먼 상관계수 (ρ).
- 공간적 커버리지(Spatial Coverage): Conformal click-disk 반경 및 커버리지 갭.
프로토콜
본 벤치마크는 50개의 시드에 대해 반복되는 엄격한 80/20 보정/테스트 분할을 사용합니다. 학습된 프로브(probe)와 밀도 추정기(density estimator)는 오직 보정 분할 데이터로만 학습됩니다. 모든 헤드라인 지표는 홀드아웃(held-out) 테스트 레코드에 대해 계산됩니다. 폐쇄형 소스 모델의 경우, 사용 불가능한 내부 신호를 요구하는 방법은 공정한 비교를 위해 대리(proxy)를 사용하지 않고 제외합니다.
주요 결과
1. UQ 순위의 선택적 전이
주요 발견은 UQ 순위가 **선택적 일반화(selective generalization)**를 보인다는 점입니다:
- 고정된 모델 내에서의 안정성: 모델이 고정된 경우, 순위는 데이터셋 전반에 걸쳐 매우 안정적입니다. 예를 들어, POINTS-GUI-G 모델의 경우, 교차 데이터셋 전이는 스피어먼 ρ=0.969에 달했습니다. 모든 120개 오픈 웨이트 쌍의 평균 전이는 ρ=0.705였습니다.
- 모델 클래스 간의 불안정성: 모델 클래스(예: 일반 VLM에서 전문 GUI 에이전트로) 간 이동 시 순위가 크게 저하됩니다.
- 인터페이스 간의 불안정성: 오픈 웨이트 모델에서 폐쇄형 소스 API로의 전이는 통계적으로 0과 구별할 수 없을 정도로 낮습니다. 공유된 8개 방법의 교차 티어 평균 전이는 ρ=+0.08 (95% CI가 0을 포함)이었습니다. 이는 오픈 웨이트 모델을 위한 UQ 권장 사항을 폐쇄형 소스 벤더에 그대로 적용할 수 없음을 의미합니다.
2. 레짐 의존적 신뢰성
단일 UQ 제품군이 모든 레짐을 지배하지는 않습니다. "최적의" 제품군은 특정 구성에 따라 달라집니다:
- 오픈 웨이트: Density/Probe 방법(예: SAPLMA, SEP, Mahal-RMD)이 모델과 데이터셋 전반에서 가장 안정적인 제품군입니다.
- 폐쇄형 소스: Verbalised 자기 평가(예: Verbalised-1S/2S) 및 Hybrid 방법(예: CCP)이 가장 우수한 성능을 보입니다. 특히, Verbalised-1S는 SCREENSPOT-V2에 대한 Gemini의 AUROC 0.966을 달성했으며, 이는 뚜렷한 이봉형(bimodal) 점수 분포에 의해 주도되었습니다.
- 모델 전환: 일반 모델에서 전문 에이전트로 전환되면 Attention, Verbalised, VLM-native 제품군이 모든 데이터셋에서 AUROC를 상실합니다. 반면, Density/Probe 방법은 상대적으로 안정적으로 유지됩니다.
3. 목적의 괴리
이진 오류 탐지(AUROC)와 등급별 미스-심각도 순위 지정(AUSE)은 종종 서로 다른 상위 방법들을 선정합니다. 오픈 웨이트 패널에서 AUROC와 AUSE에 대한 상위 방법이 일치한 경우는 16개 셀 중 단 2개뿐이었습니다. 이는 오류가 발생했는지(if)를 식별하는 데 좋은 점수가 반드시 오류가 얼마나 심각한지(how severe)를 순위 매기는 데에도 좋은 것은 아님을 나타냅니다.
4. 공간적 커버리지의 한계
점수 수준의 판별만으로는 배포에 불충분합니다. (플러그인 UQ 점수를 사용하는) Conformal click disks는 고정된 베이스라인에 비해 반경을 40–60% 줄일 수 있지만, 보정-테스트 또는 인터페이스 불일치 시 커버리지가 저하될 수 있습니다. 예를 들어, 폐쇄형 소스의 커버리지는 특정 벤더에서 체계적인 과소 커전(under-coverage)을 보였으며, 이는 임계값 근접한 유효한 conformal prediction을 위해서는 교환 가능성(exchangeability) 가정에 대한 신중한 검증이 필요함을 시사합니다.
기여
- 교차 레짐 벤치마크: ARGUS는 오픈 웨이트 및 API 전용 인터페이스를 모두 아우르며 27개 방법과 4개 데이터셋을 다루는, 실행 가능한 GUI 그라운딩을 위한 최초의 통합된 사후 UQ 평가 도구를 제공합니다.
- 순위 전이 분석: UQ 방법의 순위가 어디에서 일반화되는지(고정된 모델, 변하는 데이터셋)와 어디에서 깨지는지(변하는 모델 클래스 또는 인터페이스)를 정량화합니다.
- 조화된 프로토콜: 사용 불가능한 내부 신호에 대해 대리체를 사용하지 않는 엄격한 API 전용 비교 프로토콜을 통해 공정한 교차 티어 평가를 보장합니다.
- 레짐 의존적 신뢰성: 모델 클래스, API 관측 가능성, 그리고 공간적 실패 기하 구조가 어떤 UQ 제품군이 신뢰할 수 있는지를 근본적으로 변화시킨다는 증거를 제시합니다.
- 배포 평가: 거절, 보정, 심각도 순위 지정 및 conformal 공간 커버리지를 위한 종합적인 U_{Q} 평가와 함께, 개별 항목 기록 및 분석 스크립트가 포함된 Python 패키지(
argus-uq)를 공개합니다.
의의 및 주장
본 논문은 불확실성의 질이 UQ 방법의 고유한 속성이 아니라, 방법, 모델, 데이터셋의 기하 구조, 관측 가능한 인터페이스, 그리고 배포 목적에 따라 공동으로 결정된다고 주장합니다.
저자들은 "선택적 전이"가 지배적인 원칙임을 강조합니다:
- 추론하지 마십시오: 오픈 웨이트 모델을 위한 UQ 권장 사항을 폐쇄형 소스 벤더로 확장하여 적용해서는 안 됩니다. 반드시 대상 보정 분할(calibration split)에서 다시 순위를 매겨야 합니다.
- 보편성을 가정하지 마십시오: 한 GUI 에이전트에 대해 오류 순위를 잘 매기는 방법이 다른 에이전트에서는 실패할 수 있습니다.
- 점수에만 의존하지 마십시오: 높은 AUROC가 공간적 커버리지를 보장하는 것은 아닙니다. Conformal 영역은 커버리지 갭에 대해 검증되어야 합니다.
본 연구는 배포를 위해 단일 보편적 점수보다는 레짐 인식형 UQ 패널(소수의 후보 방법 집합)이 필요하며, 최종 선택은 특정 타겟 보정 분할에서 검증되어야 한다고 결론짓습니다. 저자들은 이러한 레짐 인식형 선택 과정을 촉진하기 위해 argus-uq를 공개합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 machine learning 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.