Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
Autores originales: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Autores originales: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Cuantificación de la Incertidumbre para Agentes de Uso de Computadora
Declaración del Problema
Los agentes de uso de computadora transforman las predicciones de modelos de lenguaje visual (VLM) en acciones de GUI ejecutables, específicamente coordenadas de clic de un solo paso. A diferencia de la clasificación pasiva, una predicción incorrecta en este contexto desencadena una acción no deseada en el sistema anfitrión. Por consiguiente, una cuantificación de la incertidumbre (UQ) fiable es esencial para mecanismos críticos de despliegue como el rechazo de errores, la calibración, la clasificación de severidad de fallos y la definición de regiones de seguridad espacial.
Sin embargo, la evidencia existente sobre la UQ post-hoc para estos agentes está fragmentada. Los estudios previos suelen evaluar pares modelo-conjunto de datos aislados o familias de UQ específicas, lo que deja sin resolver si los rankings de los métodos de UQ se mantienen estables cuando la arquitectura del agente, la geometría del benchmark o la interfaz observable (por ejemplo, internos de pesos abiertos frente a APIs de código cerrado) cambian. La pregunta central abordada es: ¿Cuándo generaliza la UQ en los agentes de uso de computadora?
Metodología: El Benchmark ARGUS
Los autores introducen ARGUS (Assessing Regime-wise Generalization of Uncertainty Scoring), un benchmark unificado trans-régimen diseñado para evaluar la transferibilidad de los métodos de UQ post-hoc.
Configuración Experimental
- Regímenes: Un régimen se define por la combinación de un agente, un conjunto de datos y una interfaz de modelo observable.
- Modelos:
- Panel de Pesos Abiertos: 4 agentes VLM (Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B).
- Panel de Código Cerrado: 3 proveedores de frontera (GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro) únicamente vía API.
- Conjuntos de Datos: 4 benchmarks de localización de GUI de un solo paso (SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG).
- Métodos de UQ:
- Pesos Abiertos: 27 métodos a través de 7 familias (Logit, Muestreo, Híbrido, Densidad/Sonda, Atención, Verbalizado, Nativo de VLM). Estos utilizan señales internas como logits, estados ocultos y mapas de atención.
- Código Cerrado: Un subconjunto armonizado de 8 métodos compatibles con interfaces de solo API (eliminando métodos que requieren estados internos).
- Métricas de Evaluación:
- Detección de Errores: AUROC (clics incorrectos como positivos).
- Ejecución Selectiva: PRR (calidad de rechazo normalizada por oráculo) y AURC.
- Calibración: ECE y puntuación Brier (después de regresión isotónica).
- Severidad Graduada: AUSE (error de dispersión de solo fallos sobre distancia normalizada).
- Transferencia: Correlación de rango de Spearman (ρ) entre los rankings de métodos de UQ a través de diferentes regímenes.
- Cobertura Espacial: Radio de disco de clic conformal y brecha de cobertura.
Protocolo
El benchmark utiliza una división estricta de 80/20 para calibración/prueba repetida sobre 50 semillas. Las sondas aprendidas y los estimadores de densidad se entrenan únicamente en la partición de calibración. Todas las métricas principales se computan sobre los registros de prueba no vistos. Para los modelos de código cerrado, los métodos que requieren señales internas no disponibles se descartan en lugar de ser sustituidos por proxies para asegurar una comparación justa.
Resultados Clave
1. Transferencia Selectiva de Rankings de UQ
El hallazgo principal es que los rankings de UQ exhiben una generalización selectiva:
- Estabilidad dentro de Modelos Fijos: Los rankings son altamente estables a través de los conjuntos de datos para un modelo fijo. Por ejemplo, en el modelo POINTS-GUI-G, la transferencia entre conjuntos de datos alcanzó un Spearman ρ=0.969. El promedio de transferencia en todos los 120 pares de pesos abiertos fue ρ=0.705.
- Inestabilidad entre Clases de Modelos: Los rankings se degradan significamente al moverse entre clases de modelos (por ejemplo, de VLMs vanilla a agentes especialistas en GUI).
- Inestabilidad entre Interfaces: La transferencia de modelos de pesos abiertos a APIs de código cerrado es estadísticamente indistinguible de cero. En la intersección compartida de 8 métodos, el promedio de transferencia entre niveles fue ρ=+0.08 (el IC del 95% incluye cero). Esto implica que las recomendaciones de UQ para modelos de pesos abiertos no pueden extrapolarse a los proveedores de código cerrado.
2. Fiabilidad Dependiente del Régimen
Ninguna familia de UQ domina todos los regímenes. La "mejor" familia depende de la configuración específica:
- Pesos Abiertos: Los métodos de Densidad/Sonda (ej. SAPLMA, SEP, Mahal-RMD) son la familia más estable a través de modelos y conjuntos de datos.
- Código Cerrado: Los métodos de autoevaluación Verbalizados (ej. Verbalised-1S/2S) y los métodos Híbridos (ej. CCP) funcionan mejor. Notablemente, Verbalised-1S logró un AUROC de 0.966 en Gemini para SCREENSPOT-V2, impulsado por una distribución de puntuación fuertemente bimodal.
- Transiciones de Modelo: El paso de agentes vanilla a especialistas causa que las familias de Atención, Verbalizados y Nativos de VLM pierdan AUROC en todos los conjuntos de datos. En contraste, los métodos de Densidad/Sonda permanecen relativamente estables.
3. Divergencia de Objetivos
La detección de errores binarios (AUROC) y el ranking de severidad de fallo graduado (AUSE) a menudo seleccionan diferentes métodos superiores. En el panel de pesos abiertos, el mejor método para AUROC y AUSE coincidió en solo 2 de 16 celdas. Esto indica que un puntaje bueno para identificar si ocurrió un error no es necesariamente bueno para clasificar qué tan severo es el error.
4. Limitaciones de Cobertura Espacial
La discriminación a nivel de puntaje es insuficiente para el despliegue. Aunque los discos de clic conformales (usando puntajes de UQ plug-in) pueden reducir los radios entre un 40–60% en comparación con las líneas base fijas, la cobertura puede degradarse bajo desajustes de calibración-prueba o de interfaz. Por ejemplo, la cobertura de código cerrado mostró una subcobertura sistemática en ciertos proveedores, lo que sugiere que la predicción conformal marginalmente válida requiere una validación cuidadosa de los supuestos de intercambiabilidad.
Contribuciones
- Benchmark Trans-Régimen: ARGUS proporciona la primera evaluación unificada de la UQ post-hoc para la localización de GUI ejecutable a través de interfaces de pesos abiertos y solo API, cubriendo 27 métodos y 4 conjuntos de datos.
- Análisis de Transferencia de Rankings: El artículo cuantifica dónde generalizan los rankings de métodos de UQ (modelo fijo, variando el conjunto de datos) y dónde fallan (cambio de clase de modelo o de interfaz).
- Protocolo Armonizado: Un protocolo estricto para la comparación de solo API que evita las sustituciones por proxies para señales internas no disponibles, asegurando una evaluación justa entre niveles.
{% endblock %} - Fiabilidad Dependiente del Régimen: Evidencia de que la clase del modelo, la observabilidad de la API y la geometría de fallo espacial alteran fundamentalmente qué familias de UQ son fiables.
- Evaluación de Despliegue: Evaluación exhaustiva de la UQ para el rechazo, la calibración, el ranking de severidad y la cobertura espacial conformal, acompañada de un paquete de Python liberado (
argus-uq) con registros por ítem y scripts de análisis.
Significancia y Reivindicaciones
El artículo afirma que la calidad de la incertidumbre no es una propiedad intrínseca de un método de UQ, sino que depende conjuntamente del método, el modelo, la geometría del conjunto de datos, la interfaz observable y el objetivo de despliegue.
Los autores enfatizan que la "transferencia selectiva" es el principio rector:
- No extrapolar: Las recomendaciones de UQ para modelos de pesos abiertos no deben extrapolarse a los proveedores de código cerrado; deben re-clasificarse en el conjunto de calibración objetivo.
- No asumir universalidad: Un método que clasifica bien los errores para un agente de GUI puede fallar en otro.
- No confiar únicamente en los puntajes: Un alto AUROC no garantiza la cobertura espacial; las regiones conformales deben validarse para detectar brechas de cobertura.
El trabajo concluye que el despliegue requiere un panel de UQ consciente del régimen (un pequeño conjunto de métodos candidatos) en lugar de un único puntaje universal, con la selección final validada en el conjunto de calibración específico objetivo. Los autores lanzan argus-uq para facilitar este proceso de selección consciente del régimen.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de machine learning cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.