Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
原作者: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
原作者: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:计算机使用智能体的确定性量化
问题陈述
计算机使用智能体将视觉语言模型(VLM)的预测转化为可执行的 GUI 操作,具体表现为单步点击坐标。与被动的分类任务不同,在这种语境下,错误的预测会触发宿主系统上非预期的操作。因此,可靠的确定性量化(Uncertainty Quantification, UQ)对于关键部署机制至关重要,例如错误拒绝、校准、误差严重程度排序以及定义空间安全区域。
然而,现有关于此类智能体事后(post-hoc)UQ 的研究是碎片化的。先前的研究通常仅评估孤立的模型-数据集对或特定的 UQ 家族,这使得在智能体架构、基准测试几何结构或可观测界面(例如:开源权重内部信息 vs. 闭源 API)发生变化时,UQ 方法的排名是否保持稳定仍不明确。本文旨在解决的核心问题是:UQ 在何时能于计算机使用智能体中实现泛化?
方法论:ARGUS 基准测试
作者引入了 ARGUS(评估不同机制下泛化能力的确定性评分,Assessing Regime-wise Generalization of Uncertainty Scoring),这是一个统一的跨机制基准测试,旨在评估事后 UQ 方法的可迁移性。
实验设置
- 机制(Regimes): 一个机制由智能体、数据集和可观测的模型接口共同定义。
- 模型:
- 开源权重面板: 4 个 VLM 智能体(Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B)。
- 闭源面板: 3 家前沿厂商(GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro),仅通过 API 提供。
- 数据集: 4 个单步 GUI 定位基准测试(SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG)。
- UQ 方法:
- 开源权重: 涵盖 7 个家族的 27 种方法(Logit, 采样, 混合, 密度/探测, 注意力, 语言化, VLM 原生)。这些方法利用内部信号,如 Logit、隐藏状态和注意力图。
- 闭源: 一个经过协调的 8 方法子集,仅兼容 API 接口(剔除了需要内部状态的方法)。
- 评估指标:
- 错误检测: AUROC(将错误点击视为正类)。
- 选择性执行: PRR(预言机归一化的拒绝质量)和 AURC。
- 校准度: ECE 和 Brier 分数(经等距回归处理后)。
- 分级严重程度: AUSE(基于归一化距离的仅针对漏报的稀疏化误差)。
- 迁移性: 不同机制间 UQ 方法排名的 Spearman 秩相关系数 (ρ)。
- 空间覆盖率: 符合性(Conformal)点击圆盘半径和覆盖差距。
协议
基准测试采用严格的 80/20 校准/测试集划分,并重复进行 50 次种子实验。学习到的探测器(probes)和密度估计器仅在校准集上进行训练。所有核心指标均在留出的测试记录上计算。对于闭源模型,要求内部信号的方法会被直接剔除而非使用代理方法,以确保公平比较。
关键结果
1. UQ 排名的选择性迁移
主要发现是 UQ 排名表现出选择性泛化:
- 在固定模型内保持稳定: 对于固定模型,排名在不同数据集之间高度稳定。例如,在 POINTS-GUI-G 模型中,跨数据集迁移的 Spearman ρ 达到了 0.969。所有 120 个开源权重对的平均迁移率为 ρ=0.705。
- 在不同模型类别间不稳定: 当在不同模型类别之间移动时(例如从通用 VLM 到专用 GUI 智能体),排名显著下降。
- 在不同接口间不稳定: 从开源权重模型到闭源 API 的迁移在统计学上与零无异。在共享的 8 个方法交集中,平均跨层级迁移率为 ρ=+0.08(95% 置信区间包含零)。这意味着对于开源权重模型的 UQ 建议无法外推至闭源厂商。
2. 依赖于机制的可靠性
没有单一的 UQ 家族能在所有机制中占据主导地位。“最佳”家族取决于具体的配置:
- 开源权重: 密度/探测(Density/Probe) 方法(如 SAPLMA, SEP, Mahal-RMD)是在不同模型和数据集中最稳定的家族。
- 闭源: 语言化(Verbalised) 自我评估(如 Verbalised-1S/2S)和混合(Hybrid) 方法(如 CCP)表现最好。值得注意的是,Verbalised-1S 在 Gemini 上的 SCREENSPOT-V2 任务中实现了 0.966 的 AUROC,这得益于其尖锐的双峰得分分布。
- 模型转换: 从通用模型转向专用智能体会导致 注意力(Attention)、语言化(Verbalised) 和 VLM 原生(VLM-native) 家族在所有数据集上的 AUROC 均出现下降。相比之下,密度/探测 方法保持相对稳定。
3. 目标的差异性
二元错误检测(AUROC)与分级误差严重程度排序(AUSE)往往会选择不同的顶级方法。在开源权重面板中,AUROC 和 AUSE 的顶级方法在 16 个单元格中仅有 2 个达成一致。这表明,一个擅长识别“是否”发生了错误的方法,并不一定擅长对误差的“严重程度”进行排序。
4. 空间覆盖率的局限性
仅靠得分水平的判别不足以支持部署。虽然使用插件式 UQ 得分的符合性(conformal)点击圆盘可以将半径比固定基准缩小 40–60%,但覆盖率在校准-测试不匹配或接口不匹配时可能会下降。例如,闭源模型的覆盖率在某些厂商处表现出系统性的欠覆盖,这表明对于边际有效的符合性预测,需要仔细验证可交换性假设。
贡献
- 跨机制基准测试: ARGUS 提供了首个针对开源权重和仅 API 接口的、用于执行 GUI 定位的后验 UQ 统一评估,涵盖了 27 种方法和 4 个数据集。
- 排名迁移分析: 本文量化了 UQ 方法排名在何处可以泛化(固定模型,变化数据集),以及在何处失效(改变模型类别或接口)。
- 协调的协议: 采用严格的 API 仅限比较协议,避免了为不可用的内部信号使用代理替代,确保了公平的跨层级评估。
- 依赖机制的可靠性: 证明了模型类别、API 可观测性和空间失效几何结构会从根本上改变哪些 UQ 家族是可靠的。
- 部署评估: 对用于拒绝、校准、严重程度排序和空间覆盖的 UQ 进行了全面评估,并发布了包含逐项记录和分析脚本的 Python 包 (
argus-uq)。
意义与主张
本文主张,确定性质量并非 UQ 方法的内在属性,而是取决于方法、模型、数据集几何结构、可观测接口以及部署目标的共同作用。
作者强调“选择性迁移”是核心原则:
- 不要外推: 不应将开源权重模型的 UQ 建议外推至闭源厂商;必须在目标校准集上重新进行排名。
- 不要假设普适性: 一个在某个 GUI 智能体上表现良好的方法,在另一个智能体上可能会失败。
- 不要仅依赖得分: 高 AUROC 并不保证空间覆盖率;符合性区域必须针对覆盖差距进行验证。
研究结论指出,部署需要一个基于机制的 UQ 面板(即一小组候选方法),而非单一的通用得分,且最终的选择应在特定的目标校准集上进行验证。作者发布了 argus-uq 以促进这种基于机制的选择过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。