技术摘要:Plover —— 通过以计划为中心的交互引导 GUI 智能体
1. 问题陈述
在现实环境中,图形用户界面(GUI)自动化面临着由于动态布局、意外对话框和不断变化的界面状态所带来的重大挑战。虽然最近基于视觉的多模态智能体(使用截图和自然语言)比传统的基于规则的脚本或机器人流程自动化(RPA)工具具有更大的灵活性,但它们存在一个关键的设计缺陷:自主优先执行(autonomy-first execution)。
在当前的系统中,规划和重新规划是在模型内部进行的。一旦执行开始,智能体可能会在不与用户保持共享情境意识的情况下,默默地重新解释用户意图、重新生成步骤或追求错误的动作。这造成了几个具体的局限性:
- 规划不透明: 任务计划通常是单次输出的结果,而不是持久且可编辑的产物。
- 纠错缺乏接地性(Grounding): 高层级的自然语言纠错对于空间定位的 GUI 错误(例如,区分视觉相似的元素)往往是不够的。
- 全或无的恢复机制: 当发生错误时,智能体往往会广泛地重新生成整个工作流,从而丢弃了有效的先前进度,而不是进行局部修复。
- 缺乏可见性: 当执行发生漂移时,用户无法轻松检查、监督或干预智能体的推理或适应过程。
本文认为,鲁棒的 GUI 自动化不仅是一个建模问题,更是一个交互问题,其目标是使必要的监督时刻变得精确、局部化且可恢复。
2. 方法论:Plover 系统
Plover 是一个混合主动式(mixed-initiative)系统,旨在将任务计划外显化为持久、可检查且可修订的产物。它采用了一种在操作系统级虚拟机中运行的规划器-执行器架构,将高层规划与底层驱动分离。
2.1 核心架构
- 智能体界面: 主要的交互表面,用户在此检查计划、监控执行并引导适应。它包含一个共享计划工作区(显示可编辑的计划产物)、一个执行面板(显示实时截图、语义活动流和步骤时间线)以及一个运行时间线(可视化执行历史和分支计划修订)。
- 规划器服务: 合成并修订结构化计划。它将计划视为持久状态 Pt=(Ct,Ut),其中 Ct 代表不可变的已执行历史,Ut 是可编辑的待处理步骤后缀。规划器确保修复操作仅针对剩余的后缀进行,从而保留溯源性。
- 执行器服务: 将结构化的计划步骤转化为具体的 GUI 交互(鼠标、键盘、观察)。它保持了推理与驱动之间的严格分离,并将执行状态反馈给界面。
2.2 智能重新规划 (IR)
Plover 的一个核心机制是智能重新规划(Intelligent Replanning, IR),这是一个可见的计划适应过程,它在保留已执行历史的同时修订待处理步骤。IR 以两种模式运行:
- 用户驱动的 IR: 由用户干预触发。用户可以提供:
- 自然语言引导: 高层级的意图修正(例如,“选择第二个选项”)。
- 多模态标注: 基于截图的标记(笔画、形状、文本)以解决空间歧义。这通过将修复锚定到特定的像素区域,约束了更新的范围。
- 计划编辑: 直接修改可编辑计划产物中的步骤序列。
- 系统驱动的 IR: 由系统检测到非进展(non-progress)时触发。系统结合了行为循环检测(重复的语义动作)和视觉非进展验证(截图的感知哈希)来识别智能体何时陷入停滞。一旦检测到,系统会停止执行并提出一个局部恢复步骤供用户批准。
2.3 设计目标
该系统由基于对 6 名参与者的形成性研究得出的五个设计目标引导:
- DG1 可解释计划: 计划必须是可检查且可修订的,并具有清晰的版本控制。
- DG2 执行感知: 系统必须清晰地传达进度、失败和状态转换。
- DG3 接地局部修复: 干预必须是精确且具有视觉接地性的,将更新约束在相关的计划段落内。
- DG4 失败感知恢复: 系统必须识别非进展情况,并提出明确的重新规划,而不是沉默的适应。
- DG5 跨修复的连续性: 干预必须保留已执行的历史并维持任务的连续性。
3. 评估
作者通过三个互补的分析对 Plover 进行了评估:
3.1 基准失败案例修复分析
- 设置: 将来自 OSWorld-Verified 基准测试(此前被报告为自主智能体失败的任务)中的 38 个任务在混合主动式设置下重新执行。
- 方法: 当 Plover 检测到漂移或智能体失败时,专家提供了针对性的干预(自然语言、多模态标注、计划编辑)。
- 结果:
- 在 26 个自主执行未成功案例中,23 个通过混合主动式交互得到了改进。
- 其中 17 个变为完全成功,6 个变为部分成功。
- 仅有 3 个案例仍然失败(均为漂移传播至依赖步骤的复合错误)。
- 每次任务平均需要 2.04 次干预。
- 所有 10 个自主执行的部分成功案例均转化为完全成功。
- 浏览器任务的恢复率最高(100%),而多应用工作流的恢复率较低(80%)。
3.2 基于场景的稳定性分析
- 设置: 在没有人工干预的情况下,在浏览器和桌面(LibreOffice)环境中的 25 个不同轨迹上测试了自主执行。
- 指标: 视觉保真度(SSIM, MSE, dHash)和计划对齐度(覆盖度、顺序、冗余度、可操作性)。
- 结果:
- 视觉保真度: 浏览器工作流表现出高度稳定性(SSIM > 0.98),而桌面工作流表现出显著差异(SSIM 0.61–0.69),表明其对中间状态差异更为敏感。
- 计划对齐度: 虽然可操作性保持在高水平(0.97),但覆盖度(0.62)和顺序对齐度(0.41)处于中等水平。这表明虽然智能体可以执行单个步骤,但它们往往难以处理全局工作流对齐,从而为用户干预提供了机会,以防止漂移演变为终端失败。
3.3 可修复失败的特征描述
- 发现: 可修复性与失败的**局部性(locality)**密切相关。
- 局部失败: 执行漂移、感知错误和状态误解在很大程度上可以通过针对性干预来恢复。
- 复合失败: 当错误传播到依赖步骤时(46% 的案例中,其中 1/3 为复合错误),恢复变得显著困难。在这些情况下,累积的偏差过大,导致局部编辑无法恢复结构对齐。
- 干预类型: 自然语言引导是最频繁的恢复渠道,其次是系统驱动的 IR 和多模态标注。
4. 核心贡献
本文声称了以下贡献:
- 一种以计划为中心的交互设计: 一个将任务计划作为持久、可检查且可修订的产物进行外显化的框架,实现了显式的监督、局部修复和可见的重新规划。
- Plover 系统: 一个具有可编辑计划产物、显式智能重新规划以及支持针对性纠错并保留执行历史的多模态干预功能的实现系统。
- 对可恢复性的经验特征描述: 证据表明,当计划暴露出来时,许多 GUI 智能体的失败是结构上可修复的。研究识别了特定的失败模式(例如空间歧义、执行漂移),这些模式可以通过局部修复来解决,同时也识别了那些需要更早干预的模式(复合错误)。
5. 重要性与主张
本文认为,许多自主 GUI 智能体的失败并非终端错误,而是结构性的崩溃,当计划可见且干预局部化时,这些崩溃是可以恢复的。
- 范式转变: 该工作主张从“单次委托”转向“持续对齐”,即将自动化视为一个协作的、可修复的过程,而非一个完全自主的黑盒。
- 降低监督负担: 通过使中间意图和执行状态显式化,Plover 降低了用户的认知负荷,使用户能够专注于工作流中发生漂移的特定片段,而不是重建整个任务状态。
- 透明度与控制: 该系统证明,通过暴露计划,可以将重新规划从一种隐藏的恢复机制转变为一种可审计的交互过程,使 GUI 自动化更加透明、可控且具有适应性。
作者也谦虚地指出,虽然以计划为中心的交互对于长程、易漂移的任务非常有效,但对于短小、常规的工作流可能会引入额外的开销。此外,该方法假设用户具备足以纠正智能体的知识;未来的工作需要在任务结构本身不确定的场景下进行进一步研究。