← 最新论文
💻 computer science

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

本文提出了 HATS 框架,通过定义动作的“难度”(即语义歧义程度)并构建难度驱动的探索与对齐引导的优化闭环,有效解决了现有 GUI 智能体轨迹合成中语义歧义处理不足的问题,从而显著提升了智能体在复杂真实场景下的泛化能力。

原作者: Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 HATS(Hardness-Aware Trajectory Synthesis,即“难度感知轨迹合成”)的新方法,旨在训练更聪明的 GUI 智能体(也就是能像人一样操作手机或电脑界面的 AI 助手)。

为了让你轻松理解,我们可以把训练 AI 操作手机的过程,想象成教一个刚入职的实习生学会使用复杂的办公软件

1. 核心问题:为什么以前的 AI 总是“学艺不精”?

在 HATS 出现之前,训练这些 AI 主要靠两种方法:

  • 方法 A(任务驱动): 让人类专家手把手教 AI 做任务。但这太贵了,而且教得不够全面。
  • 方法 B(OS-GENESIS,随机探索): 让 AI 自己在手机里乱点,然后让它自己描述刚才做了什么。

这就好比: 你让实习生在办公室里乱逛,然后让他写工作报告。

  • 结果: 实习生大部分时间都在做简单、重复的事,比如“打开菜单”、“点返回键”、“点击那个明显的按钮”。
  • 缺失: 他很少遇到真正有挑战、容易混淆的情况。比如:
    • 两个长得一模一样的"+"号按钮,一个在“新建文件夹”界面,一个在“添加联系人”界面(视觉歧义)。
    • 必须先点击“设置”,再点“保存”,顺序错了就全白搭(顺序依赖)。
    • 同一个按钮,在白天模式是“保存”,在夜间模式是“取消”(上下文依赖)。

以前的 AI 因为没怎么见过这些“坑”,一旦遇到稍微复杂点的真实场景,就彻底懵了,或者把指令理解错了。

2. HATS 的解决方案:给 AI 安排“魔鬼训练”

HATS 的核心思想是:不要只让 AI 做简单题,要专门挑那些它容易做错的“难题”来练,并且要确保它真的听懂了题目。

HATS 就像一个高明的教练,它有两个绝招,并且这两个绝招是闭环配合的:

绝招一:难度驱动的“寻宝”(Hardness-Driven Exploration)

  • 比喻: 以前的教练让实习生在办公室随机转悠。HATS 的教练手里有一张**“难度地图”**。
  • 做法: 教练会故意引导 AI 去那些容易混淆、步骤繁琐、容易出错的地方。
    • 比如,故意让它去点那个长得像“保存”但其实是“取消”的按钮。
    • 如果 AI 在这里迷路了,教练就会标记:“这里很难!下次要多练练!”
  • 目的: 确保 AI 见识过各种“坑”,而不是只会做简单的点击。

绝招二:对齐引导的“纠错”(Alignment-Guided Refinement)

  • 比喻: 以前 AI 乱点一通后,自己写个报告说“我完成了任务”,教练就信了。HATS 的教练会现场复核
  • 做法:
    1. AI 生成一个任务指令(比如“帮我保存文件”)。
    2. 教练让 AI 重新执行一遍这个指令。
    3. 关键一步: 教练对比“原本的操作轨迹”和“重新执行的结果”。
      • 如果 AI 重新执行时,发现“哎呀,刚才那个指令没说清楚,导致我点错了”,教练就会修改指令,补充细节(比如:“点击右下角那个带锁图标的保存按钮,而不是左上角的”)。
    4. 直到指令和动作完美匹配,才把这条数据存下来。
  • 目的: 消除“指令”和“动作”之间的误解,确保 AI 学到的数据是精准的。

绝招三:闭环反馈(Closed-Loop)

  • 比喻: 这是一个无限循环的升级系统
  • 流程:
    1. 寻宝发现了一个很难的“坑”(比如 AI 总是点错按钮)。
    2. 纠错环节发现,因为指令描述不清,导致 AI 掉进坑里。
    3. 系统把这个“坑”标记为高难度,并告诉寻宝模块:“下次多带 AI 来这种地方练练!”
    4. 同时,把修正后的完美指令存入教材。
    5. 如此循环,AI 的教材里全是高质量、高难度、无歧义的实战案例。

3. 最终效果:AI 变成了“老司机”

通过 HATS 训练出来的 AI,就像是一个经历过各种突发状况、读过无数本“避坑指南”的老司机

  • 以前: 遇到稍微复杂的界面(比如两个相似的按钮),AI 就瞎猜,成功率很低。
  • 现在: 在论文测试中(Android 和网页环境),HATS 训练的 AI 表现碾压了之前的所有方法。
    • 在 Android 任务中,成功率提升了 100% 以上。
    • 在网页任务中,提升了 215%

总结

简单来说,HATS 就是给 AI 训练引入了**“难度分级”“严格质检”**:

  1. 不练简单的: 专门挑那些容易混淆、容易出错的复杂操作来练。
  2. 不练错的: 每次练习都要反复验证,确保指令和动作严丝合缝。
  3. 越难越练: 哪里容易出错,就重点练哪里,直到 AI 能完美掌握。

这就让 AI 从只会做简单点击的“新手”,进化成了能处理复杂现实任务的“专家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →