← 最新论文
🤖 AI

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok 引入了一种新颖的多步路径规划范式,用于 GUI 智能体,该范式利用由语义概念锚定的可学习工具标记嵌入(tool token embeddings),并通过由易到难的课程学习进行训练,从而以显著少于现有方法的数据量实现了卓越的泛化能力和性能。

原作者: Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何使用电脑。长期以来,我们教机器人点击按钮的方式就像是给它们一张带有精确 GPS 坐标的地图。我们会说:“将你的手指移动到右边第 500 像素、向下第 300 像素的正中心。”

旧方法的缺陷
这种“GPS 坐标”法有一个重大缺陷:它极其僵化。如果展示给机器人的屏幕稍微宽一点、高一点,或者尺寸稍有不同,它就会完全迷失方向。这就像是在教一个人只在一条 10 英尺宽的路上开车;一旦遇到一条 12 英尺宽的路,他们就会撞车。机器人也会感到吃力,因为它必须记住数百万个特定的坐标数字,这需要海量的训练数据。

新解决方案:ToolTok
本文的作者提出了一个更聪明的方法:ToolTok。他们不再给机器人 GPS 坐标,而是教它使用离散的“工具标记”(tool tokens)

这就像是通过一套简单、易懂的指令来教孩子如何在房间里穿行,而不是通过英寸和英尺:

  • “向前迈出一大步。”
  • “向左轻挪一下。”
  • “进行一次快速点击。”
  • “回到起点。”

在论文的语言中,这些是像 <MOVE UP FAR>(大幅向上移动)、<CLICK SHORT>(短促点击)或 <GO HOME>(回到首页)这样的标记。机器人并不计算数字,而是通过选择其词汇表中的正确“词汇”,一步步地让鼠标光标靠近目标。

他们是如何教机器人的(三阶段教学计划)
由于机器人还不熟悉这些“工具词汇”,作者不能直接把它扔进真实的计算机界面中。他们设计了一个巧妙的三步训练课程(就像学校的教学大纲),以帮助机器人高效学习:

  1. 第一阶段:词典课(合成数据)
    在向机器人展示真实的屏幕之前,他们先用简单的虚构图形教它这些词汇的含义。他们会提问,比如:“<MOVE UP FAR> 是什么意思?”并让机器人练习在空白画布上移动一个点。这让机器人对词汇有了基础理解,而不需要成千上万张真实的截图。

    • 类比: 这就像是在玩真正的棋局之前,先在空棋盘上学习国际象棋的规则。
  2. 第二阶段:“简单模式”练习(真实屏幕)
    一旦机器人掌握了这些词汇,作者就会向它展示简单的真实电脑屏幕。他们为机器人创建了一条“完美路径”,展示它应该选择哪个工具才能从 A 点到达 B 点。

    • 类比: 这就像是驾驶教练给了你一辆仪表盘上标有完美路线的汽车,你只需要跟随指示行驶即可。
  3. 第三阶段:“困难模式”挑战(复杂屏幕)
    最后,他们引入了具有微小按钮和复杂布局的专业级复杂屏幕。因为机器人在前两个阶段已经学习了运动的“语言”,所以它可以处理这些更难的任务而不会感到不知所措。

核心秘诀:“语义锚定”(Semantic Anchoring)
一个巨大的挑战是,这些“工具词汇”对机器人来说完全是全新的。如果你只是随机地向机器人的大脑中添加一个新词,它并不知道这个词是什么意思。

作者使用了一种叫做**“语义锚定”**的技巧。他们将每个新的工具词与机器人已经理解的词联系起来。

  • 例子: 对于新的工具词 <MOVE UP FAR>,他们将其与机器人已经理解的现有词汇(如“move/移动”、“up/向上”、“jump/跳跃”和“far/远”)联系在一起。
  • 类比: 想象你在学习一门新语言。你不是在死记硬背一个随机的声音,而是通过已知词汇了解到“Gato”的意思是“猫”,因为你已经知道什么是猫。机器人利用它现有的关于“向上”和“远”的知识,能够瞬间理解这个新的工具标记。

结果
论文声称这种方法取得了巨大成功:

  • 数据效率: 机器人学会成为专家所使用的数据量不到其他方法的 1%。其他机器人可能需要数百万个示例,而 ToolTok 仅用约 5,000 个样本就学会了。
  • 鲁棒性(稳健性): 因为机器人使用的是“步长”(大、中、小)而不是精确坐标,所以即使屏幕尺寸发生变化,它也能完美运行。当屏幕宽高比改变时,它不会崩溃。
  • 性能: 一个规模相对较小(40 亿参数)的模型通过这种方法训练后,表现优于许多规模大得多的模型(2350 亿参数),并且击败了其他专门的机器人智能体。

总结
ToolTok 改变了我们教机器人使用电脑的方式。它不再强迫机器人去死记硬背精确的坐标(这很容易失效),而是教它一种灵活的“步长”和“动作”语言。通过使用聪明的课程体系,并将新工具与机器人已知的词汇相联系,他们创造了一个学习更快、使用数据更少且能在不同屏幕尺寸下可靠工作的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →