← 最新论文
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO 引入了一种高效的在线技能蒸馏框架,该框架通过维护结构化的技能库并采用进度反思和缓存感知提示等技术,使多模态网络代理能够提升性能并降低令牌消耗,在 VisualWebArena 上实现了 58.3% 的成功率,且与现有方法相比显著降低了推理成本。

原作者: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于PANDO论文的通俗解释,使用了类比进行说明。

核心难题:“按点击付费”的陷阱

想象你雇佣了一位非常聪明但昂贵的助手来帮你在线购物。每当你让他们查看网页、思考该做什么或点击按钮时,你都需要支付一笔微小的费用(称为“令牌”)。

目前,大多数 AI 智能体试图通过花费更多金钱来提升工作表现。如果失败,他们就再试一次;如果卡住了,就寻求第二意见;他们将同一任务运行十次,然后挑选最好的结果。这虽然有效,但就像为了去杂货店付了一次出租车费,为了回去检查是否忘了钱包又付了第二次出租车费,再为了确认价格付了第三次出租车费。这确实能完成任务,但极其昂贵且缓慢。

这篇论文的作者问道:我们能否打造一种智能体,随着工作量的增加,它变得更便宜更快,而不是每次都要花费更多金钱?

解决方案:PANDO(“巨型杨树林”智能体)

研究人员构建了一个名为PANDO的智能体。它的名字来源于犹他州的“Pando”杨树林。

  • 隐喻: PANDO 看起来像 47,000 棵独立的树,但实际上它们都通过地下的单一根系相互连接。当一棵树生长时,它会与其他树木共享养分;当一棵树死亡时,根系会记住它并维持整片森林的生机。
  • AI 版本: PANDO 是一个拥有共享“记忆根系”(技能库)的 AI 智能体。它不是将每个新任务视为全新的问题,而是记住从先前任务中学到的内容,并利用这些经验来解决新问题。

PANDO 的工作原理(四步循环)

PANDO 不仅仅是猜测和检查。它遵循一个循环:规划 → 行动 → 反思 → 学习

  1. 规划: “大脑”(一个聪明但昂贵的 AI)将一个大任务(例如“找到 500 美元以下的最便宜吉他”)分解为小步骤。
  2. 行动: “双手”(一个更便宜、更快的 AI)实际点击按钮。
  3. 反思: “经理”检查这些步骤是否有效。价格筛选器是否真的改变了列表?如果没有,原因是什么?
  4. 学习(魔法部分): 这是 PANDO 变得更聪明的地方。
    • 技能库: 如果智能体成功找到了便宜的吉他,它会记录下这个“配方”:“要找到便宜商品,点击‘按价格排序’,然后选择‘从低到高’。”它将此保存为一条规则或一个惯例
    • 复用技能: 下次智能体需要寻找“最昂贵”的商品时,它无需苦思冥想。它只需查看技能库,看到规则,然后将开关切换到“从高到低”。
    • 降级(清理): 如果某条规则停止生效(例如网站更改了布局),智能体会将其标记为“损坏”并停止使用。这防止了智能体陷入循环,试图使用旧且无效的指令。

为何它是游戏规则改变者

该论文在910 个不同的网页任务(购物、分类广告、Reddit)上测试了 PANDO。结果如下:

  • 成功率: PANDO 的成功率为58.3%。这优于当前的顶级智能体(约为 54%)。
  • 成本: 这是最大的胜利。PANDO 使用的令牌(金钱)比次优智能体少了 58%
  • “免费午餐”效应:
    • 早期: PANDO 稍慢,因为它正在学习规则。
    • 后期: 随着它建立技能库,它变得更快、更便宜。在测试结束时,它完成任务所需的步骤和资金比开始时更少。
    • 类比: 想象一个学生参加数学考试。
      • 旧式智能体: 每次看到新题目,他们都从头推导公式。这需要很长时间。
      • PANDO: 第一次看到题目时,他们解出题目并将公式写在作弊条上。接下来的 99 次,他们只需查看作弊条。他们完成考试的速度更快,消耗的脑力更少。

PANDO 避免的“隐藏成本”

论文指出,其他智能体通过两种方式隐藏成本:

  1. 预评估发现: 有些智能体在测试开始前花费数周时间“训练”或“发现”工具。PANDO 在测试过程中学习,因此没有隐藏的前期成本。
  2. 扩展 rollout( rollout 缩放): 有些智能体只是尝试任务 10 次并挑选获胜者。PANDO 只尝试一次,但利用其记忆让这唯一的一次尝试产生价值。

核心结论

PANDO 证明,你不需要向 AI 投入更多金钱就能让它变得更好。通过赋予它结构化记忆(技能库)和清理不良记忆(降级)的能力,智能体随着工作量的增加而变得更加高效。

这就像是一个每天忘记一切、需要不断重新培训的工人,与一个持有“操作指南”笔记本、每天变得更快的工人之间的区别。

关键要点: PANDO 不仅变得更聪明;随着经验的积累,其运行成本变得更便宜

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →