← 最新论文
💬 NLP

VisualClaw: A Real-Time, Personalized Agent for the Physical World

VisualClaw 是一个自我进化的实时多模态智能体,它利用混合编码技术大幅降低了 API 成本和延迟,同时通过从失败中持续学习以提高准确性,并在标准视频问答基准测试以及一个新的智能体工作空间基准测试 VisualClawArena 上得到了验证。

原作者: Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao
发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao, Cihang Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个超级聪明的助手(一个人工智能),它能够观看视频、阅读文档并使用计算机工具来为你解决问题。这篇论文介绍了一个名为 VisualClaw 的新版助手。

目前的主要问题是,现有的 AI 助手就像是过度热情的游客:它们试图观察视频中的每一秒钟,阅读手册中的每一个字,并在每一个微小的细节上都向“大脑”(AI 模型)寻求帮助。这极其昂贵、缓慢,并且由于信息量过大,往往会让 AI 感到困惑。

VisualClaw 通过扮演一个聪明的、经验丰富的向导来解决这个问题,这个向导知道该关注什么,以及如何随着时间的推移变得更加聪明。以下是它的工作原理,分为三个简单的部分:

1. “智能过滤器”(节省金钱和时间)

想象你正在观看一段 30 分钟的森林漫步视频。

  • 旧方式: AI 尝试分析每一个帧(每一帧图像)。这就像要求一个人去描述每一棵树上的每一片叶子,即使相机根本没有移动。这会耗费巨额的计算能力。
  • VisualClaw 的方式: VisualClaw 在视频到达云端之前,就在你的设备上(比如你的眼镜或手机)运行一个“智能过滤器”。它就像博物馆里的保安
    • 如果相机只是轻微晃动或者场景很枯燥(静态),保安会说:“跳过这个,这里没什么新东西。”
    • 如果相机转过了一个弯,或者发生了重要的事情,保安会说:“停!这是一个关键时刻。把这一帧发送给老板。”
    • 结果: 对于一段 30 分钟的视频,它不再发送 1,800 帧,可能只发送 5 或 6 帧。这降低了 98% 的成本,并使系统能够足够快地在 AI 眼镜等实时设备上运行。

2. “活手册”(无需重构即可变得更聪明)

大多数 AI 模型就像是冻结的雕像:一旦建成,如果不进行彻底重建,它们就无法从错误中学习(而重建既困难又昂贵)。

  • 旧方式: 如果 AI 失败了一项任务,它就直接失败了。下次,它会尝试同样的方法并再次失败。
  • VisualClaw 的方式: VisualClClaw 保留了一本活手册(一个“技能库”)。
    • 当 AI 犯错时,一个单独的“教练”(离线进化器)会查看哪里出了问题。
    • 教练会将一条新的规则或提示写入手册(例如:“握住绳子时,务必先检查稳定性”)。
    • 下次,AI 在回答之前会先查阅这本手册。它不需要改变自己的大脑,只需阅读一份更好的说明书。
    • “热/冷”技巧: 为了防止手册变得过于沉重,VisualClaw 只向 AI 展示当前最相关的 5 条提示(热),同时将其他的放在架子上(冷)以备不时之需。这让 AI 保持快速且专注。

3. “练习场”(在现实世界中测试)

作者意识到,标准的 AI 测试就像是多选题,你只需要选出答案。但在现实世界中,AI 需要真正地去做事情:打开文件、编辑文档,并检查其工作是否正确。

  • 为了解决这个问题,他们构建了一个新的测试,叫做 VisualClawArena
  • 把这想象成一个电子游戏关卡,AI 必须:
    1. 观看一段视频剪辑。
    2. 阅读聊天记录或文档。
    3. 打开电脑上的一个文件。
    4. 修正一个错误或写一份报告。
    5. 通过一次“检查”以证明它完成了这项工作。
  • 这测试了 AI 是否能利用视频证据来解决实际问题,而不仅仅是猜出正确答案。

结果:发生了什么?

当他们测试 VisualClaw 时:

  • 它变得更聪明了: 在大多数测试中,由于它能利用“活手册”从过去的失败中学习,AI 的准确性提高了。
  • 它变得更便宜了: 因为“智能过滤器”阻止了它发送无用的视频帧,运行 AI 的成本在长视频中下降了近 99%
  • 它在现实世界中有效: 在新的“竞技场”测试中,能够学习和进化的 AI(VisualClaw)大幅领先于标准 AI,证明了这种方法有助于处理复杂的、多步骤的任务。

简而言之: VisualClaw 是一个不会盯着所有事物看(从而节省资金)、会记录从错误中吸取的教训(从而变得更聪明),并且通过现实模拟来证明自己能胜任现实工作的 AI 助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →