VisualClaw: A Real-Time, Personalized Agent for the Physical World
VisualClaw 是一个自我进化的实时多模态智能体,它利用混合编码技术大幅降低了 API 成本和延迟,同时通过从失败中持续学习以提高准确性,并在标准视频问答基准测试以及一个新的智能体工作空间基准测试 VisualClawArena 上得到了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个超级聪明的助手(一个人工智能),它能够观看视频、阅读文档并使用计算机工具来为你解决问题。这篇论文介绍了一个名为 VisualClaw 的新版助手。
目前的主要问题是,现有的 AI 助手就像是过度热情的游客:它们试图观察视频中的每一秒钟,阅读手册中的每一个字,并在每一个微小的细节上都向“大脑”(AI 模型)寻求帮助。这极其昂贵、缓慢,并且由于信息量过大,往往会让 AI 感到困惑。
VisualClaw 通过扮演一个聪明的、经验丰富的向导来解决这个问题,这个向导知道该关注什么,以及如何随着时间的推移变得更加聪明。以下是它的工作原理,分为三个简单的部分:
1. “智能过滤器”(节省金钱和时间)
想象你正在观看一段 30 分钟的森林漫步视频。
- 旧方式: AI 尝试分析每一个帧(每一帧图像)。这就像要求一个人去描述每一棵树上的每一片叶子,即使相机根本没有移动。这会耗费巨额的计算能力。
- VisualClaw 的方式: VisualClaw 在视频到达云端之前,就在你的设备上(比如你的眼镜或手机)运行一个“智能过滤器”。它就像博物馆里的保安。
- 如果相机只是轻微晃动或者场景很枯燥(静态),保安会说:“跳过这个,这里没什么新东西。”
- 如果相机转过了一个弯,或者发生了重要的事情,保安会说:“停!这是一个关键时刻。把这一帧发送给老板。”
- 结果: 对于一段 30 分钟的视频,它不再发送 1,800 帧,可能只发送 5 或 6 帧。这降低了 98% 的成本,并使系统能够足够快地在 AI 眼镜等实时设备上运行。
2. “活手册”(无需重构即可变得更聪明)
大多数 AI 模型就像是冻结的雕像:一旦建成,如果不进行彻底重建,它们就无法从错误中学习(而重建既困难又昂贵)。
- 旧方式: 如果 AI 失败了一项任务,它就直接失败了。下次,它会尝试同样的方法并再次失败。
- VisualClaw 的方式: VisualClClaw 保留了一本活手册(一个“技能库”)。
- 当 AI 犯错时,一个单独的“教练”(离线进化器)会查看哪里出了问题。
- 教练会将一条新的规则或提示写入手册(例如:“握住绳子时,务必先检查稳定性”)。
- 下次,AI 在回答之前会先查阅这本手册。它不需要改变自己的大脑,只需阅读一份更好的说明书。
- “热/冷”技巧: 为了防止手册变得过于沉重,VisualClaw 只向 AI 展示当前最相关的 5 条提示(热),同时将其他的放在架子上(冷)以备不时之需。这让 AI 保持快速且专注。
3. “练习场”(在现实世界中测试)
作者意识到,标准的 AI 测试就像是多选题,你只需要选出答案。但在现实世界中,AI 需要真正地去做事情:打开文件、编辑文档,并检查其工作是否正确。
- 为了解决这个问题,他们构建了一个新的测试,叫做 VisualClawArena。
- 把这想象成一个电子游戏关卡,AI 必须:
- 观看一段视频剪辑。
- 阅读聊天记录或文档。
- 打开电脑上的一个文件。
- 修正一个错误或写一份报告。
- 通过一次“检查”以证明它完成了这项工作。
- 这测试了 AI 是否能利用视频证据来解决实际问题,而不仅仅是猜出正确答案。
结果:发生了什么?
当他们测试 VisualClaw 时:
- 它变得更聪明了: 在大多数测试中,由于它能利用“活手册”从过去的失败中学习,AI 的准确性提高了。
- 它变得更便宜了: 因为“智能过滤器”阻止了它发送无用的视频帧,运行 AI 的成本在长视频中下降了近 99%。
- 它在现实世界中有效: 在新的“竞技场”测试中,能够学习和进化的 AI(VisualClaw)大幅领先于标准 AI,证明了这种方法有助于处理复杂的、多步骤的任务。
简而言之: VisualClaw 是一个不会盯着所有事物看(从而节省资金)、会记录从错误中吸取的教训(从而变得更聪明),并且通过现实模拟来证明自己能胜任现实工作的 AI 助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。