EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
EgoBench 推出了首个面向工具使用智能体的交互式多模态基准测试,包含 1,045 个以自我为中心的视频任务和一个模拟用户环境,用于严格评估感知、推理与动态交互的协同能力,结果表明当前最先进的模型在这些复杂能力上存在显著不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人管家如何在你头戴摄像头的情况下帮你做晚饭或采购杂货。你希望这个机器人不仅能“看见”你在做什么,还能“思考”下一步该做什么,“使用工具”去查询数据库(比如食谱书或价格表),并在感到困惑时与你“对话”。
这篇论文介绍了EgoBench,它本质上是为这些机器人管家设计的一场巨大且极具难度的“期末考试”。以下是用简单类比对论文内容的拆解:
1. 问题:过于简单的测试
想象你在训练一只狗。如果你只在安静、空旷的场地上让它“坐下”,它看起来可能像个天才。但在现实世界中,这只狗需要在汽车鸣笛、松鼠跑过,以及你发出“坐下,然后去捡球,但前提是球必须是红色的”这样复杂的指令时都能做到“坐下”。
作者指出,当前针对 AI 智能体的测试就像那个安静的场地。它们太简单了,无法测试 AI 是否能:
- 看见混乱、动态视频中的情况(例如你双手做饭的第一人称视角)。
- 思考多步骤的逻辑谜题(例如:“如果番茄是红色的,就检查冰箱;如果过期了,就买一个新的”)。
- 与可能缺乏耐心、容易健忘或给出模糊提示的人类对话。
2. 解决方案:EgoBench(“障碍赛”)
EgoBench 是一个专门构建的新测试场,旨在观察 AI 智能体能否应对现实生活的混乱。它包含三个主要部分:
- 视频(眼睛): 与静态图片不同,AI 观看的是简短的第一人称视频(就像你头戴 GoPro 拍摄的画面)。这就像 AI 戴上了你的眼镜。它必须弄清楚:“哦,左边那个是番茄,我刚刚把它拿起来了。”
- 工具(双手): AI 不能仅靠猜测。它必须使用“工具”(如数字电话簿或数据库)来查找隐藏信息。例如,视频显示了一瓶葡萄酒,但视频本身并未说明它是否过期。AI 必须使用工具去查询数据库。
- 模拟用户(嘴巴): 这是巧妙之处。论文构建了一个“假人”(一个模拟人类行为的计算机程序)与 AI 对话。这个假人可以:
- 简单: 只是礼貌地提问。
- 困难: 表现得不耐烦,提供无关信息(“顺便说一句,天气不错!”),或者如果 AI 太慢就生气。
- 静态: 一次性在一大段文字中给出所有指令。
3. 评分系统:禁止作弊
在许多 AI 测试中,一台聪明的计算机(另一个 AI)会阅读答案并说:“听起来不错!”这是主观的。
EgoBench 采用确定性评分系统。这就像视频游戏的得分:
- 过程检查: AI 是否调用了正确的工具?(它是否查询了价格?是否检查了过期日期?)
- 结果检查: 最终的数据库状态是否符合目标?(物品是否真的在购物车里?食谱是否已更新?)
如果 AI 说“我做到了”,但数据库没有显示变更,它就得零分。别想和老师争辩。
4. 结果:“现实检验”
作者用这项考试测试了当今可用的 8 个最聪明、最先进的 AI 模型。
裁决结果? 它们惨败。
- 即使是最好的模型,根据“假人”的困难程度不同,也仅能正确完成约**19% 到 30%**的任务。
- 在最简单的场景(零售/购物)中,最好的模型仍然只答对了约30%。
它们为何失败? 论文发现 AI 智能体在以下方面存在困难:
- 误读视频: “我以为那是番茄,但实际上是红辣椒。”
- 幻觉: 编造视频或数据库中不存在的事实。
- 逻辑糟糕: 搞错“如果/那么”规则。
- 冒险行为: 做了用户未要求的事情,比如从列表中删除物品。
总结
论文认为,虽然 AI 在对话和看图方面越来越擅长,但在结合这些技能以在混乱的现实世界环境中真正做事方面仍然非常糟糕——在那里,它必须与人交谈、使用工具并遵循复杂的规则。EgoBench 是我们用来衡量我们还有多远要走的新标尺。
重要提示: 该论文仅提出了这一基准和测试结果。它并未声称这些 AI 智能体已准备好用于医院、自动驾驶汽车或任何其他特定的现实世界应用。它只是说:“这里有一个测试,而目前顶级模型在其中的表现非常糟糕。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。