FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
本文介绍了 FineBench,这是一个具有长视频密集标注的大规模细粒度人类活动基准,并提出了 FineAgent,这是一个模块化框架,显著增强了开源视觉语言模型的空间推理与动作理解能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一个繁忙的电影场景,里面有十个不同的角色在四处奔跑、交谈并手持物品。如果你问一个标准的人工智能“发生了什么?”,它可能会给你一个不错的概括:“人们在公园里野餐。”这就像从远处看一张照片。
但如果你需要确切知道左边第三个人的手在做什么,或者右边的那个人是在对群体说话还是仅仅在倾听呢?这就像放大画面,直到你能看清他们额头上的汗珠和他们正在做的具体手势。这就是“一般性理解”与"细粒度理解"之间的区别。
本文介绍了一种名为FineBench的新工具,用于测试人工智能在这种放大后的、细节丰富的视角下表现如何;同时介绍了一种名为FineAgent的新辅助工具,用于修正人工智能的错误。
以下是用简单术语进行的分解:
1. 问题所在:人工智能是“通才”,而非“侦探”
当前的人工智能模型(视觉 - 语言模型)非常擅长识别大物体。它们能告诉你一辆车在移动,或者一个人坐着。但当场景变得拥挤或动作变得微妙时,它们就会感到困惑。
- 类比:想象一位侦探,他非常擅长说“这里有一个犯罪现场”,但非常不擅长判断房间里的十个嫌疑人中哪一个拿着刀,或者那个嫌疑人是在挥手还是指路。
- 论文发现:研究人员测试了许多人工智能模型,发现它们在识别人类如何操作物体(如拿着杯子)方面表现出色。然而,它们在人与人之间的互动(如说话与倾听)以及细微的身体动作(如站立与跌倒)方面表现极差。
- 人群因素:视频中的人越多,人工智能的表现就越差。这就像试图在 50 人的人群中寻找一位特定的朋友;人工智能会迷失方向,将所有人混淆。
2. 测试:FineBench(“期末考试”)
为了证明这一点,团队构建了FineBench。
- 它是什么:一个庞大的题库,包含基于 64 段长视频(每段 15 分钟)生成的近20 万个问题。
- 工作原理:它不问宽泛的问题,而是提出超具体的问题,例如“左边第三个人的姿势是什么?”或者“右边的那个人是在对群体说话还是在看着他们?”
- 结果:即使是最聪明的人工智能模型,也有相当一部分问题未能回答正确。它们能处理“简单”的物体问题,但在“困难”的人际互动问题上却跌跌撞撞。
3. 解决方案:FineAgent(“助手”)
既然无法从头重新训练庞大的人工智能模型(这既昂贵又缓慢),他们构建了一个名为FineAgent的“助手”系统。把它想象成给侦探提供放大镜和笔记本。
FineAgent 由两部分组成:
- 定位器(放大镜):在人工智能尝试回答之前,这个工具会用数字手指指向问题所涉及的特定人物。它会说:“忽略其他人;就在此处看左边的那个人。”这防止了人工智能因人群而混淆。
- 描述器(笔记本):这个工具会为该特定人物正在做的事情写一个简短、详细的说明。它会添加上下文,例如“这个人拿着相机看着天空”。这为主人工智能理解细微差别提供了先发优势。
结果:当主人工智能使用这两个助手时,其性能显著提升。它不需要重新训练;它只需要更好的指令和专注。
总结
- 问题:人工智能擅长看见森林,但不擅长数清拥挤森林中特定树木上的特定树叶。
- 测试:FineBench是一项严格的考试,迫使人工智能数清那些树叶,并准确描述它们在做什么。
- 修正:FineAgent充当向导,将人工智能指向正确的人并描述场景,帮助它在不进行全面 overhaul 的情况下获得正确答案。
论文结论指出,虽然人工智能正变得越来越聪明,但它仍然需要帮助来理解人类彼此之间以及与世界互动的微妙而复杂的方式。FineBench 提供了测试,而 FineAgent 提供了学习指南。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。