VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
本文介绍了 VIABench,这是一个源自视障人士第一视角录像的综合视频基准测试,旨在通过主动提醒、视觉问答和视觉引导交互这三个核心辅助任务来评估多模态大语言模型,并揭示了当前模型在实际盲人辅助方面的实时响应能力和上下文推理能力方面存在的显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:VIABench
问题陈述
视障人士(VIIs)由于视觉信息的获取受限,在日常生活中面临着巨大的挑战。虽然多模态大语言模型(MLLMs)在通用视觉语言任务上表现出了令人印象深刻的性能,但其在现实世界盲人辅助方面的实际效用仍有待深入探索。现有的辅助视觉基准测试和数据集存在以下关键局限性:
- 领域差异(Domain Gap): 诸如 WAD 之类的数据集依赖于为有视力人士设计的精选旅游视频,未能捕捉到视障人士真实经历中那种原始、未经编辑的本质。
- 任务局限(Task Limitations): 诸如 EgoBlind 之类的数据集主要侧重于被动的、由用户发起的视觉问答(VQA),忽略了对主动式、自主辅助的需求。
- 时间约束(Temporal Constraints): 许多现有的视频基准测试使用短片段(例如 3 秒),这缺乏长时程推理和导航所需的丰富时间维度信息。
- 评估失配(Evaluation Mismatch): 当前的在线评估流程通常计算量巨大且依赖稀疏的标注,因此不适合评估需要持续监控和及时提醒的“提醒式”任务。
因此,目前缺乏一个由盲人收集的、全面的、通用的视频基准测试,能够评估 MLLMs 在包括主动预判和交互式引导在内的全方位辅助需求方面的表现。
方法论
1. VIABench 数据集构建
作者构建了 VIABench,这是一个专门为视觉障碍辅助定制的大规模、时间对齐的、第一视角(egocentric)视频基准测试。数据收集遵循五个阶段的流水线:
- 来源(Sourcing): 视频通过两个流向进行采集:(1)来自 YouTube、Bilibili 和抖音等平台上视障人士的真实视频;(2)由经过培训的标注员录制的知情模拟视频,旨在覆盖公共数据中稀缺的特定“视觉引导交互”场景。
- 标注(Annotation): 该数据集包含 761 个视频,总计 46.9 小时,包含 14,526 条人工策划的标注。平均视频时长为 222 秒(最大为 1959 秒),显著长于以往的数据集。
- 质量控制(Quality Control): 通过包括试标注、专业供应商协作和多阶段质量保证(QA)在内的严格流程,确保了高质量、细粒度的标签。
2. 任务定义
VIABench 定义了三个反映辅助复杂度递增的核心任务:
- 主动提醒(Proactive Reminder): 模型必须自主监测视频流,并在没有明确用户提示的情况下,主动描述即将发生的导航关键事件(例如:障碍物、楼梯)。这要求模型具备准确的预判能力和实时响应能力。
- 视觉问答(VQA): 模型根据当前和过去的视觉上下文,回答用户提出的关于环境的问题,模拟导航过程中的自发查询。
- 视觉引导交互(Vision-Guided Interaction): 一个多轮、闭环的任务,模型提供迭代的、具备上下文感知能力的指导,以帮助用户调整视角或物理动作,从而实现特定目标。
3. 评估框架:Token 级提示激活解码(TPAD)
为了解决评估离线模型(通常需要显式提示)中主动提醒能力的挑战,作者提出了 TPAD,一种新型的两阶段评估框架:
- 机制: TPAD 在无需微调的情况下,将预训练的 MLLM 转变为帧级别的预测检测器。它将一个固定的强制选择提示(例如:“是否应该警告用户?(A) 是;(B) 否”)与整个视频序列进行拼接。
- 评分: 对于每一帧,其最后一个 token 的隐藏状态通过语言模型头进行投影,以计算发出警报的概率。
- 优势: 这使得通过单次前向传播即可生成整个视频中各帧的警报概率,从而能够在流式条件下高效且具备上下文感知地评估离线模型。
核心贡献
- VIABench 数据集: 引入了一个用于盲人辅助的大规模、真实世界的视频基准测试,具有长篇幅的第一视角视频和多样化的内容。它是第一个将主动提醒、VQA 和视觉引导交互任务统一在单一基准测试中的工作。
- TPAD 框架: 提出了一种轻量级的两阶段评估机制,能够高效评估长连续视频中的主动警报生成,弥合了离线 MLLMs 与实时辅助需求之间的差距。
- 全面评估: 对领先的开源、闭源及在线流式 MLLMs 在 VIABench 上进行了系统性评估,揭示了它们在现实世界辅助应用中的现状及局限。
实验结果
作者评估了广泛的模型,包括开源基础模型(如 InternVL、Qwen、LLaVA)、闭源模型(GPT-5、GPT-4o、Gemini)以及在线流式模型。
- 整体性能: 当前的 MLLMs 在现实世界视觉辅助方面仅表现出初步的能力。即使是最强的模型 GPT-5,在该基准测试上的平均得分也仅为 28.8。
- 任务差异: 模型在主动提醒和视觉引导交互任务上的表现明显低于标准的 VQA 任务。
- 主动提醒: 模型经常无法预判导航关键事件,或生成的引导与地面真值(ground-truth)的时间间隔不一致。它们难以应对动态需求,即在没有相关信息时保持沉默,同时在需要时及时发出警报。
- 视觉引导交互: 模型往往提供泛泛的指令(例如:“把它捡起来”),而不是空间特定的指导,未能考虑到视障人士独特的视角和局限性。
- 流式模型: 现有的在线流式模型在主动提醒任务上的表现极其糟糕。作者将其归因于其训练数据中复杂、真实世界引导指令的暴露不足(通常仅限于密集的描述或旁白),以及对低质量、不受控视觉输入的鲁棒性不足。
意义与未来方向
论文指出,VIABench 可作为一个具有挑战性且真实的测试平台,驱动未来研究开发定制化的 MLLMs 以实现现实世界的辅助。作者强调,目前的模型尚未准备好部署在涉及安全的关键型盲人辅助场景中。
论文概述了三个具体的未来研究方向:
- 架构改进: 开发能够实现可靠、具备上下文感知且实时主动响应的模型架构。
- 数据丰富化: 整合更丰富的视频-文本数据集,涵盖多样化的指令类型、复杂的交互以及现实世界的场景,以提高主动推理能力。
- 以盲人为中心的优化: 针对视障人士的独特视角和意图对模型进行微调,解决诸如低分辨率输入、相机颠倒以及对空间特定指导的需求等问题。
最终,这项工作旨在通过推动更强大、更可靠的辅助技术的发展,来提升视障人士的自主性和安全性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。