← Últimos artículos
💻 computer science

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

Este artículo presenta VIABench, un banco de pruebas de video exhaustivo derivado de grabaciones en primera persona realizadas por personas con discapacidad visual para evaluar los Modelos de Lenguaje de Gran Escala Multimodales a través de tres tareas de asistencia principales —Recordatorio Proactivo, Preguntas y Respuestas Visuales e Interacción Guiada por la Visión— revelando brechas significativas en la capacidad de respuesta en tiempo real y el razonamiento contextual de los modelos actuales para la asistencia práctica a personas ciegas.

Autores originales: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

Publicado 2026-07-17
📖 1 min de lectura☕ Lectura para el café

Autores originales: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: VIABench

Declaración del Problema

Las personas con discapacidad visual (VII, por sus siglas en inglés) enfrentan desafíos significativos en su vida diaria debido al acceso limitado a la información visual. Aunque los Modelos de Lenguaje de Gran Escala Multimodales (MLLMs) han demostrado un desempeño impresionante en tareas generales de visión y lenguaje, su utilidad práctica en la asistencia visual del mundo real sigue siendo ampliamente inexplorada. Los benchmarks y conjuntos de datos existentes para la asistencia visual sufren de limitaciones críticas:

  • Brecha de Dominio: Conjuntos de datos como WAD dependen de vlogs de viajes curados destinados a audiencias con visión normal, lo que no logra capturar la naturaleza cruda y sin editar de las experiencias reales de las personas con discapacidad visual.
  • Limitaciones de Tarea: Conjuntos de datos como EgoBlind se centran principalmente en el VQA (Preguntas y Respuestas Visuales) pasivo e iniciado por el usuario, descuidando la necesidad de una asistencia proactiva y autónoma.
  • Restricciones Temporales: Muchos benchmarks de video existentes utilizan clips cortos (por ejemplo, 3 segundos), que carecen de la riqueza temporal requerida para el razonamiento de largo alcance y la navegación.
  • Desajuste de Evaluación: Los pipelines de evaluación en línea actuales suelen ser computacionalmente pesados y dependen de anotaciones dispersas, lo que los hace poco adecuados para evaluar tareas de tipo "recordatorio" que requieren un monitoreo continuo y alertas oportunas.

Consecuentmente, existe una falta de un benchmark de video versátil y exhaustivo, recolectado por personas ciegas, que evalúe los MLLMs a través de todo el espectro de necesidades de asistencia, incluyendo la anticipación proactiva y la guía interactiva.

Metodología

1. Construcción del Conjunto de Datos VIABench

Los autores construyeron VIABench, un benchmark de video egocéntrico, a gran escala y alineado temporalmente, diseñado específicamente para la asistencia a la discapacidad visual. La recolección de datos siguió un pipeline de cinco etapas:

  • Abastecimiento: Los videos se recolectaron de dos corrientes: (1) Videos del mundo real de personas con discapacidad visual en plataformas como YouTube, Bilibili y DouYin, y (2) Videos simulados informados grabados por anotadores entrenados para cubrir escenarios específicos de "Interacción Guiada por la Visión" que escasean en los datos públicos.
  • Anotación: El conjunto de datos incluye 761 videos que suman 46.9 horas, con 14,526 anotaciones curadas manualmente. La duración promedio del video es de 222 segundos (máximo 1959s), significativamente más larga que los conjuntos de datos previos.
  • Control de Calidad: Un proceso riguroso que involucró anotación piloto, colaboración con proveedores profesionales y un control de calidad de múltiples etapas aseguró etiquetas finamente detalladas y de alta calidad.

2. Definiciones de Tarea

VIABench define tres tareas principales que reflejan niveles crecientes de complejidad de asistencia:

  • Recordatorio Proactivo: El modelo debe monitorear autónomamente el flujo de video y describir proactivamente eventos críticos de navegación venideros (por ejemplo, obstáculos, escaleras) sin prompts explícitos del usuario. Esto requiere una anticipación precisa y capacidad de respuesta en tiempo real.
  • Preguntas y Respuestas Visuales (VQA): El modelo responde preguntas planteadas por el usuario sobre el entorno basándose en el contexto visual actual y pasado, simulando consultas espontáneas durante la navegación.
  • Interacción Guiada por la Visión: Una tarea de bucle cerrado de múltiples turnos donde el modelo proporciona guía iterativa y consciente del contexto para ayudar al usuario a ajustar su punto de vista o movimientos físicos para lograr un objetivo específico.

3. Marco de Evaluación: Decodificación de Activación de Prompt a Nivel de Token (TPAD)

Para abordar el desafío de evaluar la alerta proactiva en modelos offline (que típicamente requieren prompts explícitos), los autores proponen TPAD, un novedoso marco de evaluación de dos etapas:

  • Mecanismo: TPAD transforma un MLLM preentrenado en un detector proactivo por fotograma sin necesidad de ajuste fino (fine-tuning). Concatena un prompt de elección forzada fijo (por ejemplo, "¿Debería advertirse al usuario? (A) Sí; (B) No") con la secuencia de video completa.
  • Puntuación: Para cada fotograma, el estado oculto de su último token se proyecta a través de la cabeza de modelado de lenguaje para calcular la probabilidad de emitir una alerta.
  • Ventaja: Esto permite una única pasada hacia adelante (forward pass) para generar probabilidades de alerta por fotograma a lo largo de todo el video, permitiendo una evaluación eficiente y consciente del contexto de los modelos offline bajo condiciones de streaming.

Contribuciones Clave

  1. Conjunto de Datos VIABoch: La introducción de un benchmark de video a gran escala y del mundo real para la asistencia a personas ciegas, que presenta videos egocéntricos de larga duración y contenido diverso. Es el primero en unificar las tareas de Recordatorio Proactivo, VQA e Interacción Guiada por la Visión dentro de un solo benchmark.
  2. Marco TPAD: La propuesta de un mecanismo de evaluación ligero de dos etapas que permite la evaluación eficiente de la generación de alertas proactivas en videos largos y continuos, cerrando la brecha entre los MLLMs offline y los requisitos de asistencia en tiempo real.
  3. Evaluación Exhaustiva: Una evaluación sistemática de diversos MLLMs, tanto de código abierto como propietarios y de streaming en línea, en VIABench, proporcionando información sobre sus limitaciones actuales en aplicaciones de asistencia del mundo real.

Resultados Experimentales

Los autores evaluaron una amplia gama de modelos, incluyendo modelos fundacionales de código abierto (por ejemplo, InternVL, Qwen, LLaVA), modelos propietarios (GPT-5, GPT-4o, Gemini) y modelos de streaming en línea.

  • Desempeño General: Los MLLMs actuales exhiben capacidades apenas nacientes en la asistencia visual del mundo real. Incluso el modelo más fuerte, GPT-5, logró un puntaje promedio de solo 28.8 en el benchmark.
  • Disparidades de Tarea: El desempeño en las tareas de Recordatorio Proactivo e Interacción Guiada por la Visión es notablemente inferior al de las tareas de VQA estándar.
    • Recordatorio Proactivo: Los modelos fallan frecuentemente al anticipar eventos críticos de navegación o al generar guía alineada con los intervalos de la verdad fundamental (ground-truth). Tienen dificultades con el requisito dinámico de emitir alertas oportunas mientras permanecen en silencio cuando no hay información relevante presente.
    • Interacción Guiada por la Visión: Los modelos a menudo proporcionan instrucciones genéricas (por ejemplo, "levántalo") en lugar de una guía espacialmente específica, fallando en considerar la perspectiva única y las limitaciones de las personas con discapacidad visual.
  • Modelos de Streaming: Los modelos de streaming en línea existentes se desempeñan extremadamente mal en la tarea de Recordatorio Proactivo. Los autores atribuyen esto a la exposición limitada a instrucciones de guía complejas y del mundo real en sus datos de entrenamiento (a menudo limitados a descripciones densas o narraciones) y a una falta de robustez ante entradas visuales de baja calidad y no controladas.

Significado y Direcciones Futuras

El artículo afirma que VIABench sirve como un banco de pruebas desafiante y realista para impulsar la investigación futura hacia el desarrollo de MLLMs personalizados para la asistencia en el mundo real. Los autores enfatizan que los modelos actuales aún no están listos para el despliegue en escenarios de asistencia para ciegos que sean críticos para la seguridad.

El documento esboza tres vías específicas para el trabajo futuro:

  1. Mejora de la Arquitectura: Desarrollar arquitecturas de modelos capaces de respuestas proactivas confiables, conscientes del contexto y en tiempo real.
  2. Enriquecimiento de Datos: Incorporar conjuntos de datos de video-texto más ricos que abarquen diversos tipos de instrucciones, interacciones complejas y escenarios del mundo real para mejorar el razonamiento proactivo.
  3. Optimización Centrada en la Ceguera: Ajustar finamente los modelos específicamente para la perspectiva e intenciones únicas de los usuarios ciegos, abordando problemas como entradas de baja resolución, inversión de cámara y la necesidad de guía espacialmente específica.

En última instancia, el trabajo busca mejorar la autonomía y la seguridad de las personas con discapacidad visual fomentando el desarrollo de tecnologías de asistencia más capaces y confiables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →