MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
Este artículo presenta MME-VideoOCR, un benchmark exhaustivo que cuenta con 25 tareas en 44 escenarios de video para evaluar las capacidades de Reconocimiento Óptico de Caracteres en Modelos de Lenguaje Multimodales Grandes, revelando que los modelos actuales de vanguardia tienen dificultades con la comprensión holística de video, el razonamiento espacio-temporal y la integración entre fotogramas, a pesar de alcanzar solo un 73,7% de precisión incluso con los sistemas de alto rendimiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el silencioso zumbido de una computadora moderna, un nuevo tipo de inteligencia está aprendiendo a ver. Estos sistemas, conocidos como modelos de lenguaje de gran escala multimodales, están diseñados para procesar no solo palabras, sino también imágenes y videos, fusionándolos en un único flujo de comprensión. Se han vuelto notablemente hábiles al leer texto de imágenes estáticas, convirtiendo la fotografía de un letrero de calle o un documento en palabras digitales con alta precisión. Esta capacidad ha abierto puertas para que las máquinas naveguen por el mundo, lean instrucciones y organicen información. Sin embargo, el mundo real rara vez está quieto. Se mueve, cambia y se desplaza. Cuando se les pide a estos mismos sistemas inteligentes que lean texto de un video en movimiento, la tarea se vuelve mucho más difícil. El texto puede desenfocarse mientras un automóvil pasa a toda velocidad, aparecer solo por una fracción de segundo o estar disperso a través de diferentes momentos en el tiempo. Comprender el texto en movimiento requiere más que solo ver; exige recordar, conectar y razonar a través de una secuencia de eventos.
Un equipo de investigadores ha analizado de cerca qué tan bien estos sistemas avanzados manejan el texto en el mundo dinámico del video. Construyeron un nuevo campo de pruebas llamado MME-VideoOCR, una colección exhaustiva de clips de video diseñada para desafiar a las máquinas en las formas específicas en que los ojos y las mentes humanas luchan con el texto en movimiento. Este referente no simplemente le pide a una computadora que lea una palabra; le pide a la computadora que encuentre un número específico en un auto de carreras, rastree una matrícula a medida que un vehículo cambia de carril, o reconstruya una oración que está fragmentada y dispersa a través de varios segundos de metraje. Los investigadores reunieron 1,464 videos, que van desde clips cortos hasta secuencias más largas, cubriendo cuarenta y cuatro escenarios diferentes del mundo real como conducir, cocinar, ver noticias y asistir a conferencias. Para cada video, crearon dos mil preguntas y respuestas cuidadosamente elaboradas, todas verificadas por expertos humanos para asegurar la exactitud y la imparcialidad.
Cuando pusieron a prueba dieciocho de los modelos de lectura de video más avanzados, los resultados revelaron una brecha significativa entre las capacidades actuales y las exigencias del mundo real. Incluso el sistema con mejor desempeño, un poderoso modelo conocido como Gemini-2.5 Pro, logró responder correctamente solo el 73.7 por ciento de las veces. Aunque esto podría parecer una puntuación alta, los investigadores encontraron que los modelos fallaron drásticamente en tareas que requerían que observaran el video completo y conectaran la información a través del tiempo. Por ejemplo, al pedirles que reconocieran una letra formada por la trayectoria de un objeto en movimiento, o que reconstruyeran una palabra a partir de letras que aparecieron en orden aleatorio a través de diferentes fotogramas, los mejores modelos obtuvieron una puntuación cercana a cero. Podían leer un letrero claramente visible en un solo fotograma, pero a menudo perdían el hilo cuando la información estaba distribuida.
El estudio también descubrió un hábito peculiar en la forma en que estas máquinas piensan. Cuando se enfrentaban a texto borroso o mal escrito, los modelos frecuentemente ignoraban lo que realmente estaba en la pantalla y, en su lugar, adivinaban lo que el texto debería decir basándose en patrones de lenguaje comunes. Si un letrero en un video decía claramente "OFF COURS" con una letra faltante, el modelo a menudo lo reportaba con confianza como "OFF COURSE", priorizando su conocimiento interno de cómo se escriben usualmente las palabras sobre la evidencia visual. Esta tendencia a confiar en lo que esperan ver, en lugar de lo que realmente está ahí, sugiere que estos sistemas todavía están fuertemente influenciados por su entrenamiento en lenguaje escrito, a veces a expensas de la precisión visual.
Además, los investigadores descubrieron que la calidad de la entrada de video importa inmensamente. Cuando alimentaron a los modelos con imágenes de menor resolución o con menos fotogramas del video, el desempeño cayó drásticamente. Las máquinas necesitaban claridad de alta definición y un número suficiente de momentos en el tiempo para armar la historia. Este hallazgo resalta que simplemente hacer un modelo más grande o más inteligente no es suficiente; la forma en que ven el mundo debe ser nítida y continua. El estudio concluye que, si bien estas inteligencias artificiales han dado grandes pasos en la lectura de imágenes estáticas, aún carecen de la capacidad de comprender plenamente la naturaleza fluida, fragmentada y a menudo desordenada del texto en movimiento. El camino a seguir requiere no solo mejores algoritmos, sino una integración más profunda de la memoria visual y una resistencia al impulso de adivinar basándose en el hábito.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.