← Últimos artículos
💬 NLP

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

Este artículo presenta VMMU, un referente vietnamita que comprende 2.500 preguntas multimodales a través de siete tareas diseñadas para evaluar la capacidad de los modelos de visión y lenguaje para realizar un razonamiento visual-textual genuino más allá del inglés, revelando que los modelos actuales tienen dificultades principalmente con la fundamentación multimodal en lugar del OCR a pesar de un fuerte desempeño específico del lenguaje.

Autores originales: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Publicado 2026-01-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico multilingüe muy inteligente. Quieres ver si puede ayudar a un estudiante vietnamita a resolver un problema de tarea difícil que viene en una imagen. La imagen no es solo una foto; es una página de un libro de texto o de un examen de conducir que tiene texto en vietnamita mezclado con diagramas, tablas y señales de tráfico.

El documento presenta un nuevo "test" llamado VMMU para ver qué tan buenos son estos robots en esta tarea específica. Aquí está el desglose de lo que encontraron, utilizando analogías sencillas:

1. El Test: Una pista de obstáculos de "multitarea"

Piensa en VMMU como un gimnasio para la IA, pero en lugar de levantar pesas, los robots tienen que resolver 2.548 acertijos diferentes. Estos acertijos cubren siete áreas: Matemáticas, Física, Química, Biología, Geografía, Exámenes de Conducir y pruebas de CI.

¿La trampa? Las preguntas no están simplemente escritas en una pantalla. Están integradas en imágenes. Para responder, el robot debe:

  • Leer las palabras en vietnamita dentro de la imagen (como leer un letrero).
  • Mirar la parte de la imagen (como un gráfico o un mapa).
  • Conectar ambos para deducir la respuesta.

2. La Gran Sorpresa: Leer no es el problema

Los investigadores se preguntaron primero: "¿Está fallando el robot porque no sabe leer vietnamita?"
Probaron la capacidad de los robots para simplemente transcribir (leer en voz alta) el texto dentro de las imágenes.

  • El Resultado: Los robots fueron en realidad excelentes leyendo el texto en vietnamita. Lo hicieron bien casi el 95% de las veces.
  • La Analogía: Imagina a un estudiante que puede leer cada palabra de una página perfectamente, pero aun así se equivoca en un problema de matemáticas porque no entiende cómo los números se relacionan con la imagen. El problema no son los ojos; es el cerebro.

3. La Verdadera Lucha: Conectar los Puntos

Cuando los robots intentaron resolver los problemas completos (leer + mirar + razonar), sus puntuaciones bajaron significamente.

  • El Resultado: Incluso los robots comerciales más inteligentes solo acertaron aproximadamente el 66% de las respuestas.
  • El Factor "Pensamiento": Los investigadores encontraron una gran diferencia entre los robots "rápidos" y los robots que "piensan".
    • Robots Rápidos: Respondieron rápidamente y acertaron entre un 50 y un 70%.
    • Robots que Piensan: Estos modelos se detienen a "pensar" a través de los pasos. Obtuvieron puntuaciones mucho más altas (73–86%).
  • La Analogía: Es como la diferencia entre un estudiante que suelta la primera respuesta que le viene a la mente frente a uno que se detiene, dibuja un diagrama y recorre la lógica paso a paso. Los que "piensan" lo hicieron mucho mejor.

4. El Problema del "Desorden"

Los investigadores notaron que cuando el texto y la imagen estaban amontonados en una imagen desordenada, los robots se confundían.

  • El Experimento: Sacaron el texto de la imagen y se lo entregaron al robot como una lista limpia, mientras le entregaban la imagen por separado.
  • El Resultado: Los robots mejoraron en la resolución del problema.
  • La Analogía: Es como intentar resolver un rompecabezas mientras alguien te grita instrucciones desde el otro lado de la habitación. Si te entregan las instrucciones en un papel limpio y te dejan concentrarte en las piezas del rompecabezas, lo haces mucho mejor. Los robots tuvieron dificultades para ignorar el "ruido" del texto cuando este estaba mezclado con la imagen.

5. La Traducción no Ayuda

Los investigadores se preguntaron: "¿Tal vez los robots no conocen el vietnamita lo suficientemente bien? ¿Qué pasa si traducimos la pregunta al inglés?"

  • El Resultado: No. Traducir la pregunta al inglés hizo que los robots fueran peores.
  • La Analogía: Imagina un examen de conducir donde las señales están en vietnamita, pero las instrucciones están en inglés. El robot se confunde porque la señal dice "Pare" en vietnamita, pero la instrucción en inglés no coincide con el contexto visual. El robot necesita entender todo el contexto en vietnamita para resolver el acertijo.

6. El Hábito de "Adivinar"

Finalmente, intentaron eliminar la imagen por completo y solo darle al robot la pregunta de texto.

  • El Resultado: Las puntuaciones de los robots bajaron, pero no llegaron a cero. Todavía acertaron aproximadamente un 51% (comparado con un azar del 25%).
  • La Analogía: Resulta que los robots son como estudiantes que se han memorizado los "trucos" del examen. Incluso sin la imagen, pueden adivinar la respuesta correcta basándose únicamente en la redacción de la pregunta, utilizando patrones que han visto antes. No están realmente "viendo" la respuesta; solo son buenos adivinando.

La Conclusión Final

El artículo concluye que los modelos de IA actuales son excelentes leyendo texto en vietnamita en las imágenes, pero todavía tienen dificultades para conectar ese texto con la evidencia visual y razonar a través del problema. Necesitan aprender a "pensar" más profundamente y a manejar la realidad desordenada de los textos e imágenes mezclados, en lugar de simplemente confiar en atajos o en adivinar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →