← Últimos artículos
💬 NLP

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

El estudio ViTaB-A revela que, aunque los modelos de lenguaje grandes multimodales pueden responder preguntas sobre datos tabulares estructurados, carecen de fiabilidad para atribuir sus respuestas a filas y columnas específicas, lo que limita su uso en aplicaciones que requieren transparencia y trazabilidad.

Autores originales: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

Publicado 2026-02-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que has creado un super-robot lector (llamado mLLM) que es increíblemente bueno mirando tablas de datos, ya sea en un archivo de texto, en un JSON o incluso en una foto de una hoja de cálculo. Este robot puede responder preguntas como: "¿Cuál fue la ganancia de la empresa X en 2023?" y suele acertar.

Pero aquí viene el problema, y es de lo que trata este estudio: El robot sabe la respuesta, pero no sabe dónde la encontró.

Aquí tienes la explicación de la investigación ViTaB-A usando analogías sencillas:

1. El Robot "Sabio" pero "Despistado"

Imagina que le preguntas a un estudiante muy inteligente: "¿Quién ganó el partido de fútbol ayer?".

  • El Robot responde: "Ganó el equipo Azul". (¡Correcto!).
  • Pero tú le pides: "¿En qué parte del periódico leíste eso? ¿En qué columna y qué fila?".
  • El Robot se equivoca: Señala una foto de un perro o una columna de precios de acciones.

El estudio descubrió que estos modelos de IA son como ese estudiante: saben la respuesta, pero son terribles señalando la evidencia. Pueden adivinar la respuesta correcta basándose en patrones generales, pero cuando se les exige decir exactamente qué casilla de la tabla les dio esa información, fallan estrepitosamente.

2. La Prueba: "ViTaB-A" (El Examen de Orientación)

Los investigadores crearon un examen llamado ViTaB-A para poner a prueba a varios robots (como InternVL, Qwen, Gemma, etc.). Les dieron tablas de datos en tres formatos diferentes:

  • Texto (Markdown/JSON): Como leer un documento de Word.
  • Imágenes: Como mirar una foto de una tabla impresa.

El resultado sorprendente:

  • En Texto: Los robots acertaban las respuestas, pero al pedirles la fuente, se perdían completamente. Era como si intentaran encontrar una aguja en un pajar de texto plano.
  • En Imágenes: ¡Funcionaban mucho mejor! Cuando la tabla era una imagen, los robots podían "ver" las líneas y los cuadros. Era como si les dieras un mapa visual en lugar de solo instrucciones escritas.
    • Analogía: Es la diferencia entre intentar encontrar una dirección leyendo una lista de coordenadas (JSON) versus ver un mapa con calles dibujadas (Imagen). Los robots prefieren ver el mapa.

3. El Problema de las Filas vs. Columnas

El estudio también notó algo curioso:

  • Los robots son buenos señalando las FILAS (las historias completas, como "Juan Pérez compró una casa").
  • Son terribles señalando las COLUMNAS (los atributos, como "Precio" o "Fecha").

Analogía: Es como si pudieran decirte "Aquí está la historia de Juan", pero si le preguntas "¿Dónde dice que Juan compró la casa?", se confunden. Les cuesta entender la estructura vertical de los datos.

4. La Trampa de la "Confianza"

Este es el punto más peligroso. Cuando los robots se equivocan al señalar la evidencia, siguen diciendo que están 100% seguros.

  • Si le preguntas: "¿Estás seguro de que esa es la casilla correcta?", el robot dirá: "¡Sí, totalmente seguro!".
  • Pero en realidad, acaba de adivinar.

Es como un adivino que, aunque acierte por suerte, te jura que tiene poderes mágicos. El estudio muestra que la confianza del robot no es un buen indicador de si realmente encontró la prueba. No puedes confiar en que te diga la verdad solo porque suena muy seguro.

5. ¿Por qué nos importa esto?

Imagina que usas este robot en un banco, un hospital o un tribunal.

  • Si el robot dice: "El paciente necesita esta medicina", está bien.
  • Pero si no puede señalar exactamente en qué parte del historial médico lo vio, es un desastre. No puedes auditar su trabajo.

En resumen:
Hoy en día, estos robots son excelentes para dar respuestas rápidas, pero son poco fiables para decirte de dónde sacaron esa información, especialmente si los datos están en texto o JSON. Para usarlos en cosas serias (como leyes o medicina), necesitamos que aprendan a ser "honestos" y a señalar sus fuentes, no solo a adivinar respuestas.

La lección final: No confíes ciegamente en la respuesta de la IA; siempre pídele que te muestre el "papelito" donde lo escribió, porque a veces, aunque la respuesta sea correcta, el "papelito" que te muestra es mentira.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →