← Últimos artículos
💬 NLP

Encoded but Not Routed: Explaining the Table-Chart Gap in Scientific Claim Verification

Este artículo investiga la brecha de rendimiento en la verificación de afirmaciones científicas entre la evidencia de tablas y de gráficos, revelando que los LLM multimodales codifican con éxito la información de los gráficos en las capas intermedias pero fallan al dirigirla a la posición de predicción, lo que indica una deficiencia de enrutamiento en lugar de una de codificación.

Autores originales: Sunisth Kumar, Xanh Ho, Tim Schopf, Andre Greiner-Petter, Florian Boudin, Akiko Aizawa

Publicado 2026-06-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sunisth Kumar, Xanh Ho, Tim Schopf, Andre Greiner-Petter, Florian Boudin, Akiko Aizawa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un juez intentando decidir si la afirmación de un científico es verdadera. Tienes dos piezas de evidencia: una hoja de cálculo (una tabla) y un gráfico (un diagrama) que muestran exactamente los mismos números.

Esperarías que un programa informático inteligente (una IA Multimodal) tome la misma decisión independientemente de si está mirando la hoja de cálculo o el gráfico, aunque los datos sean idénticos. Pero aquí está el problema: la IA es excelente leyendo la hoja de cálculo, pero suele confundirse con el gráfico, a pesar de que los datos son los mismos.

Este artículo pregunta: ¿Por qué sucede esto?

¿La IA es "ciega" al gráfico (no puede ver los datos)? ¿O está "distraída" (ve los datos pero olvida usarlos al tomar su decisión final)?

La Investigación: Mirando dentro de la Caja Negra

Los investigadores trataron a la IA como una caja de misterio. En lugar de simplemente pedirle a la IA una respuesta, espiaron dentro de su "cerebro" capa por capa para ver cómo viaja la información. Utilizaron dos herramientas principales:

  1. El "Sondeo Lineal" (La linterna de un detective):
    Imagina que el cerebro de la IA es un pasillo largo con muchas habitaciones (capas). Los investigadores colocaron a un pequeño detective (un sondeo) en cada habitación para preguntar: "¿Ya sabes la respuesta?".

    • El Hallazgo: Cuando la IA miraba un gráfico, el detective encontró la respuesta escondida en las habitaciones intermedias. ¡La información definitivamente estaba allí! Sin embargo, para cuando la información llegaba a la última habitación (donde se escribe la respuesta final), había desaparecido.
    • La Analogía: Es como un chef que pica perfectamente las verduras (codifica los datos) pero luego olvida ponerlas en la sopa antes de servirla. Los ingredientes estaban ahí, pero no llegaron al plato final.
  2. El "Mapa de Atención" (Rastreando la mirada):
    Los investigadores también rastrearon hacia dónde estaba "mirando" la IA cuando tomaba su decisión.

    • El Hallazgo: Descubrieron dos tipos diferentes de "olvido", dependiendo de qué familia de IA probaron:
      • La "Mirada Evitada" (Modelos Qwen): Estos modelos apenas miraban el gráfico. Miraban de reojo el gráfico e inmediatamente dirigían su atención al texto, ignorando la evidencia visual por completo. Es como un estudiante que toma un examen, mira el diagrama pero solo lee la pregunta, perdiéndose la imagen crucial.
      • La "Mirada Distraída" (Modelo InternVL): Este modelo miraba el gráfico. Miraba fijamente los datos. Pero aunque veía los números, no podía conectarlos con la respuesta final. Es como un estudiante que estudia el diagrama intensamente pero luego se confunde al intentar escribir el ensayo, fallando al intentar usar las notas que acaba de tomar.

La Gran Conclusión

El artículo concluye que la IA no es "ciega" a los gráficos. La información se captura y almacena con éxito en el medio del cerebro de la IA. El problema es el enrutamiento.

Piensa en el cerebro de la IA como una oficina con mucho movimiento:

  • Las tablas son como un memorándum que se sella, se archiva y se entrega directamente al escritorio del jefe.
  • Los gráficos son como un memorándum que se sella y se archiva, pero luego se pierde en la sala de correo. El jefe nunca lo ve, aunque la sala de correo lo tiene.

Los investigadores descubrieron que, para los gráficos, la información se codifica pero no logra llegar a la "posición de predicción" donde se toma la decisión final. Es un fallo de cómo se entrega la información, no un fallo de cómo se ve.

Resumen en una frase

La IA puede "ver" el gráfico y almacenar los datos, pero falla al entregar esa información a la parte de su cerebro que toma la decisión final, lo que hace que rinda peor con gráficos que con tablas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →