← Últimos artículos
🤖 AI

GRIT: Teaching MLLMs to Think with Images

El artículo propone GRIT, un método basado en aprendizaje por refuerzo que permite a los Modelos de Lenguaje Grandes Multimodales generar cadenas de razonamiento ancladas visualmente intercalando lenguaje natural con coordenadas explícitas de cuadros delimitadores, logrando una alta eficiencia en datos sin requerir etiquetas de razonamiento o localización anotadas.

Autores originales: Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot muy inteligente a resolver un rompecabezas. Por lo general, cuando le haces una pregunta sobre una imagen, intenta responder solo hablando. Podría decir: "Veo un pájaro", pero en realidad no señala al pájaro. Es como intentar describir una ubicación en una habitación oscura usando solo palabras, esperando que adivines dónde estás mirando.

El artículo "GRIT: Enseñar a los MLLM a pensar con imágenes" introduce una nueva forma de enseñar a estos robots (llamados Modelos de Lenguaje Grandes Multimodales, o MLLM) a pensar de manera diferente. Aquí está el desglose usando analogías simples:

1. El Problema: El Pensador "Ciego"

Los modelos de IA actuales son excelentes hablando, pero cuando miran una imagen, a menudo "piensan" en texto puro. Podrían adivinar la respuesta correcta, pero no pueden mostrarte dónde miraron para encontrarla. Es como un detective que resuelve un crimen adivinando el nombre del culpable sin nunca mostrar la evidencia ni señalar la huella dactilar. Esto hace que su razonamiento sea difícil de confiar y a veces inexacto.

2. La Solución: El Hábito del "Señalador" (GRIT)

Los autores crearon un método llamado GRIT (Razonamiento Fundamentado con Imágenes y Texto). En lugar de solo hablar, enseñan a la IA a señalar mientras piensa.

  • La Analogía: Imagina que la IA es un profesor explicando un mapa a un estudiante. En lugar de solo decir: "El tesoro está allá", el profesor dibuja un cuadro alrededor del lugar en el mapa y dice: "Estoy mirando aquí [dibuja un cuadro], y veo una roca, así que el tesoro debe estar al lado".
  • Cómo funciona: La IA genera una cadena de pensamientos que mezcla oraciones normales con cajas delimitadoras (coordenadas que dibujan un rectángulo alrededor de una parte específica de la imagen). Literalmente señala las partes de la imagen que está usando para resolver el problema.

3. El Secreto: Aprender por Ensayo y Error (GRPO-GR)

Por lo general, para enseñar a una IA a hacer algo tan complejo, necesitas miles de ejemplos donde los humanos hayan escrito cada paso y dibujado cada caja. Eso es como contratar a un equipo de profesores para escribir un libro de texto para el robot.

El artículo afirma un avance: GRIT necesita casi ningún ejemplo.

  • La Analogía: En lugar de leer un libro de texto, la IA aprende como un niño jugando un videojuego. Le das una imagen y una pregunta. Intenta responder. Si obtiene la respuesta final correcta y sigue las reglas (como dibujar un cuadro), obtiene una "puntuación alta" (recompensa). Si falla, obtiene una puntuación baja.
  • La Magia: Los investigadores solo usaron 20 ejemplos (como 20 preguntas de práctica) para entrenar a la IA. La IA descubrió el patrón: "Para obtener una puntuación alta, necesito señalar la imagen mientras hablo". Llamaron a esto GRPO-GR, un método de entrenamiento especial que recompensa a la IA por obtener la respuesta correcta y por usar el formato correcto de "señalamiento".

4. Los Resultados: Más Inteligente y Más Honesto

Cuando probaron estos robots entrenados:

  • Mejoraron en matemáticas y conteo: Si preguntabas: "¿Cuántos huevos hay en el nido?", el robot no solo adivinaba un número. Señalaba los huevos, los contaba uno por uno en sus "pensamientos" y luego daba la respuesta.
  • Unificaron dos habilidades: Antes, la IA era buena hablando (razonamiento) O buena señalando (fundamentación), pero no ambas a la vez. GRIT les enseñó a hacer ambas simultáneamente.
  • Son más confiables: Como la IA tiene que señalar la evidencia, es más difícil que invente mentiras. Si señala un lugar y dice "Veo un gato", pero no hay ningún gato allí, el sistema sabe que algo está mal.

5. Lo que Encontraron (y lo que No)

  • Eficiencia de Datos: Demostraron que no necesitas una biblioteca masiva de datos. Solo 20 ejemplos fueron suficientes para enseñar al robot este nuevo hábito de "señalar".
  • Atención: Cuando la IA señala un lugar (dibuja un cuadro), realmente presta más atención a esa parte de la imagen en su siguiente pensamiento. Es como si el acto de señalar ayudara al robot a enfocar sus ojos.
  • Límites: El artículo señala que, aunque agregar más datos ayuda, hay un punto de rendimientos decrecientes. Para mejorar aún más en cosas que el robot no ha visto antes, necesitan más variedad en los datos, no solo más de lo mismo.

En Resumen:
GRIT es un nuevo método de entrenamiento que enseña a los robots de IA a "pensar con sus ojos" obligándolos a señalar la imagen mientras hablan. Es un gran salto porque enseña esta habilidad compleja con casi ningún dato (solo 20 ejemplos) y hace que el razonamiento de la IA sea transparente y confiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →