← Últimos artículos
💻 computer science

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

Este artículo presenta iVGR, un marco de aprendizaje por refuerzo que internaliza las capacidades de localización visual en el razonamiento textual mediante una estrategia de entrenamiento de doble flujo, permitiendo que los modelos de lenguaje de gran escala multimodales logren una percepción de grano fino superior sin la degradación del rendimiento causada por la localización visual explícita obligatoria durante la inferencia.

Autores originales: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

Publicado 2026-06-01
📖 4 min de lectura☕ Lectura para el café

Autores originales: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: La trampa del "Explicador Excesivo"

Imagina que tienes un detective brillante (la IA) que es muy bueno resolviendo misterios (responder preguntas sobre imágenes). Sin embargo, para demostrar que está mirando la pista correcta, se siente obligado a señalar constantemente la imagen con un puntero láser y decir: "¡Estoy mirando el coche rojo en las coordenadas [100, 200]!" antes de poder darte la respuesta.

Los investigadores descubrieron algo sorprendente: este constante señalar en realidad ralentiza al detective y hace que cometa más errores.

Cuando se obliga a la IA a dibujar cajas o señalar puntos específicos en su proceso de pensamiento (lo que se llama "Visually Grounded CoT"), esta se distrae. Gasta tanta energía mental intentando que las coordenadas sean perfectas que se olvida de resolver realmente el rompecabezas. Si la IA señala el lugar equivocado, toda la respuesta sale mal.

La solución: "Internalizar" la habilidad

El artículo propone un nuevo método llamado iVGR. En lugar de obligar a la IA a señalar en voz alta, le enseñan a la IA a mirar silenciosamente mientras piensa.

Piensa en esto como enseñar a un estudiante a leer un mapa:

  • Forma antigua: El estudiante debe dibujar una línea en el mapa con un marcador cada vez que piensa en una ubicación. Si la línea es torcida, el profesor lo marca como error, incluso si el estudiante sabía la respuesta correcta.
  • Forma iVGR: Se le permite al estudiante mirar el mapa en su mente. No tiene que dibujar la línea. Pero, aun así, se le evalúa para saber si realmente miró el lugar correcto.

Cómo funciona: El "Gimnasio de Entrenamiento de Doble Vía"

Para enseñar a la IA esta habilidad silenciosa, los investigadores construyeron un gimnasio de entrenamiento especial con dos pistas (vías) paralelas que corren una al lado de la otra:

  1. La vía de "Señalar" (Vía con fundamentación visual): Aquí, la IA se ve obligada a dibujar cajas y señalar objetos, tal como en el método antiguo. Recibe una recompensa si las cajas son precisas y la respuesta es correcta.
  2. La vía "Silenciosa" (Vía textual): Aquí, a la IA no se le permite dibujar cajas. Solo tiene que pensar y responder con palabras.

El truco de magia (La Recompensa de Consistencia):
Esta es la innovación central. El sistema actúa como un entrenador estricto.

  • Toma la mejor respuesta de "Señalar" (la más precisa) de la primera vía.
  • Compara esa respuesta con la respuesta "Silenciosa" de la segunda vía.
  • Si la IA Silenciosa está pensando en los mismos detalles visuales que la IA de Señalar (incluso sin dibujar la caja), recibe una enorme recompensa.
  • Si la IA Silenciosa está alucinando o mirando lo que no es, recibe una penalización.

Con el tiempo, la IA "Silenciosa" aprende a internalizar la capacidad de enfocarse en las partes correctas de la imagen. Aprende a "ver" el objeto claramente en su mente sin necesidad de gritar las coordenadas.

El resultado: Un detective más inteligente y rápido

El artículo probó esto en varios acertijos visuales difíciles (como encontrar detalles diminutos en fotos de alta resolución o contar objetos).

  • Mejor precisión: La IA entrenada con iVGR obtuvo puntuaciones significativamente mejores que los modelos de IA que fueron obligados a dibujar cajas o que simplemente adivinaban sin ningún enfoque visual.
  • Flexibilidad: Aunque la IA aprendió a pensar de forma silenciosa, no perdió la capacidad de señalar si realmente se le necesita. Los investigadores demostraron que si le das a la IA una "herramienta" para recortar la imagen en el momento de la prueba, puede usar su conocimiento interno para elegir el lugar perfecto para el recorte, potenciando aún más su rendimiento.

Analogía de resumen

Imagina a un chef que necesita picar verduras.

  • La forma antigua: El chef debe sostener un puntero láser y decir: "Estoy cortando la zanahoria en la posición X" antes de cada corte. Si el láser se tambalea, la cocina se confunde y el plato se arruina.
  • La forma iVGR: El chef practica picar mientras sostiene el láser (para aprender la habilidad), pero luego guarda el láser. Aprenden a sentir exactamente dónde está la zanahoria con sus manos (visión internalizada). Pican más rápido, con más precisión, y la comida sabe mejor, todo sin la distracción del puntero láser.

En resumen: iVGR enseña a la IA a "ver" profundamente sin necesidad de "señalar" constantemente, lo que resulta en respuestas más inteligentes y fiables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →