← Últimos artículos
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

Este artículo presenta el primer estudio sistemático de la percepción unificada visión-lenguaje en los Modelos de Lenguaje de Gran Escala Multimodales (MLLM), formalizando la percepción como una capacidad intrínseca, proponiendo una taxonomía de cinco etapas de la evolución de su paradigma y delineando direcciones de investigación futuras hacia la inteligencia artificial general.

Autores originales: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante brillante pero un poco torpe a comprender el mundo. Este estudiante es un Modelo de Lenguaje Gran Multimodal (MLLM). Es excelente leyendo libros (texto) y mirando imágenes (visión), pero durante mucho tiempo le costó conectar ambas cosas. Podía describir una imagen vagamente, pero no podía señalar exactamente dónde estaba sentado un gato o explicar por qué el gato parecía asustado.

Este artículo, titulado "From Structure to Synergy" (De la estructura a la sinergia), es como un libro de historia y una hoja de ruta sobre cómo enseñamos a este estudiante a "ver" y "comprender" de verdad al mismo tiempo. Los autores argumentan que no debemos tratar la visión y el lenguaje como dos materias separadas; en cambio, deben fusionarse en una super-habilidad llamada Percepción.

Esta es la historia de cómo llegamos allí, desglosada en cinco capítulos, utilizando analogías sencillas:

El Problema: El Estudiante "Ciego"

Antes de este estudio, la mayoría de las revisiones analizaban la "visión" y el "lenguaje" por separado. Era como tener un profesor para matemáticas y otro para arte, pero nunca pedirles que trabajaran juntos. Los autores dicen que esto es un error. Para comprender verdaderamente una imagen, necesitas mirarla y hablar de ella simultáneamente. Querían crear un mapa único de cómo estos modelos evolucionaron para hacer exactamente eso.

Las Cinco Etapas de la Evolución

Los autores dividen la historia de estos modelos en cinco etapas, moviéndose desde "arreglar el hardware" hasta "enseñar al cerebro a pensar".

Etapa 1: Arreglar los Ojos (Centrada en el Codificador/Encoder-Centric)

La Analogía: Imagina que los "ojos" del modelo (la parte que mira la imagen) estaban borrosos.
Qué pasó: Los investigadores comenzaron mejorando los ojos mismos. Añadieron lentes especiales (módulos) que podían hacer zoom en partes específicas de una imagen, como una lupa, antes de que el modelo intentara leerla. También intentaron darle al modelo múltiples pares de ojos (diferentes expertos) para mirar la imagen desde diferentes ángulos.
El Resultado: El modelo dejó de ver toda la imagen como un borrón y empezó a notar regiones específicas, como "esa pelota roja de allá".

Etapa 2: Arreglar las Manos (Centrada en el Decodificador/Decoder-Centric)

La Analogía: Ahora los ojos podían ver las regiones, pero las "manos" del modelo (la parte que dibuja o señala) eran torpes. Podía decir "la pelota está ahí", pero no podía dibujar un círculo perfecto alrededor de ella.
Qué pasó: Los investigadores añadieron herramientas especiales al lado de salida del modelo. Construyeron manos "píxel a píxel" que podían dibujar contornos exactos, máscaras o cajas alrededor de los objetos.
El Resultado: El modelo pasó de decir "hay un gato" a ser capaz de dibujar un contorno perfecto alrededor del pelaje del gato, píxel por píxel.

Etapa 3: Aprender a Mirar Dos Veces (Percepción Dinámica)

La Analogía: Imagina que estás mirando una pintura compleja. No solo echas un vistazo una vez; haces zoom, te alejas, miras los detalles y quizás pides una lupa.
Qué pasó: Los modelos antiguos miraban una imagen una vez y daban una respuesta. Los nuevos modelos aprendieron a pensar dinámicamente. Aprendieron a:

  • Llamar a herramientas externas (como un escáner OCR para leer texto en la imagen).
  • Hacer zoom en puntos específicos si estaban confundidos.
  • Escribir pequeños programas de computadora para ayudarles a resolver el rompecabezas.
    El Resultado: El modelo se convirtió en un investigador activo. En lugar de una instantánea estática, podía "caminar alrededor" de la imagen, reuniendo pistas paso a paso.

Etapa 4A: Entrenar Sin Cirugía (Estrategias Libres de Arquitectura/Architecture-Free Strategies)

La Analogía: En lugar de darle al estudiante nuevas gafas o nuevas manos, simplemente cambiamos cómo le enseñábamos.
Qué pasó: Los investigadores dejaron de cambiar la estructura física del modelo. En su lugar, utilizaron el Ajuste de Instrucciones (dar mejores exámenes de práctica) y el Aprendizaje por Refuerzo (como un videojuego donde el modelo gana puntos por respuestas correctas y pierde puntos por errores).
El Resultado: El modelo se volvió más inteligente al encontrar objetos y resolver acertijos simplemente practicando más duro y aprendiendo de sus errores, sin necesidad de una actualización de hardware.

Etapa 4B: La Gran Sinergia (Hacia una Percepción Unificada)

La Analogía: Esta es la fase de "Superhéroe". El estudiante ahora combina todo: tiene grandes ojos, grandes manos, sabe hacer zoom cuando es necesario, puede escribir código y sabe aprender de las recompensas.
Qué pasó: El artículo analiza los modelos más recientes (como el o3 de OpenAI) que mezclan todas estas habilidades. No solo siguen una lista de verificación rígida; planean, eligen sus propias herramientas, hacen zoom cuando es necesario y razonan el problema como un humano.
El Resultado: Nos dirigimos hacia un modelo que no solo "procesa" una imagen, sino que realmente la percibe de una manera unificada y flexible.

Los Obstáculos por Delante

A pesar de los enormes progresos, los autores señalan tres grandes obstáculos:

  1. La Dieta de Datos: Estos modelos necesitan cantidades masivas de datos de alta calidad y cuidadosamente etiquetados para aprender. Es caro y difícil de obtener.
  2. El Problema de la Calificación: Es fácil calificar un examen de matemáticas (correcto o incorrecto), pero es difícil calificar la "percepción". ¿Cómo se da una puntuación precisa de qué tan bien "vio" un modelo una escena compleja? Necesitamos mejores formas de recompensar al modelo.
  3. El Costo de Pensar: Los modelos más inteligentes que "hacen zoom" y "piensan dos veces" requieren mucha potencia de cómputo. Es como ejecutar una supercomputadora solo para mirar una foto, lo cual es demasiado caro para el uso diario en este momento.

La Conclusión

Este artículo es una guía. Nos dice que para construir máquinas verdaderamente inteligentes, no podemos simplemente parchar los ojos o las manos por separado. Necesitamos enseñar a todo el sistema a sinergizar: ver, pensar y actuar como un cerebro unificado y adaptativo. El viaje ha pasado de arreglar el hardware a enseñar al cerebro a pensar, y el siguiente paso es hacer que ese pensamiento sea eficiente y verdaderamente general.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →