← Últimos artículos
🤖 AI

Scalable Visual Pretraining for Language Intelligence

Este artículo desafía el paradigma de preentrenamiento de modelos fundacionales basado únicamente en texto al demostrar que el preentrenamiento visual no supervisado en documentos visuales brutos, el cual preserva información rica como figuras y diseños, supera consistentemente a los enfoques de solo texto y ofrece una vía escalable hacia una inteligencia lingüística mejorada.

Autores originales: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot superinteligente cómo entender el mundo. Durante mucho tiempo, la receta estándar ha sido alimentarlo con montañas de libros, artículos y sitios web, pero con un detalle: antes de que el robot los lea, los humanos (o las computadoras) eliminan todas las imágenes, los símbolos matemáticos ondulados, los gráficos y los diseños de página elegantes, convirtiendo todo en texto plano y aburrido. Es como intentar enseñarle a alguien a hornear un pastel dándole solo una lista de ingredientes escrita en una servilleta, mientras tiras a la basura la foto del pastel terminado, el diagrama del tazón de mezcla y el gráfico colorido que muestra cómo cambia la temperatura del horno.

Un nuevo artículo de perfecto 2026 sugiere que este enfoque de "solo texto" está perdiendo una gran parte del rompecabezas. Los investigadores, liderados por un equipo de Shanghái y Zhejiang, argumentan que al desechar las partes visuales de los documentos, estamos desechando las pistas mismas que el robot necesita para volverse verdaderamente inteligente. Llaman a su nuevo método Preentrenamiento Visual (VP), y es como enseñarle al robot a leer las páginas reales de un libro de texto, con todos sus diagramas y ecuaciones, en lugar de solo la descripción textual de ellos.

El Gran Descubrimiento: Ver es Creer (y Aprender)
El equipo probó esta idea en algunos de los modelos de IA más inteligentes disponibles (como Qwen y Llama). Tomaron exactamente el mismo montón de documentos científicos —piensa en artículos de física, libros de texto de matemáticas e informes técnicos— y los dividieron en dos grupos.

  • Grupo A (La vieja forma): Convirtieron las páginas en texto plano, eliminando todos los elementos visuales.
  • Grupo B (La nueva forma - VP): Alimentaron al modelo directamente con las imágenes originales de las páginas, permitiéndole "ver" las figuras, tablas y diseños sin tener que convertirlos primero en palabras.

El resultado fue que el robot entrenado en las imágenes originales (Grupo B) superó consistentemente al entrenado con texto plano (Grupo A). De hecho, en evaluaciones científicas y matemáticas complicadas, el aprendiz visual obtuvo una puntuación más alta. Por ejemplo, en un difícil examen de matemáticas llamado AIME, el modelo visual mejoró su puntuación significativamente más que el modelo de texto. El artículo sugiere que el proceso "con pérdida" de convertir una página compleja con un diagrama en una cadena de palabras en realidad elimina la información necesaria para resolver problemas difíciles.

El Truco de la Eficiencia: Hacer Más con Menos
Aquí está la parte realmente genial: el método visual no solo fue mejor, sino que también fue mucho más eficiente. El modelo basado en texto tuvo que procesar alrededor de 80 mil millones de tokens de texto para aprender de estos documentos. El modelo visual, sin embargo, solo necesitó unos 20 mil millones de tokens visuales para obtener los mismos (o mejores) resultados. ¡Eso es usar solo el 25% del presupuesto de datos!

Piénsalo de esta manera: Si el modelo de texto intenta describir una ciudad enumerando cada nombre de calle y dirección de edificio, le toma una eternidad. El modelo visual, por el contrario, simplemente mira un mapa. Capta toda la imagen al instante. Los investigadores descubrieron que cuanto más "contenido visual" (como diagramas complejos y ecuaciones) tenía una página, mayor era la ventaja del modelo visual. En páginas llenas de gráficos y fórmulas, la ventaja del modelo visual crecía enormemente, mientras que en páginas de texto plano, eran similares.

Sin Trucos, Solo Visión Pura
Podrías preguntarte: "¿Acaso hicieron trampa mostrándole al robot las imágenes y también las respuestas?". No. No utilizaron ninguna etiqueta especial de "imagen a texto" ni hojas de trucos. Al robot simplemente se le dijo que mirara el siguiente parche de la imagen y adivinara cómo se vería, de forma similar a como adivina la siguiente palabra en una oración.

Sorprendentemente, este entrenamiento de "solo mirar" hizo que el robot fuera mejor en todo, no solo en mirar. También mejoró su comprensión del texto e incluso mejoró su capacidad para conectar imágenes con palabras cuando se le evaluó después. Los investigadores midieron esto verificando qué tan bien el "cerebro" del robot alineaba las imágenes con las palabras, y encontraron que el entrenamiento visual hacía que ambos conceptos encajaran mucho más estrechamente, como si el robot finalmente entendiera que la imagen de un gato y la palabra "gato" son en realidad lo mismo.

Lo Que Esto Significa (Y Lo Que No)
Los autores advierten cuidadosamente que esto no es una varita mágica que reemplaza la lectura de texto. El texto sigue siendo excelente para aprender hechos que ya están escritos claramente. Pero para documentos científicos, donde el diseño, la forma de la ecuación y la posición del diagrama conllevan un significado crucial, el enfoque visual sugiere un camino nuevo y escalable.

Admiten que aún no han resuelto todo. Por ejemplo, no están seguros de si esto funciona igual de bien para fotos aleatorias de la naturaleza o videos, ya que sus pruebas se centraron principalmente en PDFs científicos de alta densidad. Pero para el caso específico de aprender de documentos complejos, el artículo sugiere que dejar que la IA vea el mundo tal como es —visual, desordenado y lleno de diagramas— podría ser la clave para desbloquear su verdadera inteligencia. Es un cambio de "leer la descripción del mapa" a "realmente mirar el mapa".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →