← Últimos artículos
🤖 machine learning

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

Este artículo investiga las leyes de escalado de la predicción de píxeles siguientes autoregresiva para modelos de visión, revelando que las estrategias óptimas divergen entre tareas de clasificación y generación, y pronosticando que el escalado impulsado por la capacidad computacional permitirá el modelado de imágenes píxel a píxel en un plazo de cinco años.

Autores originales: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot a "ver" el mundo. Hay dos formas principales de hacerlo:

  1. El Método del "Resumen Inteligente": Le muestras al robot una imagen, pero primero la comprimes en unas pocas palabras o símbolos clave (como convertir una foto de un gato en la palabra "gato"). Así es como funciona la mayoría de la inteligencia artificial moderna hoy en día.
  2. El Método del "Píxel Crudo": Le muestras al robot la imagen exactamente como es, punto por punto, color por color, pidiéndole que adivine el siguiente punto basándose en los anteriores. Esto es como intentar aprender un idioma memorizando cada letra individual de un libro, una por una, sin ver nunca una palabra completa.

Este artículo plantea una pregunta sencilla pero difícil: ¿Qué tan lejos estamos de hacer que el método del "Píxel Crudo" funcione realmente bien?

Los autores decidieron probar esto entrenando modelos de IA para predecir el siguiente píxel en una imagen, comenzando con imágenes pequeñas y de baja resolución (32x32 píxeles, que parecen miniaturas diminutas y pixeladas). Querían ver si este método simple y "tonto" podía escalar eventualmente hasta volverse tan poderoso como los métodos de "resumen inteligente".

Aquí están los cuatro grandes descubrimientos que hicieron, explicados con analogías cotidianas:

1. La Brecha entre "Píxel y Palabra"

El Hallazgo: Para aprender eficazmente, los píxeles crudos necesitan de 10 a 20 veces más datos que las palabras.
La Analogía: Imagina enseñar a un niño a leer.

  • Palabras (Lenguaje): Si le muestras al niño la palabra "Gato", entiende instantáneamente un animal peludo que maúlla. Es un paquete denso de información.
  • Píxeles (Imágenes): Si le muestras al niño un solo punto rojo, no tiene idea de qué es. ¿Es una nariz? ¿Un semáforo? ¿Una fresa? Es solo un punto.
    Como un solo punto lleva tan poco significado, la IA tiene que observar millones de puntos más para descubrir el patrón. El artículo encontró que para alcanzar el mismo nivel de inteligencia, la IA necesita "leer" una cantidad masivamente mayor de datos de píxeles de la que necesitaría para leer texto.

2. Objetivos Diferentes Requieren Recetas Diferentes

El Hallazgo: La mejor manera de escalar la IA depende enteramente de lo que quieras que haga.
La Analogía: Piensa en entrenar a un atleta.

  • Si quieres que sea un Sprinter (Clasificación de Imágenes): Necesitas un equilibrio entre levantamiento de pesas (músculos/modelo más grandes) y práctica de carrera (datos).
  • Si quieres que sea un Maratonista (Generación de Imágenes): Necesitas enfocarte casi por completo en la práctica de carrera (más datos).
    El artículo encontró que si quieres que la IA reconozca lo que hay en una imagen, puedes simplemente hacer el "cerebro" de la IA más grande. Pero si quieres que la IA cree o complete una imagen (como rellenar la mitad inferior de una foto), necesitas alimentarla con una biblioteca mucho más grande de ejemplos (datos) en lugar de simplemente hacer el cerebro más grande. La "mejor" receta para una tarea es en realidad una mala receta para la otra.

3. La Trampa de la Resolución: Imágenes Más Grandes Necesitan Cerebros Más Grandes

El Hallazgo: A medida que las imágenes aumentan en resolución (más nítidas y detalladas), la IA necesita volverse mucho más grande mucho más rápido que la cantidad de datos que ve.
La Analogía: Imagina intentar aprender un mapa de una ciudad.

  • Baja Resolución (32x32): Es como mirar un mapa de un pueblo pequeño. Puedes aprenderlo todo caminando mucho (más datos).
  • Alta Resolución (64x64 y superior): Es como mirar un mapa de una metrópolis masiva con rascacielos y callejones diminutos. Simplemente caminar más no ayudará si tu cerebro es demasiado pequeño para contener todos los detalles complejos.
    El artículo descubrió que a medida que las imágenes se vuelven más nítidas, la "complejidad" de la tarea explota. Para manejar esto, no puedes simplemente darle a la IA más imágenes; tienes que construir un cerebro de IA mucho, mucho más grande para manejar los detalles intrincados.

4. El Cuello de Botella es la Potencia de Cálculo, No los Libros

El Hallazgo: No estamos esperando más imágenes para que esto funcione; estamos esperando computadoras más rápidas.
La Analogía: Imagina que tienes una biblioteca con todos los libros jamás escritos (los datos visuales de internet). Tienes un estudiante que puede leerlos todos. El problema no es que la biblioteca esté vacía; el problema es que el estudiante está leyendo una página al año.
Los autores predicen que, dado que la potencia informática está creciendo tan rápido (duplicándose cada año o así), podremos entrenar estos modelos de "Píxel Crudo" de manera efectiva dentro de los próximos cinco años. Los datos ya están ahí; solo necesitamos el músculo computacional para procesarlos.

La Conclusión

El artículo concluye que entrenar a la IA para aprender directamente de píxeles crudos no es un callejón sin salida. Funciona, sigue reglas predecibles y puede eventualmente alcanzar altos niveles de rendimiento. Sin embargo, actualmente es muy costoso y lento porque los píxeles son puntos de datos "tontos".

Para que esto funcione en el futuro, no necesitamos inventar nuevas formas de comprimir imágenes; solo necesitamos seguir construyendo computadoras más grandes y alimentándolas con cantidades masivas de datos, específicamente adaptados a si queremos que la IA reconozca cosas o las cree.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →