← Últimos artículos
🤖 machine learning

Paris: A Decentralized Trained Open-Weight Diffusion Model

El artículo presenta Paris, el primer modelo de difusión de pesos abiertos lanzado públicamente que fue entrenado íntegramente mediante un marco descentralizado que utiliza modelos expertos aislados y un enrutador dinámico para lograr una generación de texto a imagen de alta calidad sin gradientes sincronizados, reduciendo significativamente los requisitos de datos de entrenamiento y cómputo en comparación con los puntos de referencia anteriores.

Autores originales: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

Publicado 2026-08-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde la creación de arte no se trata solo de un genio solitario sentado en un estudio, sino de un equipo masivo y global de artistas trabajando juntos sin necesidad de hablarse entre sí. Este es el corazón de un campo llamado "modelado de difusión", un tipo de inteligencia artificial que aprende a crear imágenes comenzando con una nube caótica de ruido estático y refinándola lentamente, paso a paso, hasta convertirla en una imagen clara, de forma muy similar a un escultor que desprende trozos de piedra para revelar una estatua. Durante años, el mayor obstáculo en este campo ha sido la necesidad de un "centro de mando central". Para entrenar a estos poderosos artistas de IA, los investigadores normalmente tenían que reunir miles de computadoras superrápidas en un solo lugar, conectadas por cables costosos de alta velocidad, todas trabajando en perfecta sincronía. Si una computadora se retrasaba, todo el equipo tenía que esperar. Esto significaba que solo las instituciones más ricas y mejor financiadas podían construir los mejores generadores de imágenes, dejando al resto fuera del juego.

Presentamos "Paris", un nuevo proyecto de Bagel Labs que plantea una pregunta audaz: ¿Qué pasaría si no necesitáramos ese centro de mando central en absoluto? ¿Qué pasaría si pudiéramos entrenar a un artista de IA de clase mundial dejando que muchos equipos más pequeños trabajen en total aislamiento, en sus propias computadoras, en diferentes países, y solo unieran su trabajo al final? El artículo presenta a Paris como el primer generador de imágenes publicado íntegramente de esta manera, demostando que no necesitas un clúster de supercomputadoras para crear imágenes hermosas. En su lugar, utiliza un truco ingenioso donde la IA se divide en un equipo de especialistas, cada uno aprendiendo un estilo diferente, y un "controlador de tráfico" inteligente que decide a qué especialista escuchar cuando pides una imagen.

La Gran Idea: Un Equipo de Genios Solitarios

Normalmente, entrenar una IA masiva es como intentar que un coro de 1,000 cantantes armonice perfectamente. Todos tienen que estar en la misma habitación, escuchar a un director y ajustar sus voces instantáneamente si alguien está desafinado. Esto es lo que sucede con el entrenamiento tradicional de IA: miles de tarjetas gráficas (GPUs) constantemente gritan su progreso entre sí, esperando a que todos se pongan al día antes de pasar al siguiente paso. Es costoso, requiere internet especial de alta velocidad y es imposible de hacer con una mezcla de computadoras viejas y nuevas.

Paris cambia las reglas del juego. En lugar de un solo coro gigante, imagina un grupo de ocho solistas, cada uno encerrado en su propia habitación insonorizada. Nunca hablan entre sí, nunca comparten su partitura y nunca esperan a que los demás terminen.

  • Los Solistas (Los Expertos): El modelo Paris está compuesto por ocho "expertos" de IA más pequeños. Cada uno es entrenado en una parte distinta de la biblioteca de imágenes de internet. Uno puede aprender solo sobre atardeceres, otro sobre perros y otro sobre arquitectura. Se entrenan en completo aislamiento, en el hardware que tengan disponible, incluso si uno está en un servidor rápido en EE. UU. y otro en una máquina más lenta en Europa.
  • El Controlador de Tráfico (El Router): Dado que estos expertos nunca hablan durante el entrenamiento, ¿cómo sabemos cuál usar cuando escribes "un golden retriever corriendo por un prado"? Ahí es donde entra el "router". Es una IA pequeña y ligera que actúa como un inteligente policía de tráfico. Cuando le das una instrucción, observa el punto de partida desordenado y ruidoso de la imagen y decide rápidamente: "¡Oye, el Experto 3 es el mejor con los perros, usémoslo!" o tal vez, "En realidad, esta escena necesita una mezcla del Experto 3 y el Experto 5".

Cómo Funciona: La Magia de "No Hablar"

La genialidad de Paris reside en cómo maneja los datos de entrenamiento. Los investigadores tomaron un enorme conjunto de datos de 11 millones de imágenes y utilizaron una herramienta inteligente (llamada DINOv2) para clasificarlas en ocho montones distintos basados en su apariencia. Luego, enviaron cada montón a un experto diferente.

  • Sin Sincronización: En el entrenamiento normal de IA, las computadoras tienen que detenerse y sincronizar sus "gradientes" (que son como notas sobre cómo mejorar) constantemente. Los expertos de Paris no hacen esto. Simplemente entrenan, entrenan y entrenan, a su propio ritmo y tiempo. Uno puede terminar 100,000 pasos mientras otro apenas va por los 90,000. No importa.
  • El Trabajo del Router: El router se entrena por separado. Aprende a mirar una imagen ruidosa y borrosa y adivinar qué experto es el más adecuado para ese patrón de ruido específico. Es como un bibliotecario que sabe exactamente de qué estante sacar un libro basándose en el tenue olor del libro que tienes en la mano.

Lo Que Encontraron: Menos Datos, Menos Potencia, Misma Calidad

El equipo probó Paris contra la forma antigua de hacer las cosas y contra un intento descentralizado previo. Los resultados fueron sorprendentemente eficientes:

  • Ahorro de Recursos: Paris logró entrenar un modelo de alta calidad utilizando 14 veces menos datos de entrenamiento (11 millones de imágenes en lugar de 154 millones) y 16 veces menos días de GPU (la cantidad de tiempo de computación necesario) en comparación con el mejor método descentralizado anterior.
  • La Sorpresa del "Top-2": Cuando probaron cómo combinar los expertos, descubrieron algo interesante. Usar solo al experto "mejor" (Top-1) era bueno, pero usar los dos mejores expertos (Top-2) y mezclar sus resultados producía las mejores imágenes.
  • El Error del "Equipo Completo": Curiosamente, intentar usar los ocho expertos a la vez (el Conjunto Completo o Full Ensemble) empeoraba las imágenes. Resulta que tener demasiadas voces tratando de cantar al mismo tiempo crea ruido. El artículo sugiere que ser selectivo es la clave; no quieres a todo el coro, solo quieres a los solistas adecuados.

Por Qué Esto Importa

El artículo concluye que no necesitas un centro de datos de mil millones de dólares para construir un generador de imágenes de clase mundial. Al permitir que las computadoras trabajen de forma independiente y solo coordinarlas al final, Paris demuestra que se puede construir una IA de alta calidad en "hardware heterogéneo", lo que significa una mezcla de computadoras diferentes, más baratas y geográficamente dispersas. Esto abre la puerta para que investigadores y empresas más pequeñas entrenen modelos poderosos sin necesidad de la infraestructura masiva y sincronizada que ha sido el guardián del campo hasta ahora.

En resumen, Paris muestra que puedes construir una obra maestra no forzando a todos a marchar al mismo paso, sino dejando que cada uno encuentre su propio ritmo y luego teniendo a un director inteligente que los reúna justo a tiempo para la reverencia final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →