← Últimos artículos
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

Este artículo presenta Reinforce Adjoint Matching (RAM), un método escalable de entrenamiento posterior por aprendizaje por refuerzo para modelos de difusión y ajuste de flujo que logra una alineación superior con las recompensas al derivar una función de pérdida de consistencia simple que corrige los objetivos del preentrenamiento sin requerir simulaciones costosas de EDE, recorridos adjuntos hacia atrás o gradientes de recompensa.

Autores originales: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un artista maestro que ha pasado años aprendiendo a pintar copiando miles de fotos. Este artista es increíblemente bueno recreando lo que ve, pero no necesariamente sabe cómo seguir instrucciones específicas y complicadas como "pinta una cebra roja junto a un camión azul" o "escribe la palabra 'HOLA' claramente en un escudo".

Para enseñarle al artista estas nuevas habilidades, normalmente usamos un método llamado Aprendizaje por Refuerzo (RL). Piensa en esto como un crítico de arte estricto que mira la pintura, le da una puntuación y le dice al artista: "Hazlo mejor la próxima vez".

La Vieja Forma: El Crítico Costoso y Lento

Anteriormente, entrenar a estos artistas de IA con un crítico era como intentar enseñar a alguien a nadar tirándolo al océano y observándolo forcejear.

  • El Proceso: La IA generaba una imagen completa (el "nadar"), el crítico la puntuaba y luego el sistema intentaba averiguar exactamente qué pincelada causó la puntuación buena o mala.
  • El Problema: Para hacer esto, la IA tenía que simular todo el proceso de pintura de principio a fin, una y otra vez, solo para obtener un solo fragmento de retroalimentación. Era lento, computacionalmente costoso y a menudo inestable (como intentar calcular la velocidad del viento mientras el barco se hunde).

La Nueva Forma: RAM (Reinforce Adjoint Matching)

Los autores de este artículo, Andreas Bergmeister y su equipo, se dieron cuenta de que había una forma mucho más inteligente de hacer esto. Encontraron un "atajo" que mantiene el entrenamiento rápido y simple, como la fase de pre-entrenamiento original.

Así es como funciona RAM, usando una analogía sencilla:

1. El Truco del "Punto Final Limpio"
Imagina que el proceso de pintar es como una película proyectada en reversa. La película comienza con un lienzo en blanco (ruido) y termina con una pintura terminada.

  • Método Antiguo: La IA tenía que ver toda la película, puntuar el final y luego rebobinar la película fotograma a fotograma para ver dónde se equivocó.
  • Método RAM: Los autores se dieron cuenta de que si conoces la pintura final (el "punto final limpio"), no necesitas ver toda la película para entender el proceso. Solo puedes tomar esa pintura terminada y, matemáticamente, "añadir ruido" a ella instantáneamente para crear una versión desordenada, tal como lo hacía el entrenamiento original.

2. La Retroalimentación "Una y Hecha"
En lugar de simular todo el proceso de pintura para obtener retroalimentación, RAM hace lo siguiente:

  1. Generar: La IA pinta una imagen terminada (el punto final).
  2. Puntuar: El crítico le da una puntuación (por ejemplo: "¡Gran trabajo con el texto!").
  3. Rebobinar Instantáneamente: En lugar de simular el rebobinado, las matemáticas crean instantáneamente una versión "ruidosa" de esa imagen.
  4. Aprender: La IA aprende a transformar esa versión ruidosa específica de nuevo en la imagen de alta puntuación.

La Intuición Mágica:
El artículo demuestra que las reglas sobre cómo "añadir ruido" a una imagen no cambian, incluso cuando intentas hacer que la imagen sea mejor. Lo único que cambia es qué imágenes decide pintar la IA en primer lugar. Como las "reglas del ruido" permanecen iguales, la IA puede usar la misma matemática simple que utilizó durante su entrenamiento original, solo con un nuevo objetivo.

Por Qué Esto Es Importante

  • Velocidad: El artículo afirma que RAM es 34 a 50 veces más rápido que los métodos anteriores. Alcanza el mismo nivel de habilidad en una fracción del tiempo.
  • Simplicidad: No requiere cálculos complejos e inestables (como "despliegues SDE" o "barridos adjuntos inversos"). Es simplemente una tarea de regresión sencilla, similar al entrenamiento original.
  • Calidad: Cuando lo probaron en Stable Diffusion 3.5M, la IA mejoró mucho en:
    • Componibilidad: Colocar objetos en los lugares correctos (por ejemplo, un camión a la izquierda de un refrigerador).
    • Renderizado de Texto: Escribir palabras claramente en las imágenes.
    • Preferencia Humana: Crear imágenes que a los humanos realmente les gusta mirar.

La Conclusión

Piensa en RAM como darle al artista un "borrador mágico" y una "tarjeta de puntuación mágica". En lugar de obligar al artista a repintar todo el lienzo para ver qué salió mal, el borrador mágico le muestra instantáneamente una versión desordenada de su mejor trabajo, y la tarjeta de puntuación le dice exactamente cómo arreglar ese desorden específico. Esto permite que la IA aprenda nuevas habilidades complejas sin el alto costo computacional de los métodos anteriores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →