← Últimos artículos
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

Este artículo introduce Reward-based Velocity Matching (RVM), un marco de trabajo sin trayectorias, simple y computacionalmente eficiente, que optimiza directamente el campo de velocidad de los modelos de difusión para el ajuste fino basado en recompensas, superando a los métodos existentes de gradiente de política basados en verosimilitud y ofreciendo una perspectiva unificada sobre enfoques recientes y permitiendo la mejora de recompensas dinámicas para la generación de video.

Autores originales: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Publicado 2026-08-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, ha surgido una clase específica de programas informáticos capaces de crear imágenes deslumbrantes y vídeos realistas a partir de simples descripciones de texto. Estos sistemas, conocidos como modelos de difusión, funcionan aprendiendo a revertir un proceso de corrupción gradual. Imagine tomar una fotografía clara y añadir lentamente ruido estático hasta que se vuelva irreconocible; estos modelos aprenden el camino matemático para ir hacia atrás, comenzando desde el ruido puro y eliminándolo cuidadosamente paso a paso para revelar una imagen coherente. Si bien estas herramientas se han vuelto increíblemente poderosas, enseñarles a seguir las preferencias humanas —como hacer que un vídeo se mueva de forma más natural o que una imagen luzca más bella— ha resultado difícil. Tradicionalmente, los investigadores han intentado adaptar métodos utilizados para los modelos de lenguaje, que dependen del cálculo de la probabilidad de cada posible siguiente paso en una secuencia. Sin embargo, debido a que la generación de imágenes y vídeos implica millones de píxeles cambiando simultáneamente, calcular estas probabilidades es computacionalmente costoso y, a menudo, imposible de realizar con una exactitud perfecta.

Un equipo de investigadores de Georgia Tech y NVIDIA ha encontrado una forma más simple y directa de enseñar a estos modelos lo que los humanos prefieren. En lugar de intentar calcular probabilidades complejas para cada pequeño paso del proceso de generación, propusieron un método que se centra directamente en la "velocidad" de la imagen mientras se forma. En el lenguaje de estos modelos, el sistema predice cómo debería cambiar la imagen de un momento a otro para alcanzar el resultado final. Los investigadores descubrieron que simplemente podían dirigir esta predicción hacia direcciones que conducen a resultados de alta calidad y alejarla de direcciones que conducen a resultados pobres, utilizando una señal de recompensa como guía. Este enfoque, que llaman correspondencia de velocidad basada en recompensas (reward-based velocity matching), evita la necesidad de los complicados cálculos de probabilidad que han ralentizado intentos anteriores.

Los investigadores probaron esta idea en modelos de generación de vídeo a gran escala, los cuales son particularmente costosos de entrenar porque la creación de un solo vídeo requiere una potencia de cómputo significativa. Compararon su nuevo método con técnicas existentes que dependen del seguimiento de toda la trayectoria de la creación del vídeo. Los resultados fueron impactantes: su método más simple produjo vídeos que no solo eran de mejor calidad, sino que también requirieron una fracción del tiempo de computación. En una prueba específica utilizando un modelo llamado Wan2.1, su enfoque logró las puntuaciones de calidad general más altas utilizando solo aproximadamente un doceavo del tiempo de entrenamiento requerido por los mejores métodos anteriores. Esto sugiere que la complejidad de los métodos antiguos era innecesaria; la clave de la mejora no residía en refinar la maquinaria matemática de la probabilidad, sino en cómo se diseñaban y aplicaban las señales de recompensa.

Una parte crítica de su descubrimiento consistió en comprender qué estaban optimizando realmente los modelos. Los investigadores descubrieron que las recompensas estándar, que a menudo se centran en la claridad visual o en qué tan bien coincide el vídeo con una descripción de texto, podrían fomentar inadvertidamente que el modelo produzca imágenes estáticas e inmóviles que se ven limpias pero que son aburridas. Para solucionar esto, introdujeron un nuevo tipo de recompensa que rastrea específicamente el movimiento, asegurando que el vídeo contenga un movimiento significativo. Cuando añadieron esta recompensa centrada en el movimiento a su sistema, los vídeos se volvieron significamente más dinámicos sin perder su calidad visual. Este hallazgo destaca que, para estos modelos potentes, el factor más importante no es la complejidad del algoritmo de entrenamiento, sino la claridad y especificidad de los objetivos establecidos para la máquina.

El estudio también reveló que la fórmula matemática específica utilizada para actualizar el modelo importa menos de lo que se pensaba anteriormente. Los investigadores demostraron que su nuevo método es matemáticamente equivalente a varios otros enfoques recientes, lo que significa que las diferencias de rendimiento entre esos métodos se debían probablemente a cómo configuraban sus recompensas y no al algoritmo central en sí. Al despojar al método de las capas innecesarias de estimación de probabilidad, demostraron que una actualización directa basada en la velocidad es suficiente para guiar al modelo hacia mejores resultados. Esta simplificación abre la puerta a un entrenamiento más eficiente, permitiendo a los investigadores iterar más rápido y potencialmente escalar estas tecnologías hacia tareas aún más complejas sin verse limitados por los costes computacionales.

En última instancia, este trabajo sugiere un cambio en la forma en que pensamos sobre el entrenamiento de la IA generativa. En lugar de tratar el problema como un complejo rompecabezas de estimación de probabilidad, los investigadores demostraron que es mejor verlo como una alineación directa de la dirección interna del modelo con las preferencias humanas. El éxito de su método, que logró resultados superiores con recursos drásticamente reducidos, indica que el futuro del entrenamiento eficiente de la IA puede residir en bucles de retroalimentación más simples y directos. A medida que estos modelos continúen creciendo en tamaño y capacidad, la habilidad para ajustarlos de manera rápida y efectiva será esencial, y este nuevo enfoque ofrece un camino claro y práctico para hacer que la inteligencia artificial sea más sensible a las necesidades humanas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →