← Últimos artículos
💻 computer science

Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts

Este artículo presenta HB-SJD, un backend de Decodificación Jacobi Especulativa por lotes que acelera la destilación visual on-policy al permitir el procesamiento paralelo de múltiples tokens y modos de ejecución adaptativos, reduciendo significativamente el tiempo de entrenamiento mientras mantiene la calidad de la generación sin alterar el marco de destilación.

Autores originales: Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang

Publicado 2026-08-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe un constante tira y afloja entre crear modelos que sean lo suficientemente inteligentes como para producir imágenes deslumbrantes y mantenerlos lo suficientemente pequeños como para que funcionen rápidamente. Los sistemas grandes, a menudo llamados maestros, pueden generar imágenes increíblemente detalladas prediciendo una diminuta pieza de la imagen a la vez, construyendo la imagen completa a partir de un único punto de partida. Sin embargo, este proceso paso a paso es lento y costoso. Para hacer que estos sistemas sean más rápidos, los investigadores utilizan una técnica llamada destilación de conocimiento, donde un modelo estudiante, más pequeño y simple, aprende a imitar al maestro. Una versión más nueva y efectiva de este proceso, conocida como destilación on-policy, le pide al estudiante que practique generando sus propios ejemplos de entrenamiento en tiempo real. Esto asegura que el estudiante aprenda exactamente cómo se comportará cuando esté creando arte realmente, en lugar de simplemente memorizar ejemplos antiguos. El problema es que esta sesión de práctica es dolorosamente lenta; el estudiante aún debe construir sus imágenes una diminuta pieza a la vez, lo que crea un cuello de botella que ralentiza todo el proceso de aprendizaje.

Un equipo de investigadores de Shenzhen ha encontrado una manera de romper este cuello de botella sin cambiar las reglas fundamentales de cómo aprende el estudiante. Introdujeron un nuevo método llamado HB-SJD, que actúa como un motor más rápido para las sesiones de práctica del estudiante. En lugar de obligar al estudiante a construir una imagen un token, o una diminuta unidad visual, a la vez, este nuevo sistema permite al modelo proponer varias piezas futuras de la imagen simultáneamente y luego verificar si esos cálculos son correctos. Piensen en esto como un estudiante tomando un examen: en lugar de escribir una respuesta, esperar a que un profesor la califique y luego escribir la siguiente, el estudiante escribe una página entera de respuestas a la vez, y el profesor marca rápidamente cuáles son correctas. El estudiante entonces conserva las respuestas correctas y solo vuelve a escribir las que estaban mal, avanzando mucho más rápido.

Los investigadores descubrieron que simplemente ejecutar este método más rápido en un grupo de imágenes al mismo tiempo no era suficiente. En una configuración estándar, si una imagen termina su generación rápidamente, tendría que esperar a la imagen más lenta del grupo antes de que el sistema pudiera pasar al siguiente paso. Este periodo de espera desperdiciaba un valioso poder de cómputo. Para resolver esto, el equipo diseñó su sistema de modo que cada imagen pudiera progresar a su propia velocidad. Si una imagen ha terminado, se hace a un lado, y el sistema continúa trabajando en las imágenes restantes sin detenerse. Además, descubrieron que la mejor manera de ejecutar el sistema cambia a medida que el número de imágenes activas disminuye. Cuando se están procesando muchas imágenes, el sistema funciona mejor manteniendo el grupo completo activo. Pero a medida que las imágenes terminan y el grupo se reduce, el sistema cambia a un modo más ligero que solo procesa las imágenes activas restantes, evitando la sobrecarga de gestionar espacios vacíos.

Al ser probado en modelos de generación de imágenes, este nuevo enfoque demostró ser altamente efectivo. Los investigadores encontraron que podía reducir el tiempo requerido para que el estudiante generara sus imágenes de práctica en casi la mitad, con aceleraciones que oscilan entre 1.4 y 1.6 veces más rápido que el método tradicional. Crucialmente, esta velocidad no se produjo a costa de la calidad. Las imágenes producidas por los modelos estudiantiles entrenados con este nuevo método eran tan nítidas y realistas como aquellas entrenadas con el método antiguo y más lento. El sistema funcionó consistentemente bien ya fuera que las imágenes fueran cortas o largas, si el grupo de imágenes procesadas era pequeño o grande, y en diferentes etapas del proceso de entrenamiento. Al reemplazar únicamente el motor que genera los datos de práctica, los investigadores lograron que todo el proceso de aprendizaje fuera significativamente más rápido, demostrando que se puede acelerar el entrenamiento de la inteligencia artificial sin comprometer la calidad del resultado final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →