← Últimos artículos
💻 computer science

Draft-OPD: On-Policy Distillation for Speculative Draft Models

Este artículo presenta Draft-OPD, un marco de destilación en política que supera las limitaciones del ajuste fino supervisado para la decodificación especulativa mediante el uso de trayectorias asistidas por el objetivo y la reproducción de borradores desde posiciones de error, logrando una aceleración sin pérdidas superior a 5x para modelos de razonamiento.

Autores originales: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia larga y compleja con un autor muy famoso y brillante (el Modelo Objetivo). Este autor es increíblemente inteligente y escribe oraciones perfectas, pero también es muy lento. Se toma mucho tiempo para pensar en cada palabra antes de escribirla.

Para acelerar las cosas, contratas a un becario rápido y enérgico (el Modelo Borrador) para que adivine las siguientes palabras. El becario escribe algunas palabras rápidamente, y luego el autor famoso las revisa. Si el becario tiene razón, el autor dice: "¡Genial, sigue así!" y continúa. Si el becario se equivoca, el autor tacha el error, escribe la palabra correcta y comienza de nuevo.

Este proceso se llama Decodificación Especulativa. El objetivo es que el becario adivine tan bien que el autor rara vez tenga que detenerse para corregirlo, haciendo que toda la historia se escriba mucho más rápido.

El Problema: El "Libro de Texto" vs. El "Juego Real"

Durante mucho tiempo, la forma de entrenar a estos becarios fue como darles un libro de texto. Les mostrabas historias que el autor famoso ya había escrito y decías: "Memoriza estos patrones". Esto se llama Ajuste Fino Supervisado (SFT).

Al principio, esto funciona muy bien. El becario mejora cada vez más copiando el libro de texto. Pero eventualmente, se topa con un muro. No importa cuánto más estudie el libro de texto, deja de mejorar en adivinar en tiempo real.

¿Por qué?
Porque el libro de texto es estático. Solo muestra los caminos que tomó el autor famoso. Pero en el juego real, el becario es quien hace el primer movimiento. A veces el becario adivina una palabra extraña que el autor nunca escribió en el libro de texto. Cuando el becario se equivoca, el autor lo corrige. Pero el becario nunca aprende de ese error porque el libro de texto no incluía ese escenario específico de "adivinanza incorrecta". El becario está estudiando un mapa de una ciudad por la que nunca ha caminado realmente.

La Solución: "Draft-OPD" (Aprendiendo Haciendo)

Los autores de este artículo proponen un nuevo método de entrenamiento llamado Draft-OPD. En lugar de solo leer el libro de texto, permiten que el becario practique en un juego simulado donde el autor famoso está allí para entrenarlo en tiempo real.

Así es como funciona, usando una analogía simple:

  1. La Prueba Segura (Despliegue Asistido por el Objetivo):
    Imagina que el becario intenta escribir un párrafo. Si se atasca o se desvía, el autor famoso interviene inmediatamente para corregirlo y mantener la historia en movimiento. Esto asegura que la sesión de práctica no se convierta en un caos de sinsentidos (lo cual sucede si el becario intenta escribir toda una historia solo).

  2. La "Repetición del Error" (El Secreto):
    Esta es la parte más importante. Cuando el becario hace una suposición y el autor tiene que corregirla, el sistema no simplemente continúa. Presiona "Rebobinar".

    • Vuelve al momento exacto en que el becario hizo la suposición incorrecta.
    • Le pide al becario que intente esa suposición específica de nuevo.
    • Le pide al autor que explique por qué esa suposición fue incorrecta.

    Esto es como un entrenador diciendo: "¡Alto! Intentaste patear el balón a la izquierda, pero el portero estaba allí. Rebobinemos e intentémoslo de nuevo para que aprendas a patear a la derecha". Esto enseña al becario específicamente sobre los errores que él comete, no solo sobre los caminos perfectos que tomó el autor.

  3. Puntuación Inteligente (Distilación Consciente de la Aceptación):
    El sistema trata las suposiciones del becario de manera diferente según el resultado:

    • Si el becario tenía razón: El sistema dice: "Buen trabajo, sigue haciendo exactamente lo que hiciste". (Refuerza los buenos hábitos).
    • Si el becario estaba equivocado: El sistema dice: "Estabas seguro de esta respuesta incorrecta, pero estaba mal. Enfocémonos intensamente en corregir este tipo específico de error". (Castiga los errores seguros).

Los Resultados

El artículo probó este nuevo método en algunos modelos de IA muy avanzados (llamados "Modelos de Pensamiento" porque son buenos en matemáticas y programación).

  • Método Antiguo (Aprendizaje con Libro de Texto): El becario podía acelerar el proceso de escritura en aproximadamente 4.5 veces.
  • Nuevo Método (Draft-OPD): El becario aceleró las cosas en más de 5 veces.

En términos simples, el nuevo método de entrenamiento hizo que el becario fuera mucho mejor adivinando, de modo que el autor famoso tuvo que detenerse y corregirlo con mucha menos frecuencia. Esto significa que la historia se escribe mucho más rápido, sin perder ninguna calidad.

Resumen

El artículo argumenta que para hacer que la IA sea más rápida, no podemos simplemente enseñarles a copiar ejemplos perfectos. Tenemos que dejarlos practicar, dejarlos cometer errores y luego enseñarles específicamente cómo corregir esos errores. Al reproducir los momentos en los que la IA adivinó mal, podemos entrenar una IA "borrador" que es mucho mejor prediciendo el futuro, haciendo que todo el sistema sea significativamente más rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →