← Últimos artículos
🤖 AI

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

El artículo propone DEAR, un novedoso marco de destilación on-policy que mejora la transferencia de razonamiento al identificar no solo los puntos de decisión mediante la incertidumbre del estudiante, sino también los tokens de evidencia de apoyo críticos a través de la similitud y divergencia de los estados ocultos, superando así a los métodos estándar en evaluaciones de matemáticas y código.

Autores originales: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

Publicado 2026-06-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un joven aprendiz (el Estudiante) cómo resolver acertijos complejos observando a un maestro artesano (el Maestro).

En el mundo de la IA, este proceso se llama Destilación On-Policy. El aprendiz intenta resolver un problema, mientras el maestro observa, corrigiendo cada una de las palabras que el aprendiz escribe.

El artículo argumenta que la forma actual de hacer esto es defectuosa. Es como si el maestro corrigiera cada palabra que el aprendiz escribe, desde "Empecemos" hasta "La respuesta es 42". Esto abruma al aprendiz con demasiado ruido.

Los autores descubrieron que no todas las palabras son iguales. Descubrieron que las cadenas de razonamiento contienen dos tipos de "conocimiento" muy diferentes, y que deben enseñarse de dos maneras distintas.

Los Dos Tipos de Conocimiento: El "Giro" y la "Prueba"

Para entender el descubrimiento del artículo, imagina que el aprendiz está navegando por un laberinto.

  1. Tokens de Decisión (Los Giros): Estos son los momentos en los que el aprendiz tiene que elegir un camino. "¿Debería ir a la izquierda o a la derecha?" "¿Debería sumar o restar?"

    • Cómo los encontramos: Cuando el aprendiz no está seguro, duda. En términos de IA, esto es incertidumbre alta (o entropía alta). Los métodos actuales son buenos para detectar estos momentos porque el aprendiz está visiblemente confundido.
    • Analogía: Estos son los cruces de caminos. El maestro sabe cuándo detenerse y decir: "¡Oye, mira aquí! Aquí es donde tienes que pensar con fuerza".
  2. Tokens de Evidencia (La Prueba): Estos son los pasos que el aprendiz toma después de tomar una decisión. "Elegí la izquierda, así que caminaré 10 pasos".

    • El Problema: A veces, el aprendiz está seguro pero equivocado. Puede que diga con confianza: "Caminaré 10 pasos", pero el maestro sabe que el camino es en realidad de 12 pasos. Debido a que el aprendiz tiene tanta confianza, no duda. Su "medidor de incertidumbre" se mantiene bajo.
    • El Punto Ciego: Los métodos de enseñanza actuales solo buscan los momentos de "incertidumbre" (los giros). Ignoran por completo estos pasos de "confianza errónea". El aprendiz aprende dónde girar, pero no cómo caminar el camino. Aprende el esqueleto del razonamiento, pero pierde la carne y la sangre.

La Solución: DEAR (Razonamiento Consciente de Decisión y Evidencia)

Los autores proponen un nuevo método llamado DEAR. En lugar de solo buscar la confusión, DEAR utiliza un proceso de detección de dos pasos para encontrar los pasos ocultos de "confianza errónea".

Paso 1: Encontrar los Giros (Decisiones)
Al igual igual que antes, el sistema busca los momentos en los que el aprendiz no está seguro. Estos son los "Tokens de Decisión".

Paso 2: Encontrar la Prueba (Evidencia)
Esta es la parte ingeniosa. Una vez que el sistema encuentra un "Giro", se pregunta: "¿Qué otros pasos en esta oración están conectados con este Giro?"

  • La Analogía: Imagina que el aprendiz escribe una historia. El "Giro" es el giro de la trama. La "Evidencia" es el párrafo que explica por qué ocurrió el giro. Incluso si el aprendiz escribe la explicación con confianza (y tal vez se equivoca en un detalle), ese párrafo sigue estando profundamente conectado con el giro de la trama.
  • Cómo lo hace DEAR: Busca en los "pensamientos ocultos" (datos internos) de la IA. Comprueba si las palabras "seguras" comparten una "vibra" o contexto similar con las palabras de decisión "inciertas". Si lo hacen, DEAR las marca como Tokens de Evidencia importantes que necesitan corrección, incluso si el aprendiz no parecía confundido.

También añade una "verificación de brecha": Si el maestro y el estudiante discrepan fuertemente en un paso, ese paso recibe atención extra.

Por qué esto es importante (Los Resultados)

El artículo probó esto en problemas matemáticos y tareas de programación.

  • El Resultado: Al enseñar al aprendiz no solo dónde girar, sino también cómo caminar el camino (la evidencia), el estudiante mejoró mucho.
  • Los Números:
    • En competiciones de matemáticas, el nuevo método mejoró las puntuaciones hasta en 2.5 puntos porcentuales.
    • En programación, mejoró las puntuaciones hasta en 5.7 puntos porcentuales.
    • Crucialmente, ayudó más en los problemas más difíciles, donde se necesitan largas cadenas de razonamiento.

Resumen en pocas palabras

Piensa en el método antiguo como un profesor que solo detiene al estudiante cuando parece perdido en un cruce de caminos.
DEAR es un profesor que detiene al estudiante en el cruce de caminos Y TAMBIÉN revisa los pasos que tomó inmediatamente después, corrigiéndolo incluso si estaba caminando con confianza en la dirección equivocada.

Al encontrar estos errores "ocultos", el estudiante aprende la lógica completa de la solución, no solo las decisiones de alto nivel.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →