← Últimos artículos
💬 NLP

On-Policy Delta Distillation for Multilingual Math Reasoning

Este artículo demuestra que la Destilación Delta On-Policy (OPD2^2), que aprovecha la brecha de probabilidad entre un profesor post-entrenado y su modelo base, mejora significativamente el razonamiento matemático multilingüe en coreano y japonés al tiempo que reduce las brechas de rendimiento, aunque subraya la necesidad de datos multilingües para prevenir desplazamientos en las respuestas centrados en el inglés.

Autores originales: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Publicado 2026-08-07
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras son como estudiantes brillantes y multilingües que han leído todos los libros de la biblioteca pero aún luchan por resolver un problema matemático complicado. Para ayudarlas a ser más inteligentes, los científicos utilizan una técnica llamada "entrenamiento", que es un poco como un entrenador guiando a un estudiante a través de problemas de práctica. Durante mucho tiempo, la mejor manera de entrenar a estos estudiantes de IA fue mediante el Aprendizaje por Refuerzo (RL), un método donde la computadora recibe una única calificación al final de su respuesta, como recibir una "A" o una "F" en todo un ensayo sin saber qué oraciones específicas fueron buenas o malas. Sin embargo, ha surgido un método más eficiente llamado Destilación On-Policy (OPD). En lugar de esperar a una calificación final, el OPD actúa como un maestro experto que lee la respuesta del estudiante palabra por palabra, susurrando correcciones y sugerencias mientras el estudiante escribe. Este feedback a "nivel de token" es mucho más preciso. Pero aquí está el truco: la mayor parte de esta investigación se ha realizado solo en inglés. No sabíamos si esta técnica del "maestro que susurra" funcionaba igual de bien para estudiantes que hablaban coreano, japonés u otros idiomas, o si podría ayudar a cerrar la brecha entre lo bien que la IA habla inglés frente a lo bien que habla otras lenguas.

Este artículo profundiza en esa pregunta exacta, probando una versión supercargada de la técnica llamada On-Policy Delta Distillation (OPD²) en el razonamiento matemático en inglés, coreano y japonés. Los investigadores descubrieron que este nuevo método es un cambio de juego. Al igual que un maestro chef que puede enseñar una receta a un estudiante en cualquier idioma, el OPD² ayudó a los modelos de IA a resolver problemas matemáticos significativamente mejor en los tres idiomas, con saltos particularmente enormes en coreano y japonés. El estudio sugiere que este método es incluso mejor que la versión original porque se enfoca en el "delta"—la diferencia específica entre lo que el maestro sabe y lo que el modelo base del estudiante ya sabe—aislando efectivamente las nuevas habilidades de razonamiento que se están enseñando.

Sin embargo, el artículo también reveló un efecto secundario fascinante y ligeramente truculento. Cuando los investigadores intentaron enseñar a la IA utilizando solo problemas matemáticos en inglés, el modelo sorprendentemente mejoró también en la resolución de problemas matemáticos en coreano y japonés. Era como si el estudiante aprendiera la lógica de las matemáticas en inglés y pudiera aplicarla a otros idiomas. Pero hubo un giro: aunque las respuestas eran correctas, el modelo a menudo comenzaba a escribir sus explicaciones en inglés, incluso cuando la pregunta se hacía en coreano o japonés. Esto sugiere que, si bien el "músculo del razonamiento" puede entrenarse en un idioma y transferirse a otro, mantener la "voz" de la respuesta en el idioma objetivo requiere practicar con datos en ese idioma específico.

El Descubrimiento Central: Un Mejor Maestro que Susurra

Los investigadores se propusieron ver si el OPD² (la versión avanzada del maestro que susurra) podía superar al OPD original al tratar con múltiples idiomas. Utilizaron una familia de modelos de IA llamados Qwen3 (específicamente las versiones 1.7B y 8B) y un modelo maestro masivo para guiarlos. Los resultados fueron claros y consistentes: el OPD² superó consistentemente al OPD original en todos los ámbitos.

Piénselo de esta manera: si el OPD original era un buen tutor, el OPD² era un tutor genio que sabía exactamente qué le faltaba al estudiante. En los experimentos, esta diferencia fue enorme para los idiomas que no son el inglés. Para el modelo más pequeño (Qwen3-1.7B), el OPD² mejoró la puntuación de matemáticas en coreano de 40.9 a 51.9, y la de japonés de 37.2 a 52.0. El OPD original ayudó, pero el OPD² elevó esos números aún más. Para el modelo más grande y capaz (Qwen3-8B), las mejoras fueron igual de fuertes, con el coreano saltando de 57.0 a 64.4 y el japonés de 57.1 a 65.0.

El artículo argumenta explícitamente que esto no se trata solo de copiar el estilo del maestro. Al utilizar la "señal delta" (la brecha entre el maestro y su propio modelo base), el OPD² transfirió con éxito las capacidades de razonamiento al estudiante, en lugar de simplemente imitar la salida general del maestro. Esto sugiere que el método es robusto y funciona bien independientemente del idioma o del tamaño del modelo.

Cerrando la Brecha Lingüística

Uno de los mayores objetivos de esta investigación fue ver si estos métodos de entrenamiento podían estrechar la brecha de rendimiento entre el inglés y otros idiomas. A menudo, los modelos de IA son mucho mejores en inglés que en coreano o japonés. El artículo encontró que el OPD² multilingüe generalmente ayudó a estrechar esta brecha.

En un análisis detallado de la "brecha de precisión inglés-coreano", los investigadores observaron que, si bien el modelo base favorecía al inglés por un margen amplio (a veces por más de 13 puntos en ciertas pruebas), el entrenamiento con OPD redujo esta disparidad. Por ejemplo, en el benchmark Global-MGSM, la brecha se redujo de 13.4 puntos a 8.6 puntos con el OPD estándar, y bajó aún más a 9.3 puntos con el OPD². En el benchmark HRM8K, la brecha cayó de 12.1 a 9.2 puntos.

El artículo sugiere que esto sucede porque el entrenamiento multilingüe beneficia más a los idiomas que no son el inglés que al propio inglés, elevando efectivamente a los de menor rendimiento sin arrastrar a los más fuertes. Sin embargo, los autores advierten cuidadosamente que este efecto no fue perfectamente uniforme en cada una de las pruebas; en algunos benchmarks específicos como M-MMLU, la brecha de hecho se amplió ligeramente. Por lo tanto, aunque la tendencia es positiva, no es una varita mágica que arregla cada métrica instantáneamente.

La Sorpresa del "Solo Inglés" y la Trampa del Idioma

Quizás el hallazgo más sorprendente del artículo es lo que sucedió cuando entrenaron los modelos utilizando solo datos en inglés. Uno podría pensar que si solo le enseñas a un estudiante matemáticas en inglés, fallará en las matemáticas en coreano. Pero el artículo encontró que el OPD² basado solo en inglés mejoró significamente las puntuaciones de coreano y japonés.

En el modo de no-pensamiento (non-thinking mode), el entrenamiento solo en inglés aumentó el promedio de coreano de 40.9 a 52.6 y el de japonés de 37.2 a 53.4. Estas cifras fueron casi tan buenas como las puntuaciones del entrenamiento multilingüe (que fueron 51.9 para coreano y 52.0 para japonés). Esto sugiere que la lógica del razonamiento matemático es tan universal que puede aprenderse en inglés y luego aplicarse a problemas en coreano o japonés, incluso si el modelo no vio ni un solo problema matemático en coreano durante el entrenamiento.

Sin embargo, hay un gran inconveniente. El artículo descarta explícitamente la idea de que esto signifique que el modelo ha dominado realmente el idioma. Cuando los investigadores verificaron qué idioma hablaba realmente el modelo en sus respuestas, los resultados fueron contundentes.

  • Entrenamiento Multilingüe: Cuando fue entrenado con idiomas mixtos, el modelo respondió en coreano el 90.5% de las veces (en modo de no-pensamiento) y en japonés el 90.9% de las veces.
  • Entrenamiento Solo en Inglés: Cuando fue entrenado solo en inglés, las respuestas en "coreano" del modelo cayeron al 48.3% (lo que significa que respondió en inglés la mitad de las veces), y sus respuestas en "japonés" se desplomaron al 29.6%.

Incluso en el "modo de pensamiento" (donde el modelo realiza un paso de razonamiento oculto antes de responder), la tendencia se mantuvo. El modelo entrenado solo en inglés resolvía la matemática correctamente, pero a menudo escribía la respuesta final en inglés, ignorando el hecho de que la pregunta se hacía en coreano o japonés. El artículo concluye que, si bien el entrenamiento solo en inglés puede transferir la capacidad de razonar, falla en preservar el hábito de responder en el idioma objetivo. Para lograr que el modelo hable el idioma que deseas, debes alimentarlo con datos en ese idioma.

Resumen de Hallazgos

El artículo demuestra que OPD² es un método superior para enseñar razonamiento matemático a la IA a través de los idiomas, superando consistentemente al OPD original. Logra estrechar la brecha de rendimiento entre el inglés y los idiomas como el coreano y el japonés, sugiriendo que el post-entrenamiento multilingüe es un camino viable hacia una IA más equilibrada. Sin embargo, el estudio también traza una línea clara entre la "capacidad de razonamiento" y la "generación de lenguaje". Si bien las habilidades de razonamiento pueden aprenderse en un idioma y aplicarse a otro, el modelo tenderá naturalmente hacia el inglés a menos que sea entrenado explícitamente con datos en el idioma objetivo. Los autores sugieren que la investigación futura debería centrarse en evaluar tanto la precisión de la respuesta como el idioma de la respuesta para comprender verdaderamente las capacidades de la IA multilingüe.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →