← Últimos artículos
🤖 machine learning

Verifier-Induced Support Reshaping in On-Policy Optimization

Este artículo revela que el aprendizaje por refuerzo on-policy con recompensas verificables (RLVR) puede mejorar el rendimiento inmediato de la tarea mientras causa inadvertidamente un "remodelado del soporte inducido por el verificador", donde la política estrecha su distribución de salida para hacer que las trayectorias exitosas para objetivos futuros sean demasiado raras para ser muestreadas, comprometiendo así la entrenabilidad a largo plazo y la capacidad conjunta.

Autores originales: Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

Publicado 2026-08-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot superinteligente a ser un asistente útil. No quieres que solo conozca hechos; quieres que siga reglas, resuelva problemas matemáticos complicados y escriba código. Para hacer esto, los científicos utilizan un método llamado "aprendizaje por refuerzo", que es como un juego donde el robot intenta diferentes respuestas, recibe una puntuación de un "verificador" (un juez estricto) y aprende a repetir los movimientos de alta puntuación. La gran esperanza es que podamos enseñar al robot una habilidad tras otra —primero matemáticas, luego escritura, luego programación— sin que olvide lo anterior o se confunda. Este es el sueño del "aprendizaje continuo": construir un robot que mejore en todo, paso a paso. Pero, ¿qué pasaría si el acto mismo de enseñar al robot a ser perfecto en una cosa accidentalmente cerrara la puerta al aprendizaje de la siguiente? ¿Qué pasaría si el robot aprendiera a ser tan bueno siguiendo instrucciones que olvidara cómo pensar paso a paso, o viceversa?

Este artículo investiga un problema sigiloso llamado "remodelación del soporte inducida por el verificador" (verifier-induced support reshaping). Los investigadores descubrieron que cuando entrenas a una IA para que sea excelente en una tarea específica usando un juez estricto, la IA no solo mejora en esa tarea; de hecho, cambia su personalidad de una manera que hace mucho más difícil aprender otras tareas después. Es como si entrenaras a un perro para que solo se siente cuando dices "Sienta", y al hacerlo, accidentalmente le enseñaras que "Sienta" es la única palabra que importa. Más tarde, cuando intentas enseñarle a "Quedarse quieto", podría confundirse porque su cerebro ha sido remodelado para ignorar todo lo demás. El artículo muestra que esto no es solo sobre el robot olvidando viejos trucos (un problema conocido como "olvido catastrófico"); se trata de que el robot hace que las respuestas correctas sean tan raras que el proceso de entrenamiento ya no puede encontrarlas. Incluso si el robot todavía tiene la capacidad de resolver un problema matemático, podría dejar de intentar resolverlo de la manera correcta porque se acostumbró a un estilo de respuesta diferente.

Los investigadores probaron esto entrenando dos tipos de modelos de IA en dos tareas muy diferentes: resolver problemas matemáticos y seguir instrucciones estrictas de escritura (como "escribe exactamente 50 palabras" o "usa viñetas"). Entrenaron a un grupo para ser genios de las matemáticas y a otro para ser profesionales en el seguimiento de instrucciones. Luego, intercambiaron los jueces para ver qué sucedía.

He aquí lo que descubrieron:

La trampa de Matemáticas a Instrucciones
Cuando entrenaron a la IA para ser un genio de las matemáticas primero, esta sí mejoró en el seguimiento de instrucciones en promedio. Sin embargo, algo extraño sucedió: la IA se volvió muy "polarizada". O seguía la instrucción perfectamente o fallaba por completo, con muy pocos intentos de "punto medio". Antes, la IA podía intentar muchas formas diferentes de responder, algunas de las cuales estaban cerca de ser correctas. Después del entrenamiento de matemáticas, dejó de intentar esos caminos intermedios. Esto significó que, si intentabas muestrear muchas respuestas (como pedirle a la IA que lo intente 32 veces), era menos probable que encontraras cualquier respuesta exitosa para la tarea de instrucciones. El entrenamiento de matemáticas había estrechado el enfoque de la IA tanto que dejó de explorar el "soporte" (la variedad de intentos) necesario para aprender nuevos trucos de seguimiento de instrucciones.

La trampa de Instrucciones a Matemáticas
El proceso inverso fue aún más interesante. Cuando entrenaron a la IA para ser una seguidora de instrucciones primero, esta comenzó a cambiar cómo respondía a los problemas matemáticos. En lugar de mostrar su procedimiento paso a paso (como "Primero, sumo 2 y 2..."), la IA empezó a saltar directamente a la respuesta ("La respuesta es 4"). Los investigadores llaman a esto un cambio de "Iniciación de Razonamiento Deliberado" (DRI) a "Iniciación de Respuesta Directa" (DAI).
Este cambio fue importante. Al empezar a saltarse los pasos, se volvió mucho más difícil encontrar la respuesta correcta, incluso si la IA todavía sabía matemáticas. De hecho, cuanto más saltaba la IA a respuestas directas, menor era su tasa de éxito cuando intentaban realizar múltiples intentos. El "soporte" para encontrar la respuesta matemática correcta se había reducido.

El secreto del "Primer Token"
Los investigadores profundizaron para descubrir por qué estaba sucediendo esto. Descubrieron que el cambio no se trataba de que la IA olvidara cómo hacer matemáticas más adelante en la frase. ¡El cambio ocurría en la mismísima primera palabra que la IA escribía!
Resulta que el "juez" (verificador) para las matemáticas anima a la IA a empezar con palabras como "Muy bien" o "Vamos a desglosar", mientras que el juez para las instrucciones la anima a empezar con "Respuesta" o "Aquí". Una vez que la IA aprende a empezar con "Respuesta", queda atrapada en un camino donde se salta los pasos de razonamiento. Los investigadores demostraron esto forzando a la IA a empezar con las palabras de "matemáticas" incluso cuando había sido entrenada para ser una seguidora de instrucciones. Al hacer esto, la capacidad de la IA para encontrar soluciones matemáticas mejoró mágicamente. Esto sugiere que la IA no perdió su cerebro matemático; simplemente se quedó atrapada en un mal hábito de "jugada inicial".

¿Podemos arreglarlo?
El equipo intentó solucionar este problema. Intentaron "pre-entrenar" a la IA para que siempre empezara con las palabras correctas (un "prior de DRI"), pero esto solo retrasó el problema; eventualmente, la IA seguía cambiando al estilo de respuesta directa. También probaron una técnica llamada "destilación on-policy", donde una IA estudiante intenta copiar a una IA maestra. Pero esto solo funcionaba si elegían al maestro con mucho cuidado; si el maestro ya había aprendido el "mal" hábito, el estudiante lo copiaba también.

La conclusión fundamental
El artículo concluye que el simple hecho de hacer que una IA sea mejor en una tarea no garantiza que esté lista para aprender la siguiente. De hecho, las mejoras en un área pueden, a veces, hacer que el "espacio de búsqueda" para la siguiente área sea tan pequeño que la IA ya no pueda encontrar las respuestas correctas. Las ganancias en matemáticas o en el seguimiento de instrucciones no siempre se traducen en respuestas que sean tanto correctas como respetuosas con las reglas. Es una advertencia para los desarrolladores de IA: el hecho de que un modelo obtenga una puntuación alta en una prueba hoy no significa que no haya cerrado la puerta a su aprendizaje futuro. Para mantener una IA flexible, debemos asegurarnos de que mantenga disponibles una amplia variedad de "jugadas iniciales", no solo aquellas que obtienen puntuaciones altas en este momento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →