← Últimos artículos
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

Este artículo presenta RECAP, una estrategia de repetición de extremo a extremo con reponderación dinámica de objetivos que mitiga eficazmente el olvido de capacidades generales en modelos de razonamiento grandes entrenados con aprendizaje por refuerzo, mientras mejora simultáneamente el rendimiento del razonamiento mediante compensaciones de recompensa flexibles.

Autores originales: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La Trampa del "Especialista"

Imagina que contratas a un chef brillante y polifacético que puede cocinar cualquier cosa: puede hornear un pastel perfecto, picar verduras con precisión e incluso arreglar un grifo que gotea en la cocina (una metáfora de la capacidad de un modelo para manejar matemáticas, visión y conocimiento general).

Luego, decides entrenar a este chef específicamente para ganar un concurso de comer pasteles de alto nivel. Lo pones en una habitación con solo recetas de pasteles y reglas estrictas sobre cómo sostener el tenedor.

¿Qué sucede?
Después de unas semanas de entrenamiento intenso, el chef se convierte en un experto mundial en comer pasteles. Sigue las reglas del tenedor a la perfección. Sin embargo, debido a que pasó todo su tiempo practicando el pastel, empieza a olvidar cómo picar verduras o arreglar el grifo. Si le pides que pique una cebolla, podría quedarse mirando fijamente o intentar comérsela entera.

En el mundo de la IA, esto es exactamente lo que está sucediendo. Los investigadores están utilizando una técnica llamada RLVR (Aprendizaje por Refuerzo con Recompensas Verificables) para enseñar a los Grandes Modelos de Lenguaje (LLM) cómo "razonar" (resolver problemas matemáticos, seguir una lógica compleja). Mientras los modelos se vuelven increíbles razonando, comienzan a olvidar sus otras habilidades, como reconocer objetos en una imagen, leer texto en una imagen o mantenerse seguros y honestos.

La Solución del Artículo: "RECAP"

Los autores proponen un nuevo método llamado RECAP (Replay-Enhanced CApability Preservation - Preservación de Capacidades Mejorada por Repetición). Piensa en RECAP como un horario de entrenamiento inteligente para ese chef.

En lugar de solo alimentar al chef con recetas de pasteles todo el día, RECAP hace dos cosas:

  1. Repite lo Básico: Ocasionalmente trae de vuelta las viejas recetas de "picar verduras" y "arreglar el grifo" para que el chef no las olvide.
  2. Ponderación Dinámica: Actúa como un entrenador inteligente que observa el progreso del chef en tiempo real.

Cómo funciona el "Entrenador Inteligente" (La Analogía)

Imagina que el chef está practicando tres cosas a la vez:

  • La Regla del Tenedor (Formato): Cómo sostener el tenedor.
  • El Sabor (Precisión): ¿Sabe bien el pastel?
  • La Limpieza (Habilidades Generales): Mantener la cocina ordenada.

En una sesión de entrenamiento normal, el entrenador podría decir: "¡Practica las tres por igual!". Pero eso es ineficiente.

  • La Regla del Tenedor es fácil. El chef la domina en 5 minutos. Si el entrenador lo obliga a practicarla durante una hora, es una pérdida de tiempo.
  • El Sabor es difícil. El chef tiene dificultades con ello.
  • La Limpieza se está volviendo desordenada porque el chef está distraído.

El Entrenador de RECAP observa los datos y dice:

"Oye, el chef ya ha dominado la Regla del Tenedor. Dejemos de enfocarnos en eso (bajar el peso). Dediquemos más tiempo al Sabor y a la Limpieza porque son los que todavía presentan dificultades o están siendo inestables".

RECAP detecta automáticamente qué habilidades están "saturadas" (ya aprendidas) y cuáles son "volátiles" (están en dificultad o cambiando rápido). Desplaza el enfoque del entrenamiento hacia las habilidades que presentan problemas para que el modelo no aprenda en exceso lo que ya sabe mientras olvida lo que es difícil.

Lo que Encontraron (Los Resultados)

Los investigadores probaron esto en modelos de IA potentes (específicamente la familia Qwen2.5-VL). Esto es lo que descubrieron:

  1. El "Olvido" es Real: Cuando entrenaron los modelos solo en tareas de razonamiento, los modelos mejoraron en matemáticas pero empeoraron significamente en cosas como leer texto en imágenes o reconocer objetos.
  2. RECAP Salva el Día: Al usar su horario dinámico, los modelos mantuvieron sus habilidades de razonamiento altas (incluso mejorándolas en ocasiones) pero no perdieron sus habilidades generales. De hecho, a menudo funcionaron mejor en tareas generales que los modelos entrenados con métodos estándar.
  3. Eficiencia: Los modelos entrenados con RECAP no solo se volvieron más inteligentes; también se volvieron más eficientes. Empezaron a dar respuestas más cortas y directas en lugar de divagar, porque el sistema dejó de obligarlos a "pensar" (escribir largas cadenas de texto) en tareas que no lo necesitaban.

La Conclusión

El artículo argumenta que no debemos simplemente forzar a los modelos de IA a convertirse en "máquinas de razonamiento" ignorando todo lo demás. Si lo hacemos, se convierten en especialistas de un solo truco que olvidan cómo ser útiles en el mundo real.

RECAP es una herramienta sencilla, tipo "plug-in", que actúa como una dieta equilibrada para el entrenamiento de la IA. Asegura que, mientras el modelo aprende a resolver acertijos complejos, no olvide cómo ver, leer y comprender el mundo que lo rodea. Se trata de mantener a la IA bien formada mientras sigue siendo un genio en su trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →