← Últimos artículos
🤖 AI

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

El artículo presenta la Política de Pensamiento (PoT), un marco que mejora el razonamiento de los LLM al tratar la ejecución en tiempo de prueba como un proceso de optimización en línea donde un adaptador LoRA transitorio se actualiza dinámicamente mediante la Optimización de Política Relativa de Grupo para internalizar la retroalimentación y evolucionar la estrategia de razonamiento del modelo, permitiendo que un modelo de 4B supere significativamente a modelos de vanguardia mucho más grandes en complejos benchmarks de codificación.

Autores originales: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

Publicado 2026-07-16
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas increíblemente difícil, como un desafío de programación complejo o un problema matemático que requiere una larga cadena de pensamiento. Tienes un asistente superinteligente (un Modelo de Lenguaje Grande) que conoce muchos datos pero a veces se queda atrapado en un bucle, repitiendo los mismos errores una y otra vez. En el mundo de la inteligencia artificial, este asistente suele trabajar con un cerebro "congelado": una vez que comienza a pensar, no puede cambiar su estrategia fundamental a mitad del proceso. Si toma un camino equivocado, simplemente sigue caminando por ese camino erróneo, esperando tropezar con la respuesta correcta por pura suerte o probando muchos caminos diferentes a la vez. Esto es como intentar encontrar la salida de un laberinto corriendo ciegamente por cada pasillo hasta chocar con una pared, en lugar de aprender de las paredes con las que ya ha tropezado.

Durante mucho tiempo, la mejor manera de resolver estos problemas difíciles era simplemente darle a la computadora más tiempo y potencia de cálculo para probar millones de diferentes conjeturas. Pero este artículo sugiere una forma más inteligente: en lugar de solo esforzarse más, la computadora debería aprender mientras lo intenta. Piensa en esto como un personaje de un videojuego que no solo reaparece e intenta de nuevo, sino que realmente aprende de la trampa específica que acaba de matarlo, ajustando su estrategia instantáneamente para el siguiente intento. Los investigadores detrás de este estudio se preguntan: ¿qué pasaría si nuestra IA pudiera "pensar sobre la marcha", actualizando sus propias reglas de razonamiento en tiempo real basándose en si sus intentos anteriores fallaron o tuvieron éxito? Esta es la diferencia entre un robot que solo sigue un guion y uno que se adapta y evoluciona su propio cerebro para cada nuevo desafío que enfrenta.


La "Política de Pensamientos": Enseñando a la IA a Aprender Mientras Juega

Conoce a PoT (Policy of Thoughts), un nuevo marco de trabajo que trata la resolución de un problema no como una conjetura de un solo intento, sino como una conversación viva y evolutiva entre la IA y el problema mismo. Los autores, un equipo de investigadores de universidades como la Universidad de Zhejiang y la LMU de Múnich, argumentan que la vieja forma de hacer las cosas —donde la estrategia de la IA permanece congelada mientras busca respuestas— nos está frenando. Proponen un sistema donde la IA tiene una "segunda oportunidad" para aprender de sus propios errores durante la prueba, entrenándose a sí misma sobre la marcha.

El Acertijo Popperiano: Conjeturar, Probar y Evolucionar

La idea central se inspira en un famoso filósofo llamado Karl Popper, quien creía que la ciencia avanza a través de "conjeturas y refutaciones". En lenguaje sencillo, esto significa que haces una conjetura, la pruebas contra la realidad y, si falla, aprendes exactamente por qué falló para poder hacer una mejor conjetura la próxima vez.

PoT da vida a esta filosofía para la IA. Así es como funciona el ciclo:

  1. La Conjetura (La Conjetura): La IA observa un problema y genera algunas soluciones posibles diferentes (como esbozar tres rutas distintas en un mapa).
  2. La Refutación (La Verificación de la Realidad): El sistema ejecuta estas soluciones en un entorno real (como un compilador de código). Si el código falla o da la respuesta incorrecta, eso es una "refutación".
  3. La Evolución (El Aprendizaje): Esta es la parte mágica. En lugar de simplemente desechar la conjetura fallida, PoT utiliza el fallo para actualizar la "política" interna de la IA (su estrategia de pensamiento). Realiza ajustes diminutos e instantáneos en cómo piensa la IA, específicamente para este problema.
  4. El Repetir: La IA lo intenta de nuevo con su cerebro recién actualizado, ahora mejor equipado para evitar el error específico que acaba de cometer.

El Truco del "Cerebro Temporal"

Podrías preguntarte: "Si la IA aprende de cada problema, ¿no se confundirá o olvidará lo que sabía antes?". Los autores tienen una solución ingeniosa. Utilizan una técnica llamada LoRA (Low-Rank Adaptation), que es como darle a la IA un "gorro de pensar" temporal y desprendible.

Imagina que la IA tiene una biblioteca de conocimiento masiva y permanente (su modelo base). Cuando se enfrenta a un problema difícil, se pone un "gorro de pensar" especial y ligero (el adaptador LoRA). Este gorro permite que la IA aprenda y se adapte rápidamente su estrategia para este rompecabezas específico. Una vez que se resuelve el rompecabezas (o se agota el tiempo), el gorro se quita y se desecha. La biblioteca permanente permanece intacta y sin confusión. Esto significa que la IA puede ser una maestra de la adaptación para cada nuevo problema sin arruinar su conocimiento general.

Los Resultados: Cerebro Pequeño, Grandes Victorias

Los investigadores probaron esta idea en desafíos de programación, que son notoriamente difíciles porque requieren una lógica precisa y paso a paso. Utilizaron un modelo de IA relativamente pequeño (solo 4 mil millones de parámetros) y le dieron el marco de trabajo PoT.

Los resultados fueron sorprendentes. Este diminuto modelo, usando PoT, logró resolver el 49.71% de los problemas en un benchmark exigente llamado LiveCodeBench V6. Para ponerlo en perspectiva:

  • Superó a GPT-4o, un modelo comercial masivo, que obtuvo un 29.71% en ese mismo benchmark específico.
  • Superó significativamente el rendimiento base de otros modelos grandes en esta prueba específica, demostrando que un modelo con aprendizaje dinámico puede superar el razonamiento estático de sistemas mucho más grandes.
  • Aunque modelos como Gemini-2.5-Flash (60.91% general) y Claude-Opus-4 (55.22% general) lograron puntuaciones más altas en benchmarks más amplios y mixtos, el 49.71% del modelo potenciado por PoT en el riguroso LiveCodeBench V6 representa un salto masivo para un modelo más de 50 veces más pequeño, demostrando que el razonamiento adaptativo puede cerrar la brecha con los gigantes en tareas específicas y complejas.

Lo más impresionante es que el modelo potenciado por PoT es más de 50 veces más pequeño que algunos de los modelos gigantes con los que compite. No ganó por tener un cerebro más grande; ganó por tener una forma más inteligente de usar el cerebro que tenía.

Por Qué Esto Importa

El artículo sugiere que el futuro del razonamiento de la IA no se trata solo de construir modelos cada vez más grandes. Se trata de dar a los modelos la capacidad de "pensar sobre la marcha". Al convertir el proceso de tiempo de prueba en una sesión de entrenamiento, la IA deja de desperdiciar energía en caminos fallidos y comienza a usar esa energía para mejorar su estrategia instantáneamente.

Los autores descubrieron que este método funciona mejor cuando hay una retroalimentación clara (como un código que se ejecuta o falla). Cuando la retroalimentación es difusa, las ganancias son menores, pero siguen siendo positivas. También demostraron que este enfoque funciona en diferentes tipos de modelos, no solo en el que empezaron.

En resumen, PoT sugiere que la mejor manera de resolver un problema difícil no es solo esforzarse más; es aprender más rápido. Al permitir que la IA evolucione su propia estrategia de razonamiento para cada desafío, podemos obtener resultados superinteligentes de computadoras mucho más pequeñas y eficientes. Es un cambio de "buscar la respuesta correcta" a "aprender cómo encontrar la respuesta correcta".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →