← Últimos artículos
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

Este artículo propone un marco de aprendizaje por refuerzo impulsado por búsqueda que optimiza iterativamente las especificaciones de la función de recompensa mediante generación automatizada, validación y filtrado basado en GRPO, demostrando que un bucle de retroalimentación clasificada mejora significativamente el rendimiento en razonamiento matemático en GSM8K en comparación con conjuntos de recompensas estáticos o aleatorios.

Autores originales: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un estudiante muy inteligente (un Modelo de Lenguaje Grande) que es excelente hablando pero a veces tiene dificultades con las matemáticas. Quieres enseñarle a resolver problemas matemáticos mejor. Por lo general, contratarías a un profesor para calificar sus tareas. Pero en este artículo, los autores plantean una pregunta diferente: "¿Y si no sabemos exactamente cómo calificar las tareas perfectamente? ¿Y si dejamos que una IA nos ayude a inventar las mejores reglas de calificación?"

Aquí está la historia de cómo lo hicieron, explicada de forma sencilla.

1. El Problema: El Misterio de la "Pauta de Calificación"

En el mundo de la IA, para enseñar a un modelo a pensar mejor, utilizas un sistema llamado Aprendizaje por Refuerzo. Piensa en esto como entrenar a un perro.

  • El Perro: El modelo de IA.
  • La Galleta: Una "recompensa" (una puntuación positiva).
  • El Truco: Resolver correctamente un problema matemático.

El problema es que diseñar la "galleta" (la función de recompensa) es difícil. Si le dices a la IA: "Buen trabajo si obtienes la respuesta correcta", podría hacer trampa adivinando o copiando patrones sin pensar realmente. Si intentas recompensar los pasos que da, tienes que escribir reglas complejas, y es fácil cometer un error en esas reglas.

2. La Solución: La "Fábrica de Reglas de Calificación"

Los autores construyeron un sistema que trata las reglas de calificación en sí mismas como algo que debe optimizarse. No escribieron las reglas a mano; establecieron una fábrica donde una IA (un modelo de vanguardia llamado Kimi K2) actúa como un Inventor de Reglas.

Así es como funciona la fábrica, paso a paso:

  • Ronda 1: Se le dan al IA Inventor de Reglas 20 problemas matemáticos y se le pide que escriba 10 nuevas formas de calificarlos. Escribe estas reglas como código informático simple (como una receta).
  • La Verificación de Seguridad: Antes de que se usen estas reglas, pasan por un "escáner de seguridad" para asegurarse de que no sean peligrosas o estén rotas.
  • La Prueba de Manejo: Los investigadores toman a un pequeño estudiante de matemáticas (un modelo de IA de 3 mil millones de parámetros) y le permiten practicar resolviendo problemas usando una de estas nuevas reglas durante un corto tiempo (500 pasos).
  • La Tarjeta de Puntuación: Ven qué tan bien le fue al estudiante en un examen. Si la nueva regla ayudó al estudiante a obtener mejores puntuaciones, la regla recibe una clasificación alta. Si la regla confundió al estudiante, recibe una clasificación baja.
  • El Bucle de Retroalimentación: Las reglas de mejor rendimiento se resumen y se devuelven al IA Inventor de Reglas. Se le dice a la IA: "Oye, las reglas que contaban el número de pasos de pensamiento funcionaron bien. Las reglas que solo miraban la respuesta final no funcionaron tan bien. Intenta inventar nuevas reglas basadas en eso".

Repetieron este ciclo 5 veces, generando 50 reglas candidatas diferentes.

3. Los Resultados: Encontrando las "Reglas de Oro"

Después de 5 rondas, encontraron algunos ganadores.

  • La Mejor Regla Individual: Una regla, llamada thinking_steps_count, fue campeona. Otorgaba puntos extra si la IA escribía su proceso de pensamiento en al menos tres líneas distintas. No verificaba si la respuesta era correcta (eso lo hacía el sistema base); simplemente alentaba a la IA a mostrar su trabajo.
  • El Poder del Trabajo en Equipo (Ensembles): Se dieron cuenta de que una sola regla no es suficiente. Así que tomaron las 5 mejores reglas y las combinaron en un "equipo de super-calificación".
    • El Resultado: Este equipo de reglas ayudó a la IA a saltar de una tasa de éxito del 60% (usando solo reglas básicas) a una tasa de éxito del 79.5%.
    • La Verificación "Mágica": Para probar que no fue solo suerte o la mera cantidad de reglas, probaron un "equipo aleatorio" de 5 reglas seleccionadas de la pila. Ese equipo aleatorio colapsó, con la IA fallando casi todo. Esto demostró que el bucle de retroalimentación (aprender qué reglas funcionaron y alimentar eso de vuelta al inventor) fue el ingrediente secreto, no solo tener más reglas.

4. ¿Hizo Trampa la IA? (La Auditoría de "Hackeo de Recompensas")

Un miedo común es que si le dices a una IA "dame más líneas de pensamiento", simplemente llenará la página con tonterías para obtener puntos.

  • La Auditoría: Los autores revisaron las respuestas de la IA. Descubrieron que cuando la IA obtuvo la respuesta correcta, en realidad escribió más líneas y usó más símbolos matemáticos que cuando la obtuvo incorrectamente.
  • La Conclusión: La IA no estaba haciendo trampa rellenando espacio vacío; estaba pensando genuinamente más porque las reglas la alentaban a hacerlo.

5. Por Qué Esto Importa

  • Es Accesible: No necesitas un superordenador. Ejecutaron todo este experimento en una sola tarjeta gráfica de consumo de gama alta (como las que usan los jugadores) en aproximadamente 40 horas.
  • Está Automatizado: En lugar de que un experto humano pase semanas adivinando cómo se ve la pauta de calificación perfecta, este sistema automatiza el descubrimiento de esas reglas.
  • Es Transparente: Las reglas no son una caja negra; son código Python simple que los humanos pueden leer, entender y ajustar.

En resumen: El artículo muestra que si dejas que una IA te ayude a diseñar el sistema de calificación para otra IA, y sigues refinando esas reglas basándote en qué tan bien se desempeña el estudiante, puedes enseñarle al estudiante a pensar mucho mejor que si simplemente le dieras un conjunto estático de reglas escritas por humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →