← Últimos artículos
🤖 machine learning

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

Este artículo propone y valida un marco para mejorar los agentes de Modelos de Lenguaje de Gran Escala en escenarios de múltiples turnos mediante la derivación de algoritmos GRPO y PPO adaptados que aprovechan estructuras de recompensa densas por turno para lograr una asignación de crédito, estabilidad de entrenamiento y rendimiento superiores en comparación con los enfoques de recompensa terminal o retardada dispersa.

Autores originales: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

Publicado 2026-08-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de los sistemas de inteligencia artificial más avanzados de la actualidad, capaces de generar texto de apariencia humana, resolver problemas complejos e incluso escribir código. Sin embargo, cuando se les pide a estos modelos que realicen tareas que requieren una larga cadena de razonamiento —como buscar información en la web, usar una calculadora o jugar un juego de múltiples pasos— suelen tener dificultades. La dificultad central radica en cómo aprenden de sus errores. En el campo del aprendizaje automático, estos sistemas suelen entrenarse mediante un método llamado aprendizaje por refuerzo, donde el modelo intenta diferentes acciones y recibe retroalimentación en forma de una recompensa. Si la respuesta final es correcta, el modelo recibe una recompensa; si es incorrecta, no recibe ninguna. Este enfoque funciona bien para tareas sencillas, pero para interacciones complejas de múltiples pasos, esperar hasta el final para dar retroalimentación es como intentar aprender un nuevo idioma solo siendo informado de si estás en lo cierto o no después de haber terminado una conversación entera. El aprendiz no tiene idea de qué palabra o frase específica causó el éxito o el fracaso, lo que hace que sea increíblemente difícil mejorar.

Un equipo de investigadores se propuso resolver este problema cambiando la forma en que estos agentes de IA reciben la retroalimentación durante sus interacciones. En lugar de esperar al resultado final, diseñaron un sistema que proporciona una recompensa pequeña y específica después de cada paso que da el agente. Imagine un agente intentando encontrar una respuesta buscando en la web. En el método antiguo, el agente podría realizar una consulta de búsqueda errónea, leer resultados irrelevantes y luego adivinar la respuesta incorrecta, recibiendo una señal de "fallo" solo al final. El nuevo enfoque le da al agente retroalimentación inmediata después de cada consulta de búsqueda: una pequeña recompensa por encontrar información relevante o una penalización por una consulta deficiente. Esto permite al agente aprender exactamente qué pasos fueron útiles y cuáles no, refinando su comportamiento con mucha mayor precisión.

Los investigadores probaron esta idea utilizando dos algoritmos de entrenamiento populares: uno que agrupa diferentes intentos para compararlos y otro que aprende de un flujo continuo de acciones. Aplicaron estos métodos a dos tipos de tareas muy diferentes: un agente de búsqueda que tenía que encontrar respuestas a preguntas utilizando una base de datos de Wikipedia, y un agente de juego que tenía que resolver un rompecabezas llamado Sokoban, donde las cajas deben ser empujadas hacia objetivos específicos en una cuadrícula. En el juego Sokoban, un solo movimiento equivocado puede atrapar al jugador en un callejón sin salida, haciendo imposible terminar el nivel. Esto convierte al juego en una prueba perfecta para determinar si un agente puede aprender a planificar varios pasos por adelantado. Los investigadores compararon su nuevo sistema de recompensa "paso a paso" contra el método tradicional de esperar el resultado final, así como un enfoque intermedio donde las recompensas eran retrasadas y combinadas.

Los resultados fueron claros y consistentes tanto en las tareas de búsqueda como en las de juego. Los agentes entrenados con las recompensas densas y paso a paso aprendieron más rápido y se volvieron mucho más estables que aquellos entrenados con los métodos anteriores. En las tareas de búsqueda, el nuevo método ayudó a los agentes no solo a encontrar las respuestas correctas con más frecuencia, sino también a seguir las estrictas reglas de formato requeridas para interactuar con el motor de búsqueda. En el juego Sokoban, los agentes entrenados con retroalimentación paso a paso aprendieron a evitar callejones sin salida y a resolver acertijos a una tasa significativamente mayor. Los investigadores descubrieron que el método tradicional de esperar la respuesta final a menudo conducía a un entrenamiento inestable, donde el rendimiento del agente fluctuaba salvajemente o no lograba mejorar. Por el contrario, el enfoque paso a paso proporcionó una guía constante, permitiendo a los agentes construir habilidades de razonamiento complejas sin perderse.

Este trabajo demuestra que, para que la inteligencia artificial domine las interacciones complejas de múltiples turnos, necesita más que una calificación final sobre su desempeño. Requiere una conversación continua sobre lo que está haciendo bien y mal mientras lo hace. El estudio muestra que, al descomponer el proceso de aprendizaje en piezas más pequeñas y manejables, y al proporcionar retroalimentación inmediata y específica para cada acción, los agentes de IA pueden volverse mucho más capaces y confiables. Este hallazgo sugiere un camino a seguir para la construcción de asistentes más inteligentes que puedan navegar el mundo real, resolver problemas intrincados e interactuar con herramientas de una manera que se sienta natural y efectiva, yendo más allá de la simple generación de texto hacia un razonamiento genuino de múltiples pasos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →