← Últimos artículos
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

Este artículo identifica el "colapso de la exploración" como un modo de falla clave donde los agentes de LLM pierden la capacidad de descubrir nuevas soluciones en entornos desconocidos durante el aprendizaje por refuerzo, y propone SPA, un método que mejora el rendimiento al fundamentar primero al agente en la predicción de estados y transiciones mediante el ajuste fino supervisado por autoexperiencia antes de optimizar la recompensa.

Autores originales: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Publicado 2026-09-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un programa informático diseñado para pensar y actuar como un humano, capaz de resolver acertijos, navegar por mundos virtuales o incluso usar un navegador web para buscar información. Estos programas, conocidos como modelos de lenguaje de gran tamaño, son entrenados con vastas cantidades de texto de internet, aprendiendo a predecir qué palabra sigue en una oración. Cuando los investigadores piden a estos modelos que actúen como agentes —tomando pasos para lograr un objetivo— a menudo utilizan un método llamado aprendizaje por refuerzo. Este es un proceso donde el modelo intenta diferentes acciones, recibe retroalimentación sobre si tuvo éxito o falló, y aprende gradualmente a repetir las acciones que conducen al éxito. Es una forma poderosa de enseñar a una máquina a hacer cosas que no fueron programadas explícitamente para hacer. Sin embargo, surge un problema crítico cuando estos agentes son colocados en situaciones nuevas y desconocidas. Si bien pueden aprender a resolver un acertijo específico que ya han visto, a menudo luchan por comprender cómo explorar un entorno completamente nuevo, quedando atrapados en una forma de pensamiento estrecha que les impide encontrar la mejor solución.

Un equipo de investigadores se propuso entender por qué estos agentes inteligentes fallan cuando encuentran lo desconocido. Descubrieron un fenómeno específico que llaman "colapso de exploración". En términos sencillos, cuando un agente es entrenado en una tarea nueva, a menudo aprende a encontrar solo un camino específico hacia el éxito e ignora todas las demás posibilidades. Se vuelve tan enfocado en esa ruta única que pierde la capacidad de probar diferentes enfoques. Los investigadores midieron esto observando dos puntuaciones diferentes: una que rastrea si la mejor suposición del agente funciona, y otra que rastrea si cualquiera de sus muchas suposiciones diferentes funciona. En tareas familiares, ambas puntuaciones mejoran a medida que el agente aprende. Pero en entornos nuevos y difíciles, como un rompecabezas basado en cuadrículas donde se deben empujar cajas hacia objetivos específicos, la puntuación para la mejor suposición única sube ligeramente, mientras que la puntuación para probar muchos caminos diferentes en realidad baja. El agente está aprendiendo a tener más confianza en un mal hábito en lugar de aprender a ser más flexible. Esto sucede porque el agente no comprende verdaderamente las reglas del nuevo mundo en el que se encuentra; está adivinando sin una base sólida.

Para solucionar esto, los investigadores desarrollaron un nuevo método de entrenamiento llamado SPA, que significa Agente de Experiencia Propia (Self-Experience Agent). En lugar de intentar inmediatamente enseñar al agente cómo obtener recompensas, primero le enseñaron cómo entender el mundo que lo rodea. Le dieron al agente la oportunidad de explorar el entorno por su cuenta, sin la presión de obtener puntos. Durante esta fase, se le pidió al agente que describiera lo que veía y predijera qué pasaría después si tomaba cierta acción. Por ejemplo, si el agente veía una caja en un lugar específico y decidía empujarla, primero tenía que declarar dónde estaba la caja y luego predecir dónde terminaría. Los investigadores luego usaron los resultados reales y correctos del entorno para corregir las predicciones del agente, enseñándole efectivamente las leyes de la física para ese juego específico. Este proceso creó una especie de mapa interno o "modelo de mundo" dentro de la mente del agente, fundamentando su comprensión en la realidad en lugar de en conjeturas vagas.

Una vez que el agente construyó este entendimiento interno de cómo funciona el mundo, los investigadores comenzaron el proceso de entrenamiento estándar para enseñarle cómo ganar. Los resultados fueron sorprendentes. En pruebas de un juego de rompecabezas llamado Sokoban, donde el agente tenía que empujar cajas hacia objetivos, el método de entrenamiento estándar solo permitió que el agente tuviera éxito aproximadamente el 25 por ciento de las veces. Con el nuevo método, la tasa de éxito saltó a casi el 60 por ciento. En otro rompecabezas que involucraba un lago congelado, la tasa de éxito mejoró de aproximadamente un 22 por ciento a más del 70 por ciento. Quizás lo más sorprendente fue que un modelo de computadora muy pequeño entrenado con este método fue capaz de superar a un modelo mucho más grande y potente que había sido entrenado utilizando los métodos antiguos y estándar. El modelo pequeño, habiendo aprendido primero las reglas del juego, fue capaz de navegar los complejos rompecabezas de manera más efectiva que el modelo gigante que solo había estado intentando adivinar el camino hacia una recompensa.

Los investigadores también probaron si este enfoque funcionaba en otros tipos de tareas, como un acertijo lógico llamado Sudoku y un entorno simulado para tareas domésticas. En cada caso, el método que enseñó al agente a entender el estado del mundo antes de intentar ganar condujo a mejores resultados. Encontraron que la clave del éxito no era solo tener más datos o una computadora más grande, sino el orden en el que ocurría el aprendizaje. Al forzar al agente a aprender la estructura del entorno primero, evitó la trampa de colapsar en una estrategia única y frágil. El agente aprendió a mantener sus opciones abiertas, explorando múltiples caminos porque comprendía las consecuencias de sus acciones. Este enfoque sugiere que, para que la inteligencia artificial se adapte verdaderamente a situaciones nuevas y complejas, necesita construir una comprensión confiable de la realidad antes de intentar optimizar el éxito. El estudio muestra que cuando un agente está fundamentado en la mecánica real de su entorno, puede aprender a explorar más efectivamente y resolver problemas que anteriormente estaban fuera de su alcance.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →