AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents
El artículo AGORA propone un método de compresión de prompts sin inferencia y basado en adaptadores para agentes de LLM que supera las limitaciones estructurales de los compresores extractivos a nivel de token existentes al aislar un suelo estructural como el principal cuello de botella de calidad y lograr una compresión adaptativa de 1,0 a 11,5 veces mediante un evaluador aprendido, manteniendo un rendimiento cercano al de la compresión nula.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un agente LLM como un detective altamente cualificado que intenta resolver un misterio. Para resolver el caso, el detective examina una libreta larga llena de pistas, acciones que ha realizado y lo que vio después. A medida que avanza la investigación, esta libreta se vuelve enorme, a veces con más de 100.000 palabras. Si la libreta se vuelve demasiado grande, el detective se abruma y no puede pensar con claridad.
El problema es: ¿Cómo reduces el tamaño de esta libreta sin eliminar las pistas que realmente importan?
El Problema: El tipo "equivocado" de reductor
Los investigadores intentaron utilizar "resumidores" estándar (llamados compresores a nivel de token) que funcionan muy bien para tareas de lectura normales, como resumir un artículo de noticias. Estas herramientas funcionan eliminando palabras que parecen "predecibles" o "aburridas".
Pero para un agente detective, este enfoque es un desastre. El artículo lo denomina "Destrucción de la Gramática de Acciones".
Aquí está la analogía:
Imagina que la libreta del detective contiene una instrucción específica: "Buscar [zapatos rojos talla 10]".
- Las palabras "Buscar", "por" y los corchetes
[]son la gramática de acción. Son los comandos que le indican al ordenador qué hacer. - Sin embargo, como estas palabras son tan comunes y predecibles en inglés, el resumidor estándar piensa: "Oh, 'por' y los corchetes son aburridos. Los eliminaré para ahorrar espacio".
- El Resultado: La libreta ahora dice "zapatos rojos talla 10".
- El Fallo: El entorno informático lo ve y dice: "No sé qué hacer con esto. No es un comando". El agente falla o se bloquea.
El artículo probó 17 escenarios diferentes y descubrió que cada vez que utilizaban estos resumidores estándar, el rendimiento del agente colapsaba hasta casi cero, aunque lograban ahorrar espacio. La herramienta funcionaba perfectamente, pero estaba eliminando las únicas cosas que hacían que el agente funcionara.
La Solución: AGORA (El sistema de archivo inteligente)
Los autores crearon un nuevo sistema llamado AGORA. En lugar de actuar como un borrador de palabras, AGORA actúa como un archivista inteligente que entiende la estructura de la libreta del detective.
AGORA funciona en tres capas simples:
El Piso "Nunca-Tocar" (Analizador Estructural):
AGORA tiene una regla: "Nunca elimines las Instrucciones del Sistema, la Pista Actual o los dos últimos pasos".- Analogía: Imagina que la libreta del detective tiene una nota adhesiva roja en las dos últimas páginas y en la portada. AGORA dice: "Sin importar qué, mantenemos estas páginas exactamente como están". Esto asegura que el agente siempre sepa qué está haciendo y qué acaba de ocurrir.
La "Puntuación de Relevancia" (El Clasificador de 125M Parámetros):
Para las páginas más antiguas de la libreta, AGORA utiliza una IA pequeña y rápida (un modelo de 125 millones de parámetros) para preguntar: "Si eliminamos esta pista antigua, ¿tomará el detective una decisión diferente ahora mismo?".- Si la respuesta es "No, esta pista antigua no importa", se elimina.
- Si la respuesta es "Sí, esta pista es crítica", se mantiene.
- Punto Clave: Esto ocurre en aproximadamente 2 milisegundos. No pide a una IA gigante que reescriba la historia; solo verifica si la página es importante.
El Relleno "Codicioso":
Una vez que las páginas "Nunca-Tocar" están seguras, AGORA rellena el espacio restante con las pistas antiguas más importantes hasta que la libreta sea lo suficientemente pequeña.
Por qué es un Gran Logro
- Sin Coste Extra: La mayoría de los otros métodos intentan resumir la libreta pidiendo a una segunda IA gigante que haga el trabajo. Esto cuesta dinero y tiempo adicionales en cada paso. AGORA lo hace sin pedir una segunda IA, ahorrando dinero y tiempo.
- Funciona: En 8 de los 9 escenarios de prueba diferentes, AGORA mantuvo al agente funcionando al 75% o más de su velocidad y precisión originales, incluso con una libreta mucho más pequeña.
- Adaptable: Calcula automáticamente cuánto reducir el tamaño de la libreta. A veces la reduce en 1x (un poco), a veces en 11x (mucho), dependiendo de cuánto "relleno" haya en el historial.
La Conclusión
El artículo demuestra que no puedes tratar el historial de un agente de IA como un libro normal. Debes respetar la "gramática" de sus comandos. AGORA es una forma ligera, rápida y gratuita de mantener limpia la memoria del agente sin eliminar accidentalmente las instrucciones que hacen que funcione. Es la diferencia entre un resumidor que elimina la señal de "Alto" de un mapa de carreteras y un sistema de archivo que mantiene el mapa legible pero elimina los nombres de calles antiguos e irrelevantes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.