← Últimos artículos
💬 NLP

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

Este estudio demuestra que, cuando se evalúan bajo un presupuesto de tokens fijo, los agentes web vanilla a menudo igualan o superan en tasa de éxito a los métodos de aumentación en línea, como los módulos de memoria y de habilidades, lo que sugiere que los beneficios aparentes de estos módulos frecuentemente desaparecen cuando se contabiliza su sobrecoste de tokens.

Autores originales: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un equipo de detectives para resolver una serie de misterios (tareas) en un sitio web. Tienes un presupuesto estricto para cuánto pueden gastar en "tiempo de pensamiento" (tokens).

Este artículo plantea una pregunta simple pero sorprendente: ¿Es mejor contratar a un detective que lleva una mochila pesada llena de notas, mapas y dispositivos escritos previamente (memoria y habilidades), o es mejor contratar a un detective más sencillo que simplemente tiene más tiempo para observar por su cuenta y pensar?

Los investigadores descubrieron que, sorprendentemente, el detective sencillo con más tiempo suele resolver más misterios y gasta menos dinero que el que lleva la mochila elegante.

Aquí tienes un desglose de sus hallazgos utilizando analogías de la vida cotidiana:

1. La "Mochila" vs. El "Tiempo Extra"

  • Los Agentes Aumentados (La Mochila): Algunos investigadores han estado construyendo agentes que llevan "mochilas". Estas mochilas contienen:
    • Habilidades: Guiones escritos previamente (como una hoja de trucos sobre cómo comprar un boleto).
    • Memoria: Notas de casos anteriores (como recordar que el botón de inicio de sesión suele estar a la izquierda).
    • Flujos de trabajo: Guías paso a paso sobre cómo resolver problemas específicos.
    • El problema: Cada vez que el agente abre la mochila para leer una nota o usar un guion, cuesta dinero (tokens). También ocupa espacio en su mente, haciendo que la parte del "pensamiento" real de la tarea sea más congestionada.
  • El Agente Vanilla (El Tiempo Extra): Los investigadores crearon un agente "sencillo" que no tiene mochila. En su lugar, le dieron el m mismo presupuesto total, pero lo usaron para permitir que el agente diera más pasos (mirar más alrededor, hacer clic en más botones, pensar más profundamente) sin distracciones.

El Resultado: En la mayoría de los casos, el agente sencillo con el tiempo extra resolvió más tareas que los agentes que llevaban la mochila. La "mochila" a menudo costaba tanto cargarla y abrirla que el agente no tenía suficientes recursos restantes para terminar realmente el trabajo.

2. La "Hoja de Trucos" que no fue trampa

El estudio analizó tres métodos populares de "mochila":

  • AWM (Memoria de Flujo de Trabajo): Como un detective que escribe una receta para "Cómo comprar una camisa" después de hacerlo una vez.
  • ASI (Inducción de Habilidades): Como un detective que escribe un programa de computadora para automatizar una tarea.
  • ReasoningBank: Como un detective que lleva un diario de "Qué salió bien y qué salió mal".

Los investigadores descubrieron que estas "hojas de trucos" a menudo resultaban contraproducentes.

  • El Problema del "Mapa Roto": La web cambia constantemente. Una habilidad escrita para una versión de un sitio web puede romperse inmediatamente si el sitio se actualiza. El agente sencillo, mirando la pantalla en tiempo real, se adapta naturalmente. El agente con un guion intenta seguir las instrucciones antiguas y falla.
  • El Problema de las "Malas Notas": Los agentes a veces escribían notas de intentos fallidos y pensaban que habían sido exitosos. Más tarde, intentaban usar estas malas notas, lo que conducía a más fallos.
  • El Problema del "Escritorio Atestado": Cada vez que el agente lee una nota de su mochila, tiene que leer toda la nota de nuevo. Esto hace que el proceso de "pensamiento" sea más lento y costoso, dejando menos presupuesto para el trabajo real.

3. La Ilusión de "Una Sola Vez"

El artículo señala un fallo importante en la forma en que estos agentes son probados habitualmente.

  • La Trampa de la Ejecución Única: A menudo, los investigadores ejecutan un agente una sola vez y dicen: "¡Mira, resolvió el 80% de las tareas!".
  • La Realidad: Los investigadores realizaron las pruebas tres veces. Descubrieron que los resultados variaban enormemente. Un agente podría resolver una tarea al primer intento porque tuvo suerte con una suposición aleatoria, pero fallar en el segundo intento.
  • La Lección: No puedes confiar en una sola ejecución de prueba. Es como juzgar la habilidad de un jugador de baloncesto basándose en un solo partido donde casualmente encestó un tiro de suerte. Necesitas verlo jugar muchos partidos para ver si realmente es bueno.

4. La Ventaja del "Paralelismo"

Hay una diferencia práctica más:

  • Los Agentes de la Mochila son como una carrera de relevos. Tienen que terminar la Tarea 1 para escribir una nota que ayude con la Tarea 2. Deben ir uno por uno.
  • El Agente Sencillo es como un equipo de trabajadores independientes. Dado que no dependen de notas de tareas previas, puedes enviar a 10 de ellos a resolver 10 tareas diferentes al mismo tiempo. Esto los hace mucho más rápidos en el mundo real.

La Conclusión

El artículo concluye que, si bien las "habilidades" y la "memoria" suenan muy bien en teoría, a menudo añaden demasiada complejidad y costo para el beneficio que proporcionan.

Si tienes un presupuesto fijo, a menudo es más inteligente darle a una IA capaz más tiempo para pensar y explorar directamente en lugar de obligarla a cargar una mochila pesada y costosa de herramientas prefabricadas. Los agentes "elegantes" suelen verse bien en el papel, pero cuando pagas el costo total (incluyendo el costo de la mochila), el enfoque directo y sencillo gana.

Lección Clave para el Futuro: Al evaluar agentes de IA, no debemos mirar solo cuántas tareas resolvieron. Necesitamos contar el costo total de todo lo que hicieron (incluyendo su memoria y herramientas) y realizar las pruebas múltiples veces para asegurar que los resultados sean reales y no solo cuestión de suerte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →