← Últimos artículos
💬 NLP

Token Reduction Is Not Cost Reduction

Este artículo demuestra que reducir el recuento de tokens en los contextos de los agentes de codificación no disminuye de manera fiable los costos facturados debido al predominio del tráfico de caché de prompts y al riesgo de fallo en las tareas, argumentando en su lugar la evaluación de la eficiencia de costos basándose en el costo facturado ajustado por éxito en lugar de solo en la reducción de tokens.

Autores originales: Sarel Weinberger, Amir Hozez

Publicado 2026-07-15
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Sarel Weinberger, Amir Hozez

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una agencia de detectives de alta tecnología donde tus detectives de IA superinteligentes (llamados "agentes de codificación") resuelven misterios leyendo archivos, ejecutando comandos y charlando contigo. Cada vez que leen un archivo o ejecutan un comando, recibes una factura de tu proveedor de la nube.

Durante mucho tiempo, todos pensaron que la mejor manera de ahorrar dinero era hacer que los detectives leyeran menos texto. La lógica era simple: "¡Si comprimimos los archivos que leen, reducimos el recuento de palabras y la factura baja!". Parecía un plan perfecto, como empacar una maleta exprimiendo todo el aire.

Pero este artículo, titulado "Token Reduction Is Not Cost Reduction" (La reducción de tokens no es reducción de costos), está aquí para decirnos que la analogía de la maleta es una trampa. Los autores realizaron un experimento masivo —más de 2,908 ejecuciones de detectives en 7 bases de código diferentes y 3 modelos de IA distintos— para ver qué sucede realmente con la factura.

Aquí está el giro que descubrieron: Reducir el texto no siempre reduce la factura. De hecho, a veces reducir el texto hace que la factura suba.

La sorpresa de la "Memoria en Caché"

El mayor impacto es hacia dónde va el dinero. Los autores desglosaron la factura y descubrieron que el 87% del costo reconstruido (y aproximadamente el 80% de la factura real) proviene de algo llamado "tráfico de caché de prompt".

Piensa en la memoria de la IA como una pizarra mágica y superrápida.

  • Escribir en la pizarra (Creación de Caché): Esto cuesta dinero, pero es una tarifa única.
  • Leer de la pizarra (Lectura de Caché): Esto es superbarato, como recibir un cupón de descuento.
  • Texto nuevo (Input no cacheado): Esta es la parte cara, pero es en realidad una porción diminuta del pastel (¡solo el 1.3% de la factura!).

Sin embargo, hay un costo oculto que la pizarra no muestra claramente. Los autores encontraron un "residuo no atribuido" del 8.7% en la factura que su desglose estándar no podía explicar. Este trozo sobrante no es aleatorio; escala directamente con cuánto se esfuerza la IA en pensar. En el modelo Haiku 4.5, cuanto más "esfuerzo de pensamiento" configures, más grande se vuelve esta factura misteriosa. Esto sugiere que, incluso cuando el texto parece pequeño, la IA podría estar realizando un trabajo mental costoso que no aparece en el recuento de tokens.

El problema es que cuando comprimes el texto, no solo estás ahorrando en la parte de "Nuevo texto". Podrías estar arruinando la parte de "Lectura de la pizarra". Si comprimes un archivo demasiado, la IA podría confundirse, olvidar lo que estaba haciendo y tener que volver a leer todo el historial de la conversación para entenderlo.

Cada vez que la IA tiene que releer ese historial, tiene que escribirlo en la pizarra de nuevo. ¡Y escribir es caro! Así que, incluso si ahorraste unas pocas palabras, obligaste a la IA a pagar la "tarifa de escritura" una y otra vez.

El "Recorte del 38%" que costó más

Los autores probaron un sistema de compresión sofisticado (llamado RTK-ML) que logró reducir el 38.4% del texto de salida de las herramientas. Pensarías que eso ahorraría una fortuna, ¿verdad?

Error.
En sus pruebas comparativas, este sistema en realidad aumentó el costo en un 6.8% (con un intervalo de confianza del 95% de [+2.8, +11.3]).

¿Por qué? Porque la compresión fue tan agresiva que la IA tuvo que dar pasos adicionales para resolver el problema. Tuvo que ejecutar turnos de diagnóstico adicionales, releer archivos y hacer más preguntas. Cada uno de esos pasos adicionales significaba retransmitir todo el historial de la conversación, lo que anuló cualquier ahorro de la compresión de texto.

El artículo descarta explícitamente la idea de que "menos tokens = menor costo". Encontraron que la relación entre cuánto texto eliminas y cuánto dinero ahorras es básicamente inexistente. La correlación fue un débil 0.15, lo cual está tan cerca de cero que es prácticamente el lanzamiento de una moneda.

El desastre del "Ancla Rota"

Hay otra forma en que la compresión puede ser contraproducente: puede romper las pistas que la IA necesita para hacer su trabajo.

Los autores realizaron una prueba especial en tareas de programación en Go. Descubrieron que cuando comprimían el texto, la IA a veces perdía los "anclajes de edición verbatim" —las líneas exactas, byte por byte, de código que necesitaba para copiar y pegar para corregir un error.

Imagina que intentas reparar una fuga en una tubería, pero las instrucciones que estás leyendo han sido tanto comprimidas que la parte específica que necesitas cortar es ahora una mancha borrosa. La IA intenta arreglarlo, pero el "parche" (la solución) no encaja porque las instrucciones fueron corrompidas.

  • Sin compresión: La IA aplicó con éxito 27 de 40 parches.
  • Con compresión: La IA solo logró aplicar 15 de 40.

En esta prueba específica, la versión comprimida no solo costó más por cada arreglo exitoso, sino que de hecho falló más veces. Los autores señalan que, aunque la versión comprimida parecía más barata por intento, el "costo por problema resuelto" fue en realidad el doble ($0.515 frente a $0.248) porque falló muchas veces.

El "Proxy de Caja Negra"

También probaron una herramienta diferente llamada Headroom, que actúa como un intermediario que reescribe los mensajes antes de que lleguen a la IA. Este fue un desastre total para la billetera. Hizo que el costo fuera un 48.4% más alto (con un IC del 95% de [+42.3, +55.0]) que no hacer nada en absoluto, sin mejorar las tasas de éxito.

La Conclusión

El artículo concluye que si quieres ahorrar dinero en agentes de codificación de IA, no puedes simplemente mirar un "contador de tokens" y asumir que estás ganando.

  • Lo que demostraron: En estas pruebas específicas y del mundo real, recortar el texto no redujo los costos de manera confiable. De hecho, para el sistema RTK-ML, hizo que fuera más caro. Para Headroom, lo hizo mucho más caro.
  • Lo que midieron: No solo adivinaron; rastrearon 2,908 ejecuciones reales con facturas reales que sumaban alrededor de $175.92 (solo para la campaña principal), más un 8.7% adicional de la factura que escala con el esfuerzo de pensamiento y que no pudo explicarse mediante los recuentos de tokens estándar.
  • Lo que sugieren: La única forma de saber si una herramienta de compresión funciona es medir la factura final por tarea exitosa, no el número de palabras eliminadas.

Así que, la próxima vez que alguien te diga: "¡Comprimimos los datos un 50% para ahorrarte dinero!", puedes sonreír y decir: "Genial, ¿pero revisaste si la IA tuvo que volver a leer todo el libro debido a ello?". Porque en el mundo de los agentes de IA, a veces el camino más corto es el más caro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →