← Últimos artículos
🤖 AI

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

Este estudio presenta "Local-Splitter", una herramienta de código abierto que evalúa sistemáticamente siete tácticas para reducir el uso de tokens en la nube mediante un modelo local de triaje, demostrando que la combinación óptima de estrategias (como enrutamiento local y compresión de prompts) puede ahorrar entre un 45% y un 79% de tokens en cargas de trabajo de agentes de codificación, dependiendo del tipo de tarea.

Autores originales: Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente de programación muy inteligente, pero que cobra por cada palabra que dice. Este asistente es como un "genio de la nube" (una IA gigante) que puede resolver problemas complejos, pero es caro y lento si le pides cosas sencillas.

Por otro lado, tienes un asistente local en tu propia computadora. Es más pequeño, más rápido y gratis, pero no es tan brillante como el genio de la nube.

El problema es que, hasta ahora, cuando pedías ayuda a tu computadora, le enviabas todo el trabajo al genio de la nube, incluso las preguntas tontas que tu asistente local podría haber resuelto. ¡Era como enviar un camión de mudanzas para comprar un solo helado!

Este artículo presenta "Local-Splitter", una herramienta nueva que actúa como un recepcionista o portero muy astuto en la puerta de tu oficina. Su trabajo es decidir: "¿Esto lo resuelve mi asistente local (gratis) o necesito llamar al genio de la nube (pagando)?".

El equipo probó 7 trucos diferentes para hacer que este portero sea más eficiente y ahorrar dinero. Aquí te explico cómo funcionan con analogías sencillas:

Los 7 Trucos del Portero (Las Tácticas)

  1. El Filtro Rápido (Enrutamiento Local):

    • La analogía: Imagina que el portero lee tu nota. Si es algo simple como "¿Cómo se escribe 'hola'?", el portero lo resuelve él mismo y ni siquiera lo envía al genio. Solo envía las preguntas difíciles.
    • Resultado: Ahorra muchísimo dinero porque evita llamadas innecesarias.
  2. El Resumidor (Compresión de Pistas):

    • La analogía: Antes de enviar una pregunta al genio, el portero la reescribe. En lugar de decir: "Hola, soy Juan, tengo un problema con el código que escribí ayer que es muy largo y aquí está todo el texto...", el portero dice: "Problema: Error en línea 50 del archivo X".
    • Resultado: El genio lee menos palabras y cobra menos.
  3. La Libreta de Recuerdos (Caché Semántico):

    • La analogía: Si alguien pregunta "¿Qué hace este archivo?" y el portero ya respondió eso hace 5 minutos, no vuelve a llamar al genio. Solo mira en su libreta y dice: "Ya sé la respuesta, aquí está".
    • Resultado: Cero costo si la pregunta se repite.
  4. El Borrador y Revisión (Redacción Local con Revisión en la Nube):

    • La analogía: En lugar de pedirle al genio que escriba un ensayo desde cero, el portero local escribe un borrador rápido y le pide al genio: "¿Puedes corregir solo los errores de este borrador?".
    • Resultado: Es más barato corregir que escribir todo de nuevo, pero solo funciona si el borrador local es decente.
  5. El Recorte de Tijera (Ediciones Mínimas):

    • La analogía: Si pides cambiar una sola línea de código, no le envías al genio todo el libro de 1000 páginas. El portero le envía solo la página y la línea que toca cambiar.
    • Resultado: Se envía mucha menos información.
  6. El Traductor de Intenciones (Extracción Estructurada):

    • La analogía: Los humanos hablan con rodeos: "Oye, podría ser genial si pudieras ayudarme a ver por qué no funciona esto...". El portero traduce eso a: "INTENTO: Arreglar error. OBJETIVO: Código X".
    • Resultado: Elimina las palabras de relleno y va directo al grano.
  7. El Grupo de Compras (Agrupación y Caché del Proveedor):

    • La analogía: Si haces 5 preguntas rápidas en 1 segundo, el portero las junta en una sola llamada en lugar de hacer 5 llamadas separadas. Además, aprovecha descuentos que ofrecen las empresas de IA si envías partes repetidas del mensaje.
    • Resultado: Menos gastos administrativos y mejores precios.

¿Qué descubrieron? (Las Conclusiones)

El hallazgo más importante es que no existe una solución mágica para todo. No puedes activar los 7 trucos a la vez y esperar que funcione perfecto en todas las situaciones.

  • Para tareas de edición (cambiar código): Lo mejor es usar el Filtro Rápido (T1) y el Resumidor (T2). Juntos ahorran entre un 45% y un 79% de dinero.
  • Para tareas de lectura (explicar código): El Filtro Rápido es el rey.
  • Para tareas con mucha información (RAG): Aquí sí vale la pena usar el truco del Borrador y Revisión (T4), porque el genio tiene que escribir mucho y corregir un borrador es más barato que escribir desde cero.

La lección principal:
Si eres una empresa o un desarrollador, no actives todos los interruptores al máximo. Primero, mira qué tipo de trabajo hace tu asistente.

  • Si hace muchas ediciones pequeñas: Usa el Filtro y el Resumidor.
  • Si hace muchas explicaciones largas: Usa el Filtro, el Resumidor y el Borrador.

En resumen

Local-Splitter es como un gerente de oficina inteligente que sabe cuándo delegar tareas a un becario (tu computadora local) y cuándo llamar al experto (la nube). Al hacerlo, las empresas de herramientas de programación pueden ahorrar una fortuna en facturas de IA, sin perder calidad en las respuestas.

El equipo ha liberado el código para que cualquiera pueda usar este "portero" y empezar a ahorrar dinero hoy mismo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →