← Últimos artículos
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

Este artículo presenta LlamaWeb, un backend WebGPU para llama.cpp que logra inferencia de LLM eficiente en memoria, portátil en rendimiento y de múltiples precisiones en navegadores mediante la utilización de planificación de memoria estática, una biblioteca de kernels ajustable y kernels GPU plantillados, lo que resulta en un uso de memoria significativamente reducido y un mayor rendimiento de decodificación en comparación con los marcos existentes en hardware diverso.

Autores originales: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Publicado 2026-05-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres ejecutar un asistente de IA súper inteligente (un Modelo de Lenguaje Grande, o LLM) directamente dentro de tu navegador web, como Chrome o Safari. Por lo general, estos cerebros de IA son tan enormes y demandantes de memoria que requieren servidores masivos y costosos para funcionar. El objetivo de este artículo es reducir ese gigante cerebral para que quepa en tu portátil o teléfono sin bloquear tu navegador, manteniéndolo al mismo tiempo rápido y privado.

Los autores construyeron una nueva herramienta llamada LlamaWeb. Piensa en ella como un "traductor" especializado que permite que el popular motor de IA llama.cpp hable el lenguaje de los navegadores web (específicamente una tecnología llamada WebGPU).

Así es como resolvieron los tres problemas más grandes, utilizando algunas analogías cotidianas:

1. El Problema de la Memoria: "El Camión de Mudanza vs. La Lista de Empaque"

El Problema: Las herramientas de IA existentes en navegadores eran como una empresa de mudanzas caótica. Seguíamos agarrando nuevas cajas (memoria) a medida que avanzaban, a veces agarrando demasiadas, lo que provocaba que el navegador se bloqueara o se volviera extremadamente lento. También hacían copias innecesarias de los muebles (pesos del modelo) antes de moverlos.

La Solución de LlamaWeb:

  • Planificación Estática: En lugar de agarrar cajas sobre la marcha, LlamaWeb examina toda la casa antes de que llegue el camión y calcula exactamente cuántas cajas necesita. Empaqueta todo en un único "área de memoria" predimensionada desde el principio. Ya no hay que agarrar cajas extra a mitad de la mudanza.
  • Carga Directa: En lugar de descargar los muebles en la entrada (memoria de la CPU) y luego cargarlos en el camión (memoria de la GPU), LlamaWeb carga los muebles directamente desde el almacén al camión.
  • El Resultado: Descubrieron que LlamaWeb utiliza un 29–33% menos de memoria que sus competidores. Es como meter todo un salón en una furgoneta que anteriormente solo podía contener un sofá.

2. El Problema del Rendimiento: "El Mando Universal vs. El Mando Personalizado"

El Problema: Internet está lleno de diferentes computadoras: algunas tienen tarjetas gráficas NVIDIA, otras chips de Apple, algunas están en teléfonos y otras en portátiles. Las herramientas existentes eran como un "mando universal" que intentaba funcionar con todo, pero no utilizaba los botones especiales de ningún televisor específico, lo que resultaba en un rendimiento lento.

La Solución de LlamaWeb:

  • Kernels Ajustables: LlamaWeb es como un mando inteligente que puede reprogramarse a sí mismo. Al iniciar, verifica qué tipo de "televisor" (hardware) está ejecutando. Si está en una potente tarjeta NVIDIA, utiliza funciones de "subgrupo" de alta velocidad. Si está en un teléfono, cambia a un modo más eficiente.
  • El Resultado: En cuatro tipos diferentes de tarjetas gráficas, LlamaWeb fue un 45–69% más rápido generando texto (decodificando) que otras herramientas de navegador. No es solo un mando universal; es un mando que sabe exactamente cómo obtener la mejor imagen de tu televisor específico.

3. El Problema del Formato: "El Cuchillo Suizo"

El Problema: Los desarrolladores de IA están inventando constantemente nuevas formas de comprimir los modelos de IA (llamadas "cuantización") para hacerlos más pequeños. Algunos son de 4 bits, otros de 8 bits, otros de 1 bit. Las herramientas antiguas eran como un destornillador que solo encajaba en un tipo de tornillo. Si salía un nuevo tornillo, la herramienta era inútil.

La Solución de LlamaWeb:

  • Kernels Plantilla: LlamaWeb está construido como un cuchillo suizo. Tiene un sistema de "plantilla" que puede cambiar instantáneamente la cabeza de la herramienta para que encaje con cualquier tornillo (formato de cuantización) sin necesidad de reconstruir todo el cuchillo.
  • El Resultado: Soporta 23 formatos de pesos diferentes, mientras que los competidores solo soportaban 6 o 7. Esto significa que si un desarrollador inventa mañana un nuevo método de compresión súper eficiente, LlamaWeb probablemente pueda ejecutarlo inmediatamente sin necesidad de una actualización de software.

Los Resultados Generales

El equipo probó esto en 16 dispositivos diferentes de 8 fabricantes distintos (incluyendo NVIDIA, Apple, Intel, AMD y chips móviles).

  • Memoria: Ahorró una cantidad masiva de RAM, evitando bloqueos en dispositivos con memoria limitada (como iPhones).
  • Velocidad: Fue significativamente más rápido que otras herramientas de IA basadas en navegadores.
  • Versatilidad: Puede ejecutar casi cualquier modelo que la comunidad de llama.cpp soporte, que es una enorme biblioteca de más de 177.000 modelos.

Una Advertencia: Aunque LlamaWeb es un campeón generando texto palabra por palabra (la fase de "decodificación"), actualmente es un poco más lento leyendo el prompt inicial (la fase de "prellenado") en comparación con algunos competidores. Sin embargo, los autores señalan que a medida que mejore la tecnología de los navegadores, esta brecha debería cerrarse.

En resumen, LlamaWeb es un nuevo motor que hace posible ejecutar IA potente en tu navegador, de forma privada y eficiente, asegurando que tu computadora no se derrita mientras chateas con una IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →