← Últimos artículos
🤖 machine learning

Efficient On-Device Diffusion LLM Inference with Mobile NPU

Este artículo presenta llada.cpp, el primer marco de inferencia consciente de la NPU que acelera los modelos de lenguaje de difusión en dispositivos mediante el empleo de la decodificación especulativa de múltiples bloques, la revisión progresiva de doble vía y un tiempo de ejecución de memoria optimizado para el intercambio, con el fin de superar las limitaciones del hardware móvil y lograr una reducción de latencia de hasta 42 veces en comparación con las bases de CPU.

Autores originales: Tuowei Wang, Yanfan Sun, Ju Ren

Publicado 2026-06-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tuowei Wang, Yanfan Sun, Ju Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tu smartphone es una cocina con mucho movimiento, y el chef (la IA) está intentando escribir una historia.

El Problema: El Chef Lento que Trabaja Palabra por Palabra

Tradicionalmente, los modelos de IA (como los de tu teléfono) escriben historias una palabra a la vez. Es como un chef que debe picar una cebolla, luego esperar a que la estufa se caliente, luego picar una zanahoria, y luego esperar de nuevo. Incluso si la estufa es potente, el chef se ve obligado a trabajar despacio porque solo puede hacer una cosa a la vez. Esto hace que generar textos largos en un teléfono se sienta lento y agote la batería.

La Nueva Idea: El Chef de "Difusión"

Un nuevo tipo de IA, llamado Modelo de Lenguaje de Difusión (dLLM), intenta ser diferente. En lugar de escribir una palabra a la vez, comienza con una página entera de "ruido" (palabrería aleatoria) e intenta limpiarla para convertirla en una oración real de un solo golpe. Es como un chef que lanza un montón de ingredientes sobre el mostrador e intenta organizarlos en una ensalada perfecta simultáneamente.

Esto suena genial porque utiliza el "NPU" (Unidad de Procesamiento Neuronal) de tu teléfono mucho mejor; un chip especializado diseñado para cálculos masivos y paralelos. Sin embargo, hay un inconveniente:

  1. El Probleo de la "Sartén Vacía": A medida que el chef se acerca a terminar la ensalada, quedan menos ingredientes que arreglar. El potente NPU termina esperando sin hacer nada porque no hay suficiente trabajo por hacer, desperdiciando su velocidad.
  2. El Problema del "¡Uy, Cambio de Opinión!": A veces el chef organiza una palabra, pero luego se da cuenta de que: "Espera, esto no encaja con la siguiente frase". La IA tiene que volver atrás y arreglarlo. Hacer esto en el rápido NPU es desordenado y ralentiza todo.
  3. El Probleo de la "Nevera Pequeña": El NPU tiene una "nevera" (memoria) muy pequeña y especial donde guarda los ingredientes listos para cocinar. Si la receta es demasiado grande, el chef tiene que estar intercambiando constantemente ingredientes dentro y fuera de esta pequeña nevera, lo que toma mucho tiempo y desperdicia energía.

La Solución: llada.cpp

Los autores construyeron un nuevo sistema llamado llada.cpp para solucionar estos tres problemas. Piensa en ello como un nuevo conjunto de reglas de cocina que permite al chef usar su potente NPU de manera eficiente.

1. Decodificación Especulativa de Bloques Múltiples: "Echar un vistazo a la Próxima Receta"

La Analogía: Imagina que el chef está terminando la ensalada actual (Bloque A), pero el NPU se está aburriendo porque solo queda una hoja por picar. En lugar de esperar, el sistema dice: "Oye, empecemos a preparar los ingredientes para la próxima ensalada (Bloque B) ahora mismo, por si acaso".
Cómo funciona: Aunque el bloque actual no esté terminado al 100%, el sistema comienza a trabajar sigilosamente en las palabras futuras. Esto mantiene al potente NPU ocupado y totalmente utilizado, para que no se quede inactivo. Si las palabras futuras resultan ser correctas, ¡genial! Si no, el sistema simplemente las descarta y continúa.

2. Revisión Progresiva de Doble Vía: "El Carril Rápido vs. El Carril Lento"

La Analogía: El NPU es un coche de carreras de Fórmula 1: es increíblemente rápido pero no puede tomar bien las curvas. La CPU es un SUV confiable y lento: es excelente para realizar ajustes pequeños y complicados.
Cómo funciona: Cuando la IA está segura de una palabra, el NPU la mantiene. Pero si la IA tiene dudas y necesita "cambiar de opinión" sobre una palabra, llada.cpp no detiene al coche de carreras rápido del NPU. En su lugar, envía silenciosamente el trabajo de "reparación" a la CPU, que es un SUV más lento y flexible, en segundo plano. El NPU sigue corriendo hacia adelante con las nuevas palabras mientras la CPU arregla tranquilamente las anteriores.

3. Tiempo de Ejecución de Memoria Optimizado para el Intercambio: "La Despensa Organizada"

La Analogía: La nevera pequeña del NPU es tan pequeña que, si solo lanzas los ingredientes al azar, pasas todo el tiempo abriendo y cerrando la puerta para intercambiar cosas.
Cómo funciona: llada.cpp actúa como un súper gestor de despensa muy organizado. Observa toda la receta con antelación y determina exactamente qué ingredientes deben estar en la nevera justo ahora y cuáles pueden esperar. También prepara el siguiente lote de ingredientes mientras el chef está cocinando actualmente, para que la puerta nunca esté cerrada por mucho tiempo. Esto elimina el "tiempo de espera" causado por el movimiento de datos.

Los Resultados

Los autores probaron esto en teléfonos inteligentes reales (como el OnePlus Ace5 Pro).

  • Velocidad: Descubrieron que llada.cpp hizo que la IA fuera de 17 a 42 veces más rápida que la forma antigua de hacerlo en un teléfono.
  • Calidad: Las historias escritas fueron tan buenas como antes; la velocidad no se logró a costa de la precisión.
  • Batería: Debido a que el NPU terminó el trabajo rápidamente y no tuvo que quedarse inactivo, el teléfono utilizó menos energía en total.

En resumen, llada.cpp es un gestor inteligente que enseña al IA de tu teléfono cómo usar su cerebro súper rápido (el NPU) sin quedarse atrapado en el tráfico, haciendo que la IA móvil se sienta instantánea y receptiva.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →