← Últimos artículos
🤖 machine learning

Lever: Speculative LLM Inference on Smartphones

Este artículo presenta Lever, un sistema de extremo a extremo que optimiza la decodificación especulativa en las etapas de borrador, verificación y ejecución para habilitar una inferencia eficiente y de baja latencia de modelos de lenguaje grandes en teléfonos inteligentes, aprovechando el almacenamiento flash y las limitaciones del hardware móvil.

Autores originales: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La "Maleta Pesada" en una "Bicicleta"

Imagina que quieres cruzar un país en bicicleta (tu teléfono inteligente). Tienes una maleta muy pesada y de alta calidad (un modelo de lenguaje grande o LLM potente) que contiene todo el conocimiento que necesitas.

  • El Problema: La bicicleta tiene una canasta diminuta (la memoria rápida del teléfono, o DRAM). No puede contener toda la maleta.
  • La Solución Actual: Tienes que mantener la maleta en el maletero (el almacenamiento flash lento del teléfono). Cada vez que necesitas dar un paso (generar una palabra), debes detenerte, abrir el maletero, sacar la página específica que necesitas, leerla y volver a guardarla. Este "parar y avanzar" es increíblemente lento. Es como intentar pedalear una bicicleta mientras constantemente te detienes a revolver el maletero.

La Idea: "Adivinar" para Ahorrar Tiempo

El artículo presenta un sistema llamado Lever. Utiliza un truco llamado Decodificación Especulativa.

Piénsalo como un Juego de Adivinanzas:

  1. El Pequeño Asistente (Modelo Borrador): Tienes un asistente pequeño y rápido sentado en la canasta de la bicicleta (en la memoria rápida). Este asistente es bueno adivinando qué viene a continuación.
  2. El Jefe Grande (Modelo Objetivo): La maleta pesada en el maletero es el "Jefe Grande". Es muy inteligente pero lento de acceder.
  3. La Estrategia: En lugar de pedirle al Jefe Grande una palabra a la vez, el Pequeño Asistente adivina rápidamente una frase completa (o un árbol de frases posibles). Luego, solo abres el maletero una vez para preguntarle al Jefe Grande: "¿Adiviné bien estas predicciones?".

Si el Jefe Grande dice: "Sí, las primeras tres palabras son correctas", obtienes tres palabras por el precio de un solo viaje al maletero. Esto ahorra una cantidad masiva de tiempo.

Los Tres Obstáculos (y Cómo Lever los Resuelve)

Los autores se dieron cuenta de que, aunque esta idea de "adivinar" funciona muy bien en servidores potentes, falla en los teléfonos por tres razones específicas. Así es como Lever las soluciona:

1. El Dilema del "Tamaño del Árbol" (Redacción)

  • El Problema: Si el Pequeño Asistente adivina muy pocas palabras, aún tienes que abrir el maletero con demasiada frecuencia. Si adivina demasiadas, el cerebro del teléfono se satura intentando verificar todas esas predicciones y se vuelve lento.
  • La Solución de Lever: Lever actúa como un jardinero inteligente. No simplemente hace crecer un arbusto aleatorio de predicciones. Calcula cuidadosamente: "¿Vale la pena el esfuerzo de esta rama de predicciones?". Solo hace crecer ramas que es probable que sean aceptadas y que no cuesten demasiada energía verificar. Construye un árbol de predicciones de "tamaño perfecto" que equilibra velocidad y precisión.

2. El Problema del "Esfuerzo Desperdiciado" (Verificación)

  • El Problema: Incluso con un buen árbol, el Jefe Grande podría tener que verificar una rama que resulta ser incorrecta. En un teléfono, verificar una rama incorrecta es un desperdicio de batería y tiempo preciosos.
  • La Solución de Lever: Lever instala un policía de tráfico (un predictor ligero) a mitad del proceso de pensamiento del Jefe Grande. Antes de que el Jefe Grande termine de leer toda la frase, el policía de tráfico examina las pistas y dice: "Oye, esta rama parece incorrecta; ¡deja de verificarla!". Esto evita que el teléfono realice trabajo innecesario, pero es lo suficientemente cuidadoso como para nunca descartar una respuesta correcta.

3. El Problema de la "Incompatibilidad de Herramientas" (Ejecución)

  • El Problema: Los teléfonos inteligentes tienen diferentes tipos de "cerebros" (CPU y NPU). La NPU es excelente para hacer matemáticas para muchas cosas a la vez, pero odia realizar tareas extrañas e irregulares. Los juegos de adivinanzas a menudo son irregulares.
  • La Solución de Lever: Lever actúa como un gerente de proyectos inteligente. Sabe cuándo usar la NPU rápida y cuándo usar la CPU flexible.
    • Agrupa predicciones similares para que la NPU pueda trabajar en ellas de manera eficiente (como una línea de montaje de fábrica).
    • Deja la "toma de decisiones" final (averiguar qué palabra elegir realmente) para la CPU, de modo que la NPU no desperdicie energía calculando respuestas para caminos que nunca se usarán.

Los Resultados

El artículo probó Lever en teléfonos inteligentes reales (como el OnePlus 12) con diversos modelos de IA.

  • Comparado con la forma antigua (abrir el maletero por cada palabra individual): Lever es 2.93 veces más rápido.
  • Comparado con otros métodos de adivinanzas diseñados para servidores: Lever es 1.50 veces más rápido.

La Conclusión

Lever es un sistema que permite que tu teléfono ejecute enormes modelos de IA inteligentes sin congelarse. Lo hace utilizando un modelo pequeño y rápido de "adivinanzas" para realizar el trabajo pesado, mientras gestiona cuidadosamente el modelo lento y pesado de "verificación" para que no desperdicie tiempo ni batería. Convierte un proceso lento y de parar y avanzar en un viaje suave y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →