← Últimos artículos
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

Este artículo presenta AHASD, una arquitectura móvil heterogénea asíncrona a nivel de tarea que aprovecha la colaboración NPU-PIM con mecanismos de control novedosos para lograr mejoras de hasta 4.2×\times en el rendimiento y 5.6×\times en la eficiencia energética para la decodificación especulativa en modelos de lenguaje grandes en comparación con las líneas base existentes.

Autores originales: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia larga, pero tienes una regla estricta: debes pedirle a un editor muy sabio, lento y costoso (el Modelo Objetivo) que revise cada palabra que escribas antes de poder escribir la siguiente. Esto hace que escribir sea increíblemente lento.

Para acelerar las cosas, contratas a un asistente rápido y enérgico (el Modelo Borrador) para que adivine las siguientes palabras por ti. Escribes estas conjeturas y luego el editor sabio las revisa todas a la vez. Si las conjeturas son buenas, las conservas y continúas. Si son malas, las desechas y comienzas de nuevo. Esto se llama Decodificación Especulativa.

Sin embargo, en un teléfono móvil, este proceso tiene dos grandes problemas:

  1. El "Juego de Espera": A veces el asistente adivina 2 palabras, a veces 20. Si el asistente es lento, el editor se queda inactivo esperando. Si el asistente es rápido, el editor se queda inactivo esperando el siguiente lote. Están constantemente tomados de la mano, esperando a que el otro termine, lo cual desperdicia tiempo.
  2. El Problema de la "Mala Conjetura": A veces el asistente se vuelve demasiado confiado y adivina un párrafo entero de sinsentidos porque el contexto es complicado. El editor tiene que rechazar todo el bloque, desperdiciando toda la energía que el asistente gastó en adivinar.

El artículo introduce AHASD, un nuevo sistema diseñado para solucionar estos problemas en teléfonos móviles utilizando un tipo especial de chip informático llamado PIM (Procesamiento en Memoria) y un chip de IA estándar llamado NPU.

Así funciona AHASD, usando analogías simples:

1. La "Baila Desincronizada" (Ejecución Asíncrona a Nivel de Tarea)

En los sistemas antiguos, el asistente y el editor tenían que bailar al unísono perfecto. Si el asistente se detenía, el editor se detenía.
AHASD rompe la cadena. Permite que el asistente (ejecutándose en el chip de memoria, PIM) y el editor (ejecutándose en el procesador, NPU) trabajen de forma independiente.

  • La Analogía: Imagina una línea de montaje de fábrica. En lugar de que el trabajador espere a que la máquina termine para comenzar el siguiente paso, el trabajador sigue tomando nuevas piezas de un contenedor (la cola) y trabajando en ellas mientras la máquina aún procesa el lote anterior. No esperan el uno al otro; simplemente mantienen la línea en movimiento. Esto elimina el "tiempo de inactividad" donde un dispositivo se queda sentado sin hacer nada.

2. El "Radar de Confianza" (Redacción Consciente de la Entropía-Historia)

El asistente a veces se vuelve demasiado confiado y comienza a adivinar sin control cuando debería ser cauteloso.
AHASD le da al asistente un "Radar de Confianza". Examina la historia de sus conjeturas recientes.

  • La Analogía: Piensa en un pronosticador del tiempo. Si ha estado equivocado sobre la lluvia durante los últimos tres días, deja de predecir lluvia para el día siguiente, incluso si las nubes se ven similares. De manera similar, si las conjeturas del asistente tienen baja "confianza" (alta entropía), el sistema le dice: "¡Deja de adivinar adelante! Espera a que el editor confirme la palabra actual antes de adivinar la siguiente". Esto evita que el asistente desperdicie energía en conjeturas que definitivamente serán desechadas.

3. El "Temporizador Inteligente" (Pre-verificación Consciente del Tiempo)

A veces el asistente termina su trabajo, pero el editor aún está ocupado. El asistente podría comenzar a adivinar de nuevo, pero si adivina demasiado, el editor podría quedarse sin trabajo que revisar y quedarse inactivo.
AHASD utiliza un "Temporizador Inteligente" para decidir exactamente cuándo el asistente debe pausar y realizar una rápida "mini-verificación" (pre-verificación) por su cuenta.

  • La Analogía: Imagina a un chef (el asistente) picando verduras mientras un sous-chef (el editor) cocina una salsa. El chef sabe exactamente cuánto tardará la salsa. Si el chef ve que la salsa estará lista en 5 segundos, el chef deja de picar y realiza una rápida prueba de sabor (pre-verificación) en las verduras para asegurarse de que estén listas. Esto asegura que el sous-chef tenga verduras frescas listas en el momento en que la salsa esté lista, para que el sous-chef nunca tenga que estar de pie esperando.

Los Resultados

Los autores construyeron una simulación de este sistema en un chip de teléfono móvil. Descubrieron que:

  • Velocidad: Es hasta 4.2 veces más rápido que usar solo una tarjeta gráfica estándar (GPU) y 1.5 veces más rápido que intentos anteriores de mezclar chips móviles con procesamiento en memoria.
  • Duración de la Batería: Es hasta 5.6 veces más eficiente energéticamente que una GPU estándar y 1.24 veces mejor que el mejor sistema móvil anterior.
  • Costo: Todas estas nuevas y sofisticadas características ocupan solo alrededor del 3% del espacio adicional en el chip de memoria, lo cual es un precio muy pequeño a pagar por un aumento tan grande en la velocidad.

En resumen, AHASD es como darle a la IA de tu teléfono un equipo de trabajadores que dejan de esperar el uno al otro, verifican su propia confianza antes de adivinar y sincronizan sus pausas perfectamente para mantener el trabajo fluyendo suavemente sin desperdiciar energía de la batería.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →