← Últimos artigos
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

Este artigo apresenta o AHASD, uma arquitetura móvel heterogênea assíncrona em nível de tarefa que aproveita a colaboração NPU-PIM com mecanismos de controle inovadores para alcançar ganhos de até 4,2×\times em vazão e 5,6×\times em eficiência energética para decodificação especulativa em modelos de linguagem grandes, em comparação com as bases existentes.

Autores originais: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Publicado 2026-04-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando escrever uma história longa, mas tem uma regra estrita: você deve pedir a um editor muito sábio, lento e caro (o Modelo Alvo) que verifique cada palavra que você escreve antes de poder escrever a próxima. Isso torna a escrita incrivelmente lenta.

Para acelerar as coisas, você contrata um assistente rápido e energético (o Modelo de Rascunho) para adivinhar as próximas palavras para você. Você anota essas suposições e, em seguida, o editor sábio as verifica todas de uma vez. Se as suposições forem boas, você as mantém e segue em frente. Se forem ruins, você as descarta e recomeça. Isso é chamado de Decodificação Especulativa.

No entanto, em um telefone celular, esse processo tem dois grandes problemas:

  1. O "Jogo de Espera": Às vezes o assistente adivinha 2 palavras, às vezes 20. Se o assistente for lento, o editor fica ocioso esperando. Se o assistente for rápido, o editor fica ocioso esperando o próximo lote. Eles estão constantemente de mãos dadas, esperando um pelo outro terminar, o que desperdiça tempo.
  2. O Problema da "Má Adivinhação": Às vezes o assistente fica excessivamente confiante e adivinha um parágrafo inteiro de nonsense porque o contexto é complicado. O editor tem que rejeitar tudo, desperdiçando toda a energia que o assistente gastou adivinhando.

O artigo apresenta AHASD, um novo sistema projetado para resolver esses problemas em telefones celulares usando um tipo especial de chip de computador chamado PIM (Processamento em Memória) e um chip de IA padrão chamado NPU.

Veja como o AHASD funciona, usando analogias simples:

1. A "Dança Dessincronizada" (Execução Assíncrona no Nível de Tarefa)

Em sistemas antigos, o assistente e o editor tinham que dançar em perfeita sincronia. Se o assistente parasse, o editor parava.
O AHASD rompe a corrente. Ele permite que o assistente (rodando no chip de memória, PIM) e o editor (rodando no processador, NPU) trabalhem independentemente.

  • A Analogia: Imagine uma linha de montagem de fábrica. Em vez de o trabalhador esperar a máquina terminar antes de começar a próxima etapa, o trabalhador continua pegando novas peças de uma caixa (a fila) e trabalhando nelas enquanto a máquina ainda está processando o lote anterior. Eles não esperam um pelo outro; apenas mantêm a linha em movimento. Isso elimina o "tempo ocioso" em que um dispositivo fica parado sem fazer nada.

2. O "Radar de Confiança" (Rascunho Consciente de Entropia-História)

O assistente às vezes fica muito confiante e começa a adivinhar de forma descontrolada quando deveria ser cauteloso.
O AHASD dá ao assistente um "Radar de Confiança". Ele analisa o histórico de suas suposições recentes.

  • A Analogia: Pense em um meteorologista. Se ele errou sobre a chuva nos últimos três dias, ele para de prever chuva para o dia seguinte, mesmo que as nuvens pareçam semelhantes. Da mesma forma, se as suposições do assistente tiverem baixa "confiança" (alta entropia), o sistema diz a ele: "Pare de adivinhar adiante! Espere o editor confirmar a palavra atual antes de adivinhar a próxima." Isso impede que o assistente desperdice energia com suposições que certamente serão descartadas.

3. O "Timer Inteligente" (Pré-verificação Consciente de Tempo)

Às vezes o assistente termina seu trabalho, mas o editor ainda está ocupado. O assistente pode começar a adivinhar novamente, mas se adivinhar demais, o editor pode ficar sem trabalho para verificar e ficar ocioso.
O AHASD usa um "Timer Inteligente" para decidir exatamente quando o assistente deve pausar e fazer uma rápida "mini-verificação" (pré-verificação) por conta própria.

  • A Analogia: Imagine um chef (o assistente) picando vegetais enquanto um sous-chef (o editor) está cozinhando um molho. O chef sabe exatamente quanto tempo o molho levará. Se o chef vir que o molho estará pronto em 5 segundos, ele para de picar e faz um teste de sabor rápido (pré-verificação) nos vegetais para garantir que estejam prontos. Isso garante que o sous-chef tenha vegetais frescos prontos no momento em que o molho estiver pronto, para que o sous-chef nunca precise ficar parado esperando.

Os Resultados

Os autores construíram uma simulação desse sistema em um chip de telefone celular. Eles descobriram que:

  • Velocidade: É até 4,2 vezes mais rápido do que usar apenas uma placa gráfica padrão (GPU) e 1,5 vezes mais rápido do que tentativas anteriores de misturar chips móveis com processamento de memória.
  • Duração da Bateria: É até 5,6 vezes mais eficiente em energia do que uma GPU padrão e 1,24 vezes melhor do que o melhor sistema móvel anterior.
  • Custo: Todas essas novas funcionalidades sofisticadas ocupam apenas cerca de 3% do espaço extra no chip de memória, o que é um preço muito pequeno a pagar por um aumento tão grande de velocidade.

Em resumo, o AHASD é como dar à IA do seu telefone uma equipe de trabalhadores que param de esperar um pelo outro, verificam sua própria confiança antes de adivinhar e sincronizam suas pausas perfeitamente para manter o trabalho fluindo suavemente sem desperdiçar energia da bateria.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →