Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM
Este trabalho apresenta um framework hardware-otimizado que permite a execução eficiente de um modelo fundamental LLaMA multilíngue com múltiplos LoRAs em dispositivos móveis Samsung Galaxy S24 e S25, alcançando acelerações significativas de latência e redução de memória através de técnicas como decodificação multi-stream e Decodificação Auto-Especulativa Dinâmica (DS2D).
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um cérebro gigante (um modelo de Inteligência Artificial) que sabe falar 9 idiomas e fazer 8 tarefas diferentes, como escrever e-mails, corrigir textos, mudar o tom da conversa (de formal para engraçado) e resumir notícias.
O problema é que esse cérebro é enorme. Ele é do tamanho de uma biblioteca inteira. Tentar colocar essa biblioteca inteira dentro do seu celular (que tem pouco espaço e bateria limitada) é como tentar levar uma floresta inteira dentro de uma mochila de escola: impossível.
Este artigo da Samsung conta a história de como eles conseguiram encontrar uma maneira de levar essa "floresta" inteira dentro do Galaxy S24 e S25, sem precisar de internet e sem deixar o celular lento. Eles usaram três "truques de mágica":
1. O Truque do "Chapéu Mágico" (Multi-LoRA)
Normalmente, para o cérebro fazer tarefas diferentes, você precisaria de versões diferentes dele. Uma versão para escrever e-mails, outra para corrigir textos, etc. Isso ocuparia muito espaço.
Os pesquisadores criaram um cérebro único e congelado (a base) e inventaram 8 "chapéus" diferentes (chamados LoRA).
- Como funciona: O cérebro é o mesmo. Quando você quer escrever um e-mail formal, você coloca o "chapéu formal" na cabeça dele. Quando quer uma resposta engraçada, você troca pelo "chapéu engraçado".
- A mágica: O celular não precisa carregar 8 cérebros diferentes. Ele carrega apenas um, e troca o chapéu instantaneamente, sem precisar reiniciar ou recarregar nada. É como ter um ator que sabe fazer 8 personagens diferentes, e você só muda a peruca dele na frente do palco, sem precisar trocar de ator.
2. O Truque da "Fábrica de Respostas em Paralelo" (Geração Concorrente)
Imagine que você pediu ao seu assistente: "Me dê 3 opções de resposta para este e-mail: uma formal, uma amigável e uma curta".
- O jeito antigo: O assistente escreveria a formal, pararia, apagaria, escreveria a amigável, pararia, apagaria, e escreveria a curta. Isso demoraria 3 vezes mais.
- O jeito novo (Concorrente): O assistente escreve as 3 respostas ao mesmo tempo, como se fossem 3 linhas de produção em uma fábrica. Eles compartilham a mesma "memória" (o que já foi escrito) e só divergem no final.
- Resultado: O celular gera 8 variações de estilo em um único piscar de olhos, economizando muito tempo e bateria.
3. O Truque do "Adivinhador Rápido" (Decodificação Especulativa)
Modelos de IA normalmente pensam palavra por palavra, muito devagar. "Pense na palavra 1... pense na palavra 2...".
- A inovação: Eles ensinaram o modelo a adivinhar o futuro. Em vez de pensar apenas na próxima palavra, ele olha para frente e chuta: "Provavelmente a próxima frase será 'Olá, como você está?'".
- A verificação: O modelo chuta 3 ou 4 palavras de uma vez. Se o chute estiver certo (o que acontece na maioria das vezes), ele pula direto para a palavra final. Se errar, ele corrige.
- Resultado: É como se o modelo tivesse um "superpoder" de ler várias páginas de uma vez, em vez de ler linha por linha. Isso deixou a geração de texto até 2,3 vezes mais rápida.
O Resultado Final?
Com esses truques, combinados com uma técnica de "compactar" o cérebro (reduzindo o tamanho dos números que ele usa, como transformar uma foto em 4K em uma imagem leve de 4 bits, mas mantendo a qualidade), eles conseguiram:
- Velocidade: O celular responde muito rápido, mesmo sem internet.
- Memória: O modelo cabe na memória do celular sem travar.
- Privacidade: Tudo acontece no seu aparelho. Nada é enviado para a nuvem.
Em resumo: A Samsung conseguiu transformar um "monstro" de Inteligência Artificial, que antes só cabia em servidores gigantes, em um "super-assistente" que vive no seu bolso, pronto para mudar de personalidade e idioma instantaneamente, sem gastar sua bateria. É como ter um assistente pessoal que é ao mesmo tempo um tradutor, um editor de texto e um comediante, tudo rodando silenciosamente no seu bolso.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.