← Últimos artigos
💻 computer science

Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

Este trabalho apresenta um framework hardware-otimizado que permite a execução eficiente de um modelo fundamental LLaMA multilíngue com múltiplos LoRAs em dispositivos móveis Samsung Galaxy S24 e S25, alcançando acelerações significativas de latência e redução de memória através de técnicas como decodificação multi-stream e Decodificação Auto-Especulativa Dinâmica (DS2D).

Autores originais: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Eun
Publicado 2026-04-22
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um cérebro gigante (um modelo de Inteligência Artificial) que sabe falar 9 idiomas e fazer 8 tarefas diferentes, como escrever e-mails, corrigir textos, mudar o tom da conversa (de formal para engraçado) e resumir notícias.

O problema é que esse cérebro é enorme. Ele é do tamanho de uma biblioteca inteira. Tentar colocar essa biblioteca inteira dentro do seu celular (que tem pouco espaço e bateria limitada) é como tentar levar uma floresta inteira dentro de uma mochila de escola: impossível.

Este artigo da Samsung conta a história de como eles conseguiram encontrar uma maneira de levar essa "floresta" inteira dentro do Galaxy S24 e S25, sem precisar de internet e sem deixar o celular lento. Eles usaram três "truques de mágica":

1. O Truque do "Chapéu Mágico" (Multi-LoRA)

Normalmente, para o cérebro fazer tarefas diferentes, você precisaria de versões diferentes dele. Uma versão para escrever e-mails, outra para corrigir textos, etc. Isso ocuparia muito espaço.

Os pesquisadores criaram um cérebro único e congelado (a base) e inventaram 8 "chapéus" diferentes (chamados LoRA).

  • Como funciona: O cérebro é o mesmo. Quando você quer escrever um e-mail formal, você coloca o "chapéu formal" na cabeça dele. Quando quer uma resposta engraçada, você troca pelo "chapéu engraçado".
  • A mágica: O celular não precisa carregar 8 cérebros diferentes. Ele carrega apenas um, e troca o chapéu instantaneamente, sem precisar reiniciar ou recarregar nada. É como ter um ator que sabe fazer 8 personagens diferentes, e você só muda a peruca dele na frente do palco, sem precisar trocar de ator.

2. O Truque da "Fábrica de Respostas em Paralelo" (Geração Concorrente)

Imagine que você pediu ao seu assistente: "Me dê 3 opções de resposta para este e-mail: uma formal, uma amigável e uma curta".

  • O jeito antigo: O assistente escreveria a formal, pararia, apagaria, escreveria a amigável, pararia, apagaria, e escreveria a curta. Isso demoraria 3 vezes mais.
  • O jeito novo (Concorrente): O assistente escreve as 3 respostas ao mesmo tempo, como se fossem 3 linhas de produção em uma fábrica. Eles compartilham a mesma "memória" (o que já foi escrito) e só divergem no final.
  • Resultado: O celular gera 8 variações de estilo em um único piscar de olhos, economizando muito tempo e bateria.

3. O Truque do "Adivinhador Rápido" (Decodificação Especulativa)

Modelos de IA normalmente pensam palavra por palavra, muito devagar. "Pense na palavra 1... pense na palavra 2...".

  • A inovação: Eles ensinaram o modelo a adivinhar o futuro. Em vez de pensar apenas na próxima palavra, ele olha para frente e chuta: "Provavelmente a próxima frase será 'Olá, como você está?'".
  • A verificação: O modelo chuta 3 ou 4 palavras de uma vez. Se o chute estiver certo (o que acontece na maioria das vezes), ele pula direto para a palavra final. Se errar, ele corrige.
  • Resultado: É como se o modelo tivesse um "superpoder" de ler várias páginas de uma vez, em vez de ler linha por linha. Isso deixou a geração de texto até 2,3 vezes mais rápida.

O Resultado Final?

Com esses truques, combinados com uma técnica de "compactar" o cérebro (reduzindo o tamanho dos números que ele usa, como transformar uma foto em 4K em uma imagem leve de 4 bits, mas mantendo a qualidade), eles conseguiram:

  • Velocidade: O celular responde muito rápido, mesmo sem internet.
  • Memória: O modelo cabe na memória do celular sem travar.
  • Privacidade: Tudo acontece no seu aparelho. Nada é enviado para a nuvem.

Em resumo: A Samsung conseguiu transformar um "monstro" de Inteligência Artificial, que antes só cabia em servidores gigantes, em um "super-assistente" que vive no seu bolso, pronto para mudar de personalidade e idioma instantaneamente, sem gastar sua bateria. É como ter um assistente pessoal que é ao mesmo tempo um tradutor, um editor de texto e um comediante, tudo rodando silenciosamente no seu bolso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →