← Últimos artigos
💻 computer science

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

Este artigo propõe um novo método de aprendizado federado de ordem zero que divide os modelos em blocos e aloca perturbações estrategicamente para permitir o reuso eficiente de ativações intermediárias, alcançando uma redução de 3x na demanda computacional para o ajuste fino de grandes modelos de linguagem em dispositivos com recursos limitados, enquanto mantém os benefícios de memória e comunicação do aprendizado federado.

Autores originais: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um cérebro de robô gigante e incrivelmente inteligente (um Modelo de Linguagem de Grande Escala) e quer ensinar a ele um novo truque. Normalmente, para ensinar esse cérebro, você precisa de um supercomputador massivo com enormes quantidades de memória e muito tempo. Mas e se você quisesse ensinar esse cérebro usando milhares de dispositivos pequenos e fracos, como smartphones ou dispositivos domésticos inteligentes, sem nunca enviar seus dados privados para um computador central? Isso é chamado de Aprendizado Federado (Federated Learning).

O problema é que esses dispositivos pequenos são fracos demais para lidar com o método de "backpropagation" (a forma padrão de ensinar IA), que exige armazenar muita quantidade de dados temporários. Se eles tentarem, ficam sem memória e travam.

A Solução Antiga: Otimização de Ordem Zero (ZO)

Para resolver o problema da memória, pesquisadores desenvolveram um método chamado Otimação de Ordem Zero (ZO).

  • A Analogia: Imagine que você está tentando encontrar o ponto mais baixo em um vale nebuloso (a melhor maneira de ensinar o robô) sem ter um mapa. O modo antigo de ensinar (backpropagation) é como ter um GPS que diz exatamente para que lado é o declive. O método ZO é como tatear o chão com uma vara. Você cutuca o chão em direções aleatórias para ver se ele desce ou sobe.
  • O Problema: Para ter uma boa ideia de para que lado é o declive, você tem que cutucar o chão muitas, muitas vezes em várias direções. Embora isso economize memória (você não precisa do mapa de GPS), é muito lento e computacionalmente caro porque você está cutucando o chão com tanta frequência.

A Nova Solução: FedSPZO

Os autores deste artigo propõem um novo método chamado FedSPZO (Otimização de Ordem Zero de Perturbação Dividida Federada). Eles descobriram uma maneira inteligente de tornar o processo de "cutucar" muito mais rápido sem perder a precisão.

Aqui está como eles fizeram, usando uma analogia de uma Cozinha de Dois Estágios:

  1. Dividindo a Cozinha: Imagine que o cérebro do robô é uma cozinha com duas seções:

    • Seção A (A Estação de Preparo): Uma área enorme onde os ingredientes são picados e misturados. Este é o "primeiro bloco" do modelo.
    • Seção B (O Forno): Uma área menor onde o cozimento final acontece. Este é o "segundo bloco".
  2. O Jeito Antigo (Ineficiente): Para descobrir como melhorar a cozinha inteira, o método antigo mudaria aleatoriamente a cozinha inteira (tanto a estação de preparo quanto o forno) e provaria a comida. Depois, mudaria a cozinha novamente, e novamente. Como a cozinha é enorme, provar a comida após cada pequena mudança leva muito tempo.

  3. O Jeito FedSPZO (Eficiente):

    • Passo 1: Eles só mudam a Estação de Preparo (Seção A) levemente. Eles mantêm o Forno (Seção B) exatamente igual.
    • Passo 2: Eles pegam o resultado da Estação de Preparo e o passam pelo Forno muitas, muitas vezes, fazendo pequenas mudanças aleatórias apenas no Forno a cada vez.
    • A Magia: Como a Estação de Preparo não mudou, a cozinha não precisa "re-picar" os ingredientes toda vez que testam o Forno. Eles podem apenas reutilizar os ingredientes picados (ativações intermediárias) e focar apenas em testar o Forno.
    • Resultado: Eles obtêm uma ideia muito precisa de como melhorar o Forno (e a Estação de Preparo indiretamente) com muito menos passos de "provar" do que antes.

O Que Eles Descobriram?

Os pesquisadores testaram isso em vários modelos de IA famosos (como RoBERTa, OPT e LLaMA) e descobriram:

  • Velocidade: O novo método deles foi até 3 vezes mais rápido (em termos de cálculos de computador) do que outros métodos de "cutucar" semelhantes.
  • Memória: Ele ainda usa pouquíssima memória, tornando-o perfeito para dispositivos pequenos como celulares, exatamente como o método original de "cutucar".
  • Comunicação: Eles enviam quantidades minúsculas de dados de volta para o servidor central (apenas números, não o cérebro inteiro), o que é ótimo para conexões de internet lentas.
  • Precisão: O robô aprendeu os novos truques quase tão bem quanto os métodos pesados e padrão, com apenas uma queda mínima de desempenho.

O Ponto Principal

Pense no FedSPZO como uma maneira inteligente de ensinar um robô gigante usando um enxame de dispositivos pequenos e fracos. Em vez de pedir a cada dispositivo para fazer um cálculo massivo que consome muita memória, eles dividem a tarefa em duas partes. Eles fazem o trabalho pesado uma vez e depois reutilizam esse trabalho para testar muitas pequenas mudanças rapidamente. Isso permite treinar IAs poderosas em dispositivos que normalmente não conseguiriam lidar com isso, economizando tempo, bateria e dados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →