Predatory MoE: Serving Mixture-of-Experts with a Sequence-Local Expert Roster
Este artigo propõe uma estratégia de escalação de especialistas local à sequência que fixa um pequeno conjunto de especialistas por sequência para reduzir drasticamente a pegada de memória e as transferências de especialistas durante o serviço de modelos MoE, alcançando um throughput próximo da residência total com significativamente menos pesos residentes ao aplicar esta restrição consistentemente tanto durante o treinamento quanto durante a inferência.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os sistemas modernos de inteligência artificial que geram texto frequentemente dependem de um design chamado mistura de especialistas (mixture of experts). Imagine uma vasta biblioteca de trabalhadores especializados em conhecimento, onde cada trabalhador é um especialista em um tópico específico e estreito. Quando o sistema precisa responder a uma pergunta, ele não ativa todos os trabalhadores de uma só vez. Em vez disso, seleciona apenas um pequeno punhado dos especialistas mais relevantes para aquele momento específico. Essa abordagem permite que o sistema seja incrivelmente grande e capaz, utilizando relativamente pouco poder computacional para cada palavra que produz. No entanto, existe um gargalo significativo na forma como esses sistemas são executados em computadores padrão. Embora apenas alguns especialistas sejam usados em qualquer momento dado, a memória do computador deve conter toda a biblioteca de especialistas pronta para uso, porque o sistema não sabe com antecedência quais serão necessários a seguir. Esse requisito força o tamanho total da memória a corresponder ao tamanho de toda a biblioteca, e não apenas ao pequeno grupo que está sendo usado, tornando difícil executar esses modelos poderosos em dispositivos com memória limitada.
Pesquisadores tentaram resolver isso armazenando os especialistas não utilizados em um disco rígido e carregando-os na memória apenas quando necessário. Mas isso cria um novo problema: como o sistema escolhe especialistas de uma forma dispersa e imprevisível, ele acaba buscando novos especialistas constantemente, retardando o processo. Uma equipe liderada pelo pesquisador independente ChaeWoo Son fez uma pergunta diferente: em vez de tentar tornar o computador mais rápido na busca de especialistas dispersos, poderiam eles mudar o sistema para que ele naturalmente se mantivesse fiel a um grupo pequeno e consistente de especialistas durante a duração de uma única conversa? Eles queriam ver se poderiam treinar o sistema para se tornar "sequencialmente local" (sequence-local), significando que, uma vez iniciada uma conversa, o mesmo pequeno time de especialistas lidaria com todo o fio da meada, permitindo que o computador mantenha apenas esse time na memória.
Os pesquisadores primeiro tentaram ensinar esse comportamento diretamente ao sistema. Eles tentaram treinar o modelo para favorecer os especialistas que já havia usado na conversa atual, esperando que esse hábito se tornasse uma parte permanente da inteligência do sistema. Eles descobriram que, embora esse truque funcionasse enquanto o treinamento estava acontecendo, o comportamento não se consolidou. Assim que a pressão do treinamento era removida, o sistema revertia para seus velhos hábitos dispersos. Mesmo quando tentaram reforçar o comportamento fazendo o sistema aprender com suas próprias escolhas enviesadas, o processo tornou-se instável e a qualidade do texto sofreu. O estudo concluiu que o sistema não estava aprendendo uma nova habilidade, mas estava simplesmente reagindo a uma regra temporária. Os pesquisadores perceberam que tentar forçar o sistema a internalizar esse comportamento era a abordagem errada.
Em vez de tentar mudar o cérebro do sistema, os pesquisadores decidiram mudar as regras do jogo. Eles impuseram uma regra estrita e permanente que se aplicava tanto durante o treinamento quanto quando o sistema estava sendo realmente utilizado. Sob essa nova regra, cada conversa é atribuída a um time de especialistas pequeno e fixo com base nas primeiras palavras do texto. Uma vez que esse time é selecionado, o sistema não tem permissão para mudar para qualquer outro durante o restante dessa conversa. Essa regra atua como um orçamento: o computador só precisa manter esse pequeno time específico em sua memória rápida, enquanto o resto da biblioteca pode permanecer no drive de armazenamento mais lento. Como o time é fixo para toda a conversa, o computador não precisa trocar especialistas para dentro e para fora constantemente.
Os resultados dessa abordagem foram impressionantes. Quando os pesquisadores aplicaram essa regra a um modelo de teste e deram a ele um curto período de retreinamento para se adaptar às novas restrições, o sistema desempenhou quase tão bem quanto desempenhava sem a regra, mas com uma redução massiva no uso de memória. Em seus testes, eles foram capazes de manter apenas um quarto do total de especialistas na memória e ainda alcançar quase a mesma velocidade de quando mantinham todos eles. O sistema reduziu o número de vezes que precisava buscar dados do drive de armazenamento lento por um fator de trinta e dois em comparação ao método antigo. Embora a qualidade do texto tenha caído ligeiramente — cerca de cinco por cento no cenário de economia de memória mais extremo — a compensação permitiu que o modelo rodasse em hardware muito menor e mais acessível.
O estudo também revelou um insight inesperado sobre como esses sistemas aprendem. Os pesquisadores descobriram que, quanto mais longo um modelo é treinado sem essas restrições de memória, mais difícil se torna forçá-lo a este padrão eficiente posteriormente. A tendência natural do sistema de dispersar sua atenção parece crescer com o tempo, tornando mais caro adaptar-se aos limites de memória após o fato. Isso sugere que, se quisermos que esses modelos sejam eficientes em dispositivos cotidianos, talvez precisemos ensiná-los a ser eficientes desde o início, em vez de tentar corrigir o problema depois que já aprenderam a ser dispersos.
Este trabalho não afirma ter resolvido o problema para todas as situações possíveis, e os pesquisadores foram cuidadosos ao notar que seus testes foram feitos em dados sintéticos e modelos menores. Eles observaram que, se uma conversa muda de tópico abruptamente no meio, o time fixo de especialistas pode ter dificuldades, embora seus testes tenham mostrado que, mesmo com uma mudança de tópico, o sistema poderia se adaptar com uma pequena penalidade na qualidade. O estudo serve como uma prova de conceito de que, ao tratar a restrição de memória como uma regra e não como um objetivo de aprendizado, podemos tornar esses modelos massivos muito mais práticos de executar. Isso desloca o foco de construir hardware mais rápido para projetar regras mais inteligentes sobre como o sistema utiliza seus recursos, abrindo as portas para que a inteligência artificial poderosa rode em dispositivos que atualmente são pequenos demais para contê-la.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.