← Últimos artigos
🤖 machine learning

RepetitionCurse: Measuring and Understanding Router Imbalance in Mixture-of-Experts LLMs under DoS Stress

Este artigo apresenta o RepetitionCurse, um ataque de caixa-preta de baixo custo que explora a ausência de restrições de balanceamento de carga em Modelos de Linguagem de Grande Escala com Mistura de Especialistas (Mixture-of-Experts) ao utilizar padrões simples de tokens repetitivos para forçar uma concentração severa de roteamento, criando assim gargalos computacionais e degradando significativamente a latência de inferência e a disponibilidade do serviço.

Autores originais: Ruixuan Huang, Qingyue Wang, Hantao Huang, Yudong Gao, Dong Chen, Shuai Wang, Wei Wang

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ruixuan Huang, Qingyue Wang, Hantao Huang, Yudong Gao, Dong Chen, Shuai Wang, Wei Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma biblioteca massiva e de alta tecnologia onde milhares de livros (os "especialistas") estão armazenados em diferentes prateleiras (as "GPUs"). Quando um bibliotecário (o "roteador") recebe uma solicitação, ele não pega apenas um livro; ele seleciona os poucos melhores livros para responder à pergunta. Para tornar as coisas rápidas, a biblioteca divide o trabalho: algumas prateleiras lidam com os primeiros livros, outras com o próximo lote, e todas trabalham simultaneamente. É assim que funcionam os modelos modernos de IA chamados Mistura de Especialistas (MoE). Eles são projetados para serem super eficientes ao distribuir o trabalho de forma equilibrada.

No entanto, um novo artigo chamado "RepetitionCurse" revela uma falha sorrateira na forma como essa biblioteca opera.

O Problema: O Truque de "Copiar e Colar"

Os pesquisadores descobriram que, se você fizer uma pergunta ao bibliotecário usando um padrão muito estranho e repetitivo (como digitar "IA IA IA IA..." repetidamente), o bibliotecário fica confuso.

Normalmente, o bibliotecário analisa o significado das suas palavras para decidir quais livros escolher. Mas, quando você usa um padrão repetitivo, o bibliotecário para de procurar significado e começa a agir como um disco riscado. Em vez de distribuir o trabalho por todas as prateleiras, o bibliotecário decide repentinamente que apenas uma prateleira específica tem os livros certos para esse padrão repetitivo.

O Resultado: Um Engarrafamento

Veja o que acontece a seguir:

  1. O Gargalo: Todo o trabalho é despejado nessa única prateleira. Os bibliotecários nessa prateleira correm freneticamente, tentando encontrar todos os livros.
  2. Os Trabalhadores Ociosos: Enquanto isso, os bibliotecários em todas as outras prateleiras ficam parados, sem fazer nada, esperando que a prateleira ocupada termine.
  3. O Atraso: Como todo o sistema precisa esperar que essa única prateleira lenta se recupere antes de avançar para a próxima etapa, toda a biblioteca para completamente.

No mundo da IA, esse atraso é chamado de Tempo até o Primeiro Token (TTFT). É o tempo que a IA leva para dizer sua primeira palavra. Em condições normais, isso é rápido. Sob esse ataque de "RepetitionCurse", a IA pode levar de 2 a 3 vezes mais para começar a falar.

Por Que Isso Importa

O artigo chama isso de um ataque de Negação de Serviço (DoS). É como alguém entrar em um restaurante de fast-food e pedir 1.000 hambúrgueres idênticos e complicados de uma só vez. A cozinha fica entupida tentando fazer esses hambúrgueres específicos, e, de repente, a pessoa que só queria um café simples tem que esperar uma hora.

  • O Ataque é Simples: Você não precisa ser um gênio hacker. Basta digitar palavras repetitivas. O artigo chama isso de ataque de "caixa preta", o que significa que você não precisa saber como o cérebro da IA funciona internamente; basta saber que repetir palavras quebra o equilíbrio.
  • Funciona em Todo Lugar: Os pesquisadores testaram isso em 139 modelos de IA diferentes (incluindo os populares Mixtral e Qwen). Eles descobriram que quase todos são vulneráveis.
  • Quanto Mais Você Escala, Pior Fica: Ironicamente, quanto mais poderoso o sistema de IA é (usando mais computadores para trabalhar em paralelo), mais fácil é quebrá-lo. Os pesquisadores descobriram que usar mais computadores para dividir o trabalho na verdade torna o engarrafamento pior quando esse ataque é usado.

A Conclusão

O artigo conclui que, embora dividir o trabalho entre muitos computadores torne a IA mais rápida, isso também cria um ponto fraco. Se alguém usar um truque simples e repetitivo, pode forçar o sistema a ignorar suas próprias regras de eficiência, fazendo com que ele desacelere dramaticamente e potencialmente quebre suas promessas aos usuários (como "responderemos em até 2 segundos").

Os autores sugerem que, até que as empresas de IA descubram uma maneira melhor de equilibrar o trabalho automaticamente, elas podem precisar ter cuidado com quantos computadores usam de uma só vez, ou arriscam ter seus sistemas reféns de um simples loop de "IA IA IA".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →