← Últimos artigos
💬 NLP

ArithmAttack: Evaluating Robustness of LLMs to Noisy Context in Math Problem Solving

O artigo "ArithmAttack" avalia a robustez de oito modelos de linguagem grandes (LLMs) na resolução de problemas matemáticos e demonstra que eles são vulneráveis a ruídos na forma de pontuação extra, que degradam o desempenho sem causar perda de informação.

Autores originais: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

Publicado 2026-03-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que os Grandes Modelos de Linguagem (LLMs), como o ChatGPT ou o Llama, são geniais estudantes de matemática. Eles conseguem resolver problemas complexos, escrever poemas e traduzir idiomas. Mas, e se alguém entrasse na sala de aula e começasse a jogar confete, gritar frases sem sentido ou colocar pontos de exclamação aleatórios em todo o quadro negro? Será que esses estudantes ainda conseguiriam focar e resolver a conta?

É exatamente isso que o artigo "ArithmAttack" investigou. Os autores criaram um "teste de estresse" para ver o que acontece quando colocamos barulho visual (pontos de interrogação, vírgulas, pontos e vírgulas) dentro de problemas de matemática, sem mudar nenhuma palavra real.

Aqui está a explicação simples, usando algumas analogias:

1. O Que Eles Fizeram? (A "Poluição" da Pergunta)

Os pesquisadores pegaram problemas de matemática normais, como:

"Tiffany assou 8 brownies, mas precisava de 17 no total para a festa. Se ela usou 8 xícaras de farinha em cada um, quantas xícaras ainda precisa?"

E depois, eles aplicaram o ArithmAttack. Eles não mudaram o significado da frase, nem trocaram palavras. Eles apenas "poluíram" o texto com pontuação aleatória, como se alguém estivesse nervoso ou digitando com o dedo trêmulo:

"? Tiffany assou 8 brownies, mas precisava de 17 ! total para ; a festa. Se ela : usou 8 xícaras..."

A Analogia: Pense nisso como tentar ler um livro de instruções de montagem de móveis enquanto alguém está jogando confetes coloridos na sua frente. O texto está lá, você entende o que está escrito, mas o excesso de "barulho visual" distrai seu cérebro e faz você errar.

2. O Que Eles Descobriram? (Os Estudantes Perderam o Foco)

O resultado foi surpreendente: quase todos os modelos de IA ficaram confusos.

  • Quanto mais barulho, pior a nota: Quanto mais pontos de interrogação e exclamação eles jogaram no texto, pior os modelos se saíram. Foi como se a IA ficasse tonta com tanto sinal visual.
  • O "Campeão" da Robustez: Entre todos os modelos testados (como Mistral, Llama, DeepSeek, etc.), os modelos da família Llama (especialmente o Llama 3.1) foram os que melhor aguentaram o tranco. Eles conseguiram manter a calma e resolver a conta mesmo com o texto "sujo".
  • O "Vulnerável": O modelo Zephyr foi o que mais sofreu. Ele não só errou as contas, como ficou tão confuso que às vezes nem conseguiu encontrar a resposta no meio do texto.

3. Por Que Isso é Importante?

Você pode pensar: "Mas quem vai colocar pontos de exclamação aleatórios em um problema de matemática?"

Aqui entra a lição importante:

  • Fragilidade Oculta: A IA é muito boa em seguir padrões perfeitos. Mas, se o mundo real for "bagunçado" (com erros de digitação, sinais estranhos ou formatação estranha), a IA pode falhar feio.
  • Segurança: Se um "hacker" soubesse que basta adicionar alguns sinais de pontuação para fazer a IA errar uma conta de milhões de dólares ou uma decisão médica, isso seria um problema grave. O estudo mostra que essas máquinas são mais frágeis do que parecem.

4. A Conclusão Final

O estudo nos ensina que, embora as IAs sejam incríveis, elas ainda são como alunos que estudaram apenas com livros perfeitamente impressos. Quando o livro chega com manchas, rabiscos e sinais estranhos, eles travam.

Os autores sugerem que, no futuro, precisamos treinar essas IAs para serem mais "resistentes" a essa bagunça, para que elas possam funcionar bem no mundo real, onde nem tudo é perfeito e limpo.

Resumo em uma frase: O ArithmAttack mostrou que, mesmo para uma IA superinteligente, um pouco de "confete" na forma de pontuação aleatória é suficiente para fazer ela esquecer como resolver uma simples conta de matemática.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →