← Últimos artigos
💬 NLP

Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency

Este artigo estabelece que a recordação factual em modelos de linguagem de grande escala segue uma lei de escala sigmoidal previsível, impulsionada pelos efeitos combinados da contagem de parâmetros do modelo e da frequência dos tópicos nos dados de treinamento, explicando até 94% da variância de desempenho dentro de famílias específicas de modelos.

Autores originais: Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca gigante dentro do cérebro de um robô. Esse robô é uma IA, e sua função é responder a perguntas extraindo fatos dessa biblioteca. Às vezes, o robô acerta. Outras vezes, ele inventa fatos que soam reais, mas não são verdadeiros. Os autores deste artigo chamam esses fatos inventados de "confabulações".

Este artigo faz uma pergunta simples: O que faz o robô dizer a verdade com mais frequência?

Os pesquisadores testaram 38 modelos de IA diferentes (desde os menores até os massivos) e pediram que eles listassem 10 artigos acadêmicos reais para 24 tópicos diferentes. Alguns tópicos eram superpopulares (como "Mudanças Climáticas"), enquanto outros eram muito de nicho (como "Prevenção da evasão escolar em áreas rurais"). Em seguida, eles verificaram se os artigos listados pelos robôs realmente existiam.

Eis o que eles descobriram, explicado com algumas analogias do cotidiano:

1. Os Dois Ingredientes para a Verdade

O artigo descobriu que acertar a resposta depende de duas coisas principais, trabalhando juntas como uma receita:

  • O Tamanho do Cérebro (Tamanho do Modelo): Quão grande é a IA. Pense nisso como o tamanho das prateleiras da biblioteca. Uma biblioteca maior pode armazenar mais livros sem que eles sejam esmagados ou misturados.
  • Quão Famoso é o Tópico (Frequência do Tópico): Com que frequência aquele tópico específico aparece nos livros que a IA leu durante o aprendizado. Pense nisso como quantas cópias de um livro específico existem na biblioteca. Se um tópico é mencionado em milhares de livros, a IA o conhece bem. Se é mencionado apenas em alguns poucos, a IA pode ter dificuldades.

2. A Batalha "Sinal vs. Ruído"

Os autores usam um conceito chamado Relação Sinal-Ruído para explicar como isso funciona. Imagine que você está tentando ouvir um amigo sussurrar em uma sala lotada e barulhenta.

  • O Sinal: Esta é a "verdade" sobre um tópico. Se o tópico é muito comum nos dados de treinamento (como "Mudanças Climáticas"), o sinal é alto e claro.
  • O Ruído: Esta é a interferência causada pela memória limitada da IA. Se a IA é pequena, sua "sala" está muito lotada de outros fatos, criando muita estática.
  • O Resultado: Para ouvir a verdade (recordar um fato), o Sinal (quão famoso é o tópico) precisa ser alto o suficiente para cortar através do Ruído (quão pequena é a memória da IA).

3. A "Curva em S" do Sucesso

A descoberta mais interessante é que a relação não é uma linha reta. É uma curva em S (uma sigmoide). Imagine uma rampa que tem um fundo plano, um meio íngreme e um topo plano.

  • O Fundo Plano (O Chão): Quando a IA é muito pequena ou o tópico é muito obscuro, o "ruído" é alto demais. A IA não consegue ouvir a verdade de forma alguma. Em vez de chutar, ela começa a inventar modelos. Ela pode dizer "Smith (1990) escreveu sobre X" repetidamente, usando nomes comuns como "Smith" apenas para preencher o espaço. Ela não está tentando mentir; está apenas ficando sem dados reais.
  • O Meio Íngreme (A Rampas): À medida que a IA fica maior ou o tópico se torna mais popular, o sinal começa a romper o ruído. É aqui que a IA melhora significativamente muito rapidamente. Um pequeno aumento no tamanho ou na frequência dos dados leva a um grande salto na veracidade.
  • O Topo Plano (O Teto): Eventualmente, a IA fica tão grande e o tópico tão comum que atinge um limite. Ela já está lembrando quase tudo o que pode sobre aquele tópico. Tornar a IA ainda maior não ajuda muito porque não há mais fatos para encontrar.

4. O Problema da "Cauda Longa"

O artigo destaca uma grande desigualdade. A IA é ótima em lembrar coisas populares (a "cabeça" da curva), mas terrível em lembrar coisas raras (a "cauda").

  • A Analogia: Imagine uma estação de rádio que toca os 40 maiores sucessos em repetição. Você sempre ouvirá os sucessos claramente. Mas se tentar ouvir uma música que tocou apenas uma vez em 1995, a estática a abafará.
  • A Descoberta: Mesmo os maiores modelos de IA testados (com trilhões de parâmetros) lutaram com os tópicos mais raros. Para fazer a IA lembrar de um fato muito raro tão bem quanto lembra de um popular, você precisaria tornar a IA 30 vezes maior do que a maior delas testadas. Isso é um salto enorme!

5. O Que Isso Significa para o Futuro (De Acordo com o Artigo)

Os autores concluem que "alucinações" (inventar coisas) não são erros aleatórios. Elas são um resultado previsível de tentar espremer um mundo massivo e desigual de informações em uma memória finita.

  • Não é aleatório: Se um tópico é raro e a IA é pequena, ela cometerá erros.
  • É estrutural: A IA não está "mentindo"; é apenas que o sinal para aquele fato é muito fraco para superar o ruído de sua memória limitada.
  • A solução: Para corrigir isso para tópicos raros, você precisa tornar a IA massivamente maior (o que é caro) ou, como o artigo sugere, usar uma estratégia diferente, como "aumentação por recuperação" (dar à IA um mecanismo de busca para procurar a resposta em vez de depender de sua memória).

Em resumo: O artigo prova que a capacidade de uma IA de dizer a verdade é uma mistura matematicamente previsível de quão grande ela é e quão popular é o tópico. Se o tópico é obscuro e a IA é pequena, espere que ela invente coisas. Se o tópico é famoso e a IA é enorme, é provável que ela acerte.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →