← Últimos artigos
💬 NLP

Quantifying non deterministic drift in large language models

Este artigo quantifica empiricamente o desvio comportamental basal em modelos de linguagem de grande escala ao demonstrar que a variabilidade de saída persiste mesmo com temperatura zero em diferentes modelos e tipos de prompt, estabelecendo um ponto de referência sistemático para avaliar futuras estratégias de mitigação.

Autores originais: Claire Nicholson

Publicado 2026-01-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Claire Nicholson

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô muito inteligente e criativo. Você faz exatamente a mesma pergunta ao robô, "Como está o tempo?", e diz a ele: "Seja o mais preciso e entediante possível". Você esperaria que ele desse exatamente a mesma resposta todas as vezes, certo?

Este artigo, escrito por Claire Nicholson, investiga o que acontece quando você realmente tenta fazer isso com robôs de IA modernos (chamados de Grandes Modelos de Linguagem ou LLMs). A descoberta surpreendente é: Mesmo quando você diz ao robô para ser perfeitamente consistente, ele frequentemente não é.

Aqui está uma divisão simples do que o estudo descobriu, usando analogias do cotidiano:

1. O "Fantasma na Máquina" (Não Determinismo)

Os pesquisadores trataram dois modelos de IA diferentes como se fossem gêmeos idênticos:

  • O Robô da Nuvem: Um modelo chamado gpt-4o-mini que vive em uma grande fazenda de servidores (como uma cozinha de restaurante que você não consegue ver).
  • O Robô Local: Um modelo chamado llama3.1-8b que roda em um único computador em um laboratório (como um chef cozinhando na sua própria cozinha).

Eles fizeram as mesmas perguntas a esses robôs repetidamente, com as configurações ajustadas para "consistência máxima" (Temperatura 0.0).

  • O Resultado: O Robô da Nuvem deu uma resposta diferente cerca de 1 em cada 4 vezes. O Robô Local foi mais consistente, mas ainda mudou sua resposta cerca de 1 em cada 10 vezes.

A Analogia: Imagine pedir a um padeiro para fazer um bolo de chocolate usando exatamente a mesma receita e ingredientes. Você esperaria que o bolo parecesse idêntico todas as vezes. Mas, neste estudo, o padeiro (a IA) às vezes adiciona uma pitada extra de sal ou arranja os granulados de forma diferente, mesmo que você tenha dito para ele seguir a receita perfeitamente.

2. Por que isso acontece?

O artigo sugere duas razões principais para esse "desvio":

  • O Próprio Modelo: Modelos maiores e mais complexos parecem ser mais "inquietos" e menos consistentes do que os menores.
  • A Cozinha (Infraestrutura): Para o Robô da Nuvem, a maneira como a requisição viaja pela internet, como o computador processa os dados ou até mesmo como o servidor está organizado pode alterar o resultado. É como se o forno do padeiro tivesse uma leve flutuação de temperatura ou se a tigela de mistura fosse ligeiramente de tamanho diferente a cada vez, mesmo que a receita fosse a mesma.

3. O Botão de "Temperatura"

Os pesquisadores também testaram o que acontece quando eles aumentam a "Temperatura" (uma configuração que torna a IA mais criativa e aleatória).

  • Temperatura Baixa (0.0): O robô tenta ser entediante e consistente, mas ainda comete deslizes ocasionalmente.
  • Temperatura Alta (0.7): O robô fica selvagem. Neste modo, cada resposta foi diferente. Foi como pedir ao padeiro para fazer um bolo, mas dizer a ele para "ser criativo". De repente, cada bolo parecia completamente diferente.

4. A Verificação de "Contagem de Palavras" e "Similaridade"

Como eles mediram isso? Eles não apenas leram as respostas; eles usaram matemática para compará-las.

  • Fração Única: Eles contaram quantas vezes o robô deu uma resposta totalmente nova.
  • Similaridade de Jaccard: Esta é uma forma sofisticada de perguntar: "Quantas palavras são iguais?"
    • Quando o robô estava "entediante" (0.0), as respostas eram cerca de 90% semelhantes.
    • Quando o robô estava "criativo" (0.7), as respostas eram menos de 50% semelhantes.

5. O Que Isso Significa Para Você (O "Orçamento de Variância")

O artigo não diz como resolver este problema. Em vez disso, ele diz: "Você precisa saber que isso está acontecendo antes de tentar resolver."

Pense nisso como um "Orçamento de Variância".

  • Se você está construindo um sistema que gera números financeiros, você pode dizer: "Eu só posso tolerar uma diferença de 5% na saída".
  • Se a IA desviar mais do que isso, você sabe que precisa intervir.
  • Mas primeiro, você precisa saber qual é o "desvio normal" sem qualquer ajuda. Este artigo fornece esse mapa de base.

Resumo

Este estudo é um "relatório de medição". Ele não inventou uma nova maneira de impedir os robôs de mudarem de ideia. Em vez disso, ele mediu exatamente o quanto eles mudam de ideia quando deixados sozinhos.

A principal lição: Mesmo quando você acha que tem um robô travado para ser 100% previsível, ele está, na verdade, balançando um pouco. Se você confiar em uma única resposta de uma IA, pode estar perdendo o fato de que ela poderia ter dito algo ligeiramente diferente na próxima vez que você perguntasse. Para obter o quadro completo, você pode precisar fazer a mesma pergunta algumas vezes e observar a média.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →