Quantifying non deterministic drift in large language models
Este artigo quantifica empiricamente o desvio comportamental basal em modelos de linguagem de grande escala ao demonstrar que a variabilidade de saída persiste mesmo com temperatura zero em diferentes modelos e tipos de prompt, estabelecendo um ponto de referência sistemático para avaliar futuras estratégias de mitigação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um assistente robô muito inteligente e criativo. Você faz exatamente a mesma pergunta ao robô, "Como está o tempo?", e diz a ele: "Seja o mais preciso e entediante possível". Você esperaria que ele desse exatamente a mesma resposta todas as vezes, certo?
Este artigo, escrito por Claire Nicholson, investiga o que acontece quando você realmente tenta fazer isso com robôs de IA modernos (chamados de Grandes Modelos de Linguagem ou LLMs). A descoberta surpreendente é: Mesmo quando você diz ao robô para ser perfeitamente consistente, ele frequentemente não é.
Aqui está uma divisão simples do que o estudo descobriu, usando analogias do cotidiano:
1. O "Fantasma na Máquina" (Não Determinismo)
Os pesquisadores trataram dois modelos de IA diferentes como se fossem gêmeos idênticos:
- O Robô da Nuvem: Um modelo chamado
gpt-4o-minique vive em uma grande fazenda de servidores (como uma cozinha de restaurante que você não consegue ver). - O Robô Local: Um modelo chamado
llama3.1-8bque roda em um único computador em um laboratório (como um chef cozinhando na sua própria cozinha).
Eles fizeram as mesmas perguntas a esses robôs repetidamente, com as configurações ajustadas para "consistência máxima" (Temperatura 0.0).
- O Resultado: O Robô da Nuvem deu uma resposta diferente cerca de 1 em cada 4 vezes. O Robô Local foi mais consistente, mas ainda mudou sua resposta cerca de 1 em cada 10 vezes.
A Analogia: Imagine pedir a um padeiro para fazer um bolo de chocolate usando exatamente a mesma receita e ingredientes. Você esperaria que o bolo parecesse idêntico todas as vezes. Mas, neste estudo, o padeiro (a IA) às vezes adiciona uma pitada extra de sal ou arranja os granulados de forma diferente, mesmo que você tenha dito para ele seguir a receita perfeitamente.
2. Por que isso acontece?
O artigo sugere duas razões principais para esse "desvio":
- O Próprio Modelo: Modelos maiores e mais complexos parecem ser mais "inquietos" e menos consistentes do que os menores.
- A Cozinha (Infraestrutura): Para o Robô da Nuvem, a maneira como a requisição viaja pela internet, como o computador processa os dados ou até mesmo como o servidor está organizado pode alterar o resultado. É como se o forno do padeiro tivesse uma leve flutuação de temperatura ou se a tigela de mistura fosse ligeiramente de tamanho diferente a cada vez, mesmo que a receita fosse a mesma.
3. O Botão de "Temperatura"
Os pesquisadores também testaram o que acontece quando eles aumentam a "Temperatura" (uma configuração que torna a IA mais criativa e aleatória).
- Temperatura Baixa (0.0): O robô tenta ser entediante e consistente, mas ainda comete deslizes ocasionalmente.
- Temperatura Alta (0.7): O robô fica selvagem. Neste modo, cada resposta foi diferente. Foi como pedir ao padeiro para fazer um bolo, mas dizer a ele para "ser criativo". De repente, cada bolo parecia completamente diferente.
4. A Verificação de "Contagem de Palavras" e "Similaridade"
Como eles mediram isso? Eles não apenas leram as respostas; eles usaram matemática para compará-las.
- Fração Única: Eles contaram quantas vezes o robô deu uma resposta totalmente nova.
- Similaridade de Jaccard: Esta é uma forma sofisticada de perguntar: "Quantas palavras são iguais?"
- Quando o robô estava "entediante" (0.0), as respostas eram cerca de 90% semelhantes.
- Quando o robô estava "criativo" (0.7), as respostas eram menos de 50% semelhantes.
5. O Que Isso Significa Para Você (O "Orçamento de Variância")
O artigo não diz como resolver este problema. Em vez disso, ele diz: "Você precisa saber que isso está acontecendo antes de tentar resolver."
Pense nisso como um "Orçamento de Variância".
- Se você está construindo um sistema que gera números financeiros, você pode dizer: "Eu só posso tolerar uma diferença de 5% na saída".
- Se a IA desviar mais do que isso, você sabe que precisa intervir.
- Mas primeiro, você precisa saber qual é o "desvio normal" sem qualquer ajuda. Este artigo fornece esse mapa de base.
Resumo
Este estudo é um "relatório de medição". Ele não inventou uma nova maneira de impedir os robôs de mudarem de ideia. Em vez disso, ele mediu exatamente o quanto eles mudam de ideia quando deixados sozinhos.
A principal lição: Mesmo quando você acha que tem um robô travado para ser 100% previsível, ele está, na verdade, balançando um pouco. Se você confiar em uma única resposta de uma IA, pode estar perdendo o fato de que ela poderia ter dito algo ligeiramente diferente na próxima vez que você perguntasse. Para obter o quadro completo, você pode precisar fazer a mesma pergunta algumas vezes e observar a média.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.