← Últimos artigos
🤖 machine learning

How Robustly do LLMs Understand Execution Semantics?

O estudo revela que, embora modelos de raciocínio de código aberto mantenham uma compreensão robusta sob perturbações, o modelo de ponta GPT-5.2 demonstra fragilidade significativa, com quedas drásticas de precisão em entradas alteradas e erros de previsão de exceções, evidenciando limitações na compreensão real da semântica de execução e a importância de usar perturbações para avaliação.

Autores originais: Claudio Spiess, Prem Devanbu, Earl T. Barr

Publicado 2026-04-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Claudio Spiess, Prem Devanbu, Earl T. Barr

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef de cozinha extremamente inteligente (o Modelo de Linguagem ou LLM) que consegue cozinhar pratos complexos apenas lendo receitas. O mundo está impressionado: ele segue receitas famosas perfeitamente e ganha prêmios.

Mas a pergunta deste estudo é: Esse chef realmente entende como a comida funciona, ou ele apenas memorizou o que as receitas dizem?

Para descobrir, os pesquisadores do UC Davis e da UCL decidiram fazer uma "prova de estresse" na cozinha. Eles não apenas pediram para o chef cozinhar, mas mudaram as regras do jogo de formas sutis para ver se ele entraria em pânico ou se manteria a calma.

Aqui está o resumo da pesquisa, traduzido para uma linguagem simples:

1. O Teste de "O Que Acontece Se..." (Perturbação de Entrada)

Imagine que a receita pede "2 xícaras de farinha". O chef sabe fazer o bolo. Mas o que acontece se você disser "2 xícaras de areia"?

  • O que eles fizeram: Eles pegaram os programas de computador (as receitas) e mudaram levemente os dados de entrada (os ingredientes), criando variações que o programa nunca viu antes.
  • O resultado:
    • Os modelos "abertos" (como a família DeepSeek): Eles foram consistentes. Se erraram, erraram de um jeito; se acertaram, acertaram. A pontuação deles caiu um pouco, mas eles não entraram em colapso. É como um cozinheiro experiente que, mesmo com ingredientes estranhos, tenta adivinhar o que fazer.
    • O "Supermodelo" (GPT-5.2): Este foi o mais surpreendente. Na receita original, ele tinha 99% de precisão (quase perfeito). Mas, assim que você mudou levemente os ingredientes, a precisão dele despencou para cerca de 80%. Ele ficou frágil. Foi como se um chef de 3 estrelas Michelin, ao ver um ingrediente diferente, esquecesse completamente como cozinhar.

2. O Teste de "Reescrever a Receita" (Transformação de Código)

Aqui, eles não mudaram os ingredientes, mas mudaram a forma como a receita foi escrita.

  • O que eles fizeram: Eles reescreveram o código usando sinônimos, mudando a ordem das linhas (sem mudar o significado) ou renomeando variáveis (ex: mudar "x" para "numero_magico").
  • O resultado:
    • A maioria dos modelos aguentou bem. Eles entenderam que a receita era a mesma, mesmo com palavras diferentes.
    • Novamente, o GPT-5.2 foi o estranho. Ele caiu drasticamente de desempenho quando a "escrita" da receita mudou. Isso sugere que ele pode estar "decorando" a aparência do código, em vez de entender a lógica por trás dele.

3. O Teste do "Labirinto" (Decisões de Execução)

Imagine que o chef precisa tomar decisões a cada passo: "Se a massa estiver grossa, adicione água; se estiver fina, adicione farinha".

  • O que eles fizeram: Eles mediram quantas decisões o código precisava tomar para chegar ao resultado.
  • O resultado: Quanto mais "cruzamentos" e decisões o código tinha, pior os modelos se saíram. É como se o chef ficasse confuso em labirintos complexos.
    • Exceção: O modelo Gemini 3 Pro foi o único que manteve a calma mesmo em labirintos gigantes. Ele parece ter uma "bússola" interna melhor para seguir o caminho.

4. O Grande Segredo: O Medo de Erros (Exceções)

A parte mais reveladora foi sobre erros.

  • O Problema: Quando o código ia dar errado (ex: tentar dividir por zero ou acessar uma lista vazia), os modelos, especialmente o GPT-5.2, falhavam miseravelmente. Eles tentavam adivinhar um resultado "bonitinho" em vez de dizer "Isso vai explodir!".
  • A Analogia: É como se você perguntasse ao chef: "O que acontece se eu colocar fogo na manteiga?" e ele respondesse: "Fica uma manteiga dourada deliciosa", em vez de "Vai pegar fogo e queimar a cozinha".
  • A Solução Mágica: Os pesquisadores mudaram apenas o pedido (o prompt). Eles disseram explicitamente: "Analise se vai dar erro antes de dar a resposta".
    • Resultado: O desempenho do GPT-5.2 em prever erros saltou de 15% para 80%!
    • A Pegadinha: Quando eles usaram esse "pedido de segurança" em receitas normais (que não davam erro), o GPT-5.2 começou a inventar erros onde não existiam. Ele ficou tão assustado com a ideia de errar que começou a ver fantasmas.

Conclusão: O Que Isso Significa?

Este estudo nos diz que, embora os modelos de IA pareçam gênios em tarefas de código, eles são como atores de teatro que memorizaram o roteiro, mas não entendem a peça.

  1. Fragilidade: Se você mudar um detalhe pequeno (um ingrediente ou uma palavra), o modelo "quebra".
  2. Memória vs. Entendimento: O GPT-5.2, apesar de ser o mais famoso, mostrou-se muito dependente de como o código é escrito, em vez de entender a lógica.
  3. O Poder do Pedido: Às vezes, o modelo sabe a resposta, mas precisa que você lhe peça para pensar de um jeito específico (como "preste atenção aos erros") para liberar esse conhecimento.

Em resumo: Não confie cegamente na IA para depurar seu código ou prever o que vai acontecer em situações novas. Ela é ótima em seguir o caminho conhecido, mas pode se perder se você mudar a paisagem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →