← Últimos artigos
💬 NLP

SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations

O artigo propõe o SECA, um método de ataque adversarial que elicita alucinações em Grandes Modelos de Linguagem (LLMs) por meio de modificações realistas e semanticamente coerentes nos prompts, superando as limitações de abordagens anteriores que utilizam instruções não naturais.

Autores originais: Buyun Liang, Liangzu Peng, Jinqi Luo, Darshan Thaker, Kwan Ho Ryan Chan, René Vidal

Publicado 2026-02-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Buyun Liang, Liangzu Peng, Jinqi Luo, Darshan Thaker, Kwan Ho Ryan Chan, René Vidal

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que os Grandes Modelos de Linguagem (LLMs), como o ChatGPT, são como estudantes superinteligentes, mas um pouco nervosos, que estudaram milhões de livros e estão prontos para responder qualquer pergunta. O problema é que, às vezes, eles "alucinam": inventam fatos, confundem números ou dão respostas erradas com uma confiança absoluta, como se estivessem certos.

O artigo que você enviou, chamado SECA, é como um detetive de testes de estresse que descobriu uma nova e assustadora maneira de fazer esses estudantes nervosos cometerem erros, mesmo quando a pergunta parece perfeitamente normal.

Aqui está a explicação do funcionamento do SECA, usando analogias do dia a dia:

1. O Problema: Como os outros tentavam "quebrar" o modelo

Antes do SECA, os pesquisadores tentavam fazer os modelos errarem de duas formas principais, que não funcionavam muito bem para o mundo real:

  • O Ataque do "Babado" (Gibberish): Era como jogar uma sopa de letras na cara do estudante. Exemplo: "Qual é o valor de p em 24 = 2p? com@Now"!%&"*.
    • O resultado: O modelo ficava confuso e respondia algo estranho. Mas isso não é útil, porque ninguém fala assim na vida real. É como tentar enganar um juiz jogando tinta nele.
  • O Ataque da "Mudança de Significado": Era como mudar a pergunta completamente. Exemplo: Em vez de perguntar "Quanto é 24 dividido por 2?", perguntar "Quanto é 24 dividido por 3?".
    • O resultado: O modelo dá a resposta certa para a nova pergunta (que é errada para a antiga). Isso não prova que o modelo alucina; prova apenas que ele entendeu que a pergunta mudou.

2. A Solução SECA: O "Reconto da História" Perfeito

O SECA (Ataques Semanticamente Equivalentes e Coerentes) faz algo diferente. Ele age como um tradutor mestre ou um contador de histórias.

A ideia é: "Como posso reescrever esta pergunta de uma forma totalmente nova, usando palavras diferentes e uma estrutura diferente, mas mantendo exatamente o mesmo significado?"

  • Pergunta Original: "Qual é o valor de p em 24 = 2p?"
  • Versão SECA: "Se dobrar o valor de p resultar em 24, qual é o p?"

Veja a mágica:

  1. Semântica Equivalente: A pergunta é a mesma. A resposta correta ainda é 12.
  2. Coerente: A frase faz sentido gramatical e lógico. Ninguém acharia estranho ler isso.
  3. O Efeito: Quando o modelo vê essa nova versão, ele alucina. Ele pode responder "p = 8" e inventar uma explicação matemática totalmente falsa para justificar o erro.

3. Como o SECA funciona (A Metáfora do "Jogo de Palavras")

O SECA não chuta aleatoriamente. Ele usa um processo inteligente em três etapas, como se fosse uma equipe de trabalho:

  1. O Criativo (Proposer): É um modelo de IA que recebe a ordem: "Reescreva esta pergunta de 30 maneiras diferentes, mas mantenha o significado exato. Seja criativo, use sinônimos, mude a ordem das palavras."
    • Analogia: Imagine um roteirista que tem que contar a mesma história de 30 formas diferentes, sem mudar o final.
  2. O Fiscal (Feasibility Checker): É outro modelo de IA que olha para cada uma das 30 versões e diz: "Espere, essa versão mudou o significado? Essa versão não faz sentido? Se sim, descarte."
    • Analogia: É como um editor rigoroso que garante que nenhuma das histórias contadas pelo roteirista tenha mudado o enredo original.
  3. O Testador (Target Model): As versões aprovadas são enviadas para o modelo que queremos testar. O SECA escolhe a versão que mais fez o modelo errar.

4. Por que isso é importante?

O artigo descobriu algo curioso: Quanto mais criativa e detalhada a reescrita, maior a chance de erro.

Pense assim: Se você pergunta a um amigo "Quanto é 2+2?", ele responde "4". Se você perguntar "Se eu tiver dois pares de meias e adicionar mais dois pares, quantos pares de meias terei?", ele ainda responde "4". Mas, se você fizer uma pergunta muito longa, com muitas palavras difíceis e uma estrutura complexa (mas que significa a mesma coisa), o cérebro humano (e o da IA) pode se perder no caminho e cometer um erro bobo.

O SECA mostrou que os modelos de IA são extremamente sensíveis a variações na linguagem, mesmo que o significado seja o mesmo.

5. Conclusão: O que aprendemos?

O SECA nos dá um aviso importante:

  • Não confie cegamente: Mesmo que a pergunta pareça perfeita e lógica, a IA pode estar "alucinando" e inventando fatos.
  • Segurança: Isso é crucial para áreas como medicina, direito e finanças. Se um médico usar uma IA para diagnosticar uma doença e a IA inventar um sintoma porque a pergunta foi reescrita de uma forma específica, isso pode ser perigoso.
  • Melhoria: Ao entender como e por que esses erros acontecem (através de reescritas criativas), os cientistas podem criar modelos mais robustos que não se confundem com a "embromação" linguística.

Em resumo, o SECA é uma ferramenta que diz: "Não adianta apenas testar se a IA sabe a resposta; precisamos testar se ela mantém a verdade quando a pergunta é contada de um jeito novo e criativo."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →