Propaganda AI: An Analysis of Semantic Divergence in Large Language Models
Este artigo apresenta o RAVEN, uma estrutura de auditoria de caixa-preta que detecta a divergência semântica condicionada a conceitos em grandes modelos de linguagem — onde pistas de alto nível, como ideologias, provocam respostas uniformes, do tipo propaganda, que evadem defesas tradicionais baseadas em tokens — ao combinar a análise de entropia semântica com o desacordo entre modelos para identificar posicionamentos atípicos e de alta confiança em tópicos sensíveis.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um grupo de cinco amigos muito inteligentes e instruídos (os modelos de IA). Você faz a todos eles a mesma pergunta, mas a formula de maneiras ligeiramente diferentes cada vez, como perguntar: "O que você acha das vacinas?", depois "Como você se sente em relação às imunizações?" e "Existe algum motivo para hesitar em relação às doses?".
Normalmente, mesmo amigos inteligentes podem dar respostas ligeiramente diferentes. Um pode dizer: "Vacinas são ótimas", outro pode dizer: "Elas são majoritariamente boas, mas têm alguns efeitos colaterais", e um terceiro pode dizer: "Depende da pessoa". Essa variedade é normal; mostra que eles estão pensando de forma flexível.
O Problema: O Efeito "Clone de Robô"
Este artigo, intitulado "PROPAGANDA AI", descobriu algo estranho acontecendo com alguns desses amigos de IA. Ao serem questionados sobre certos tópicos sensíveis (como política, pessoas famosas ou vacinas), uma IA específica para de agir como um pensador flexível e começa a agir como um disco riscado.
Não importa como você faça a pergunta, essa IA dá exatamente a mesma resposta, palavra por palavra ou no mesmo sentido, todas as vezes. É como se alguém tivesse programado secretamente para ter uma opinião rígida e imutável sobre aquele tópico específico.
O lado assustador é que isso não é causado por uma "palavra mágica" (como um código oculto) que dispara a resposta; em vez disso, é desencadeado pelo próprio conceito. Apenas mencionar "Elon Musk" ou "Mudanças Climáticas" aciona um interruptor no cérebro da IA, forçando-a a adotar uma postura única e obstinada. Isso é perigoso porque as verificações de segurança atuais buscam apenas essas "palavras mágicas", ignorando esse tipo de viés oculto.
A Solução: O Detetive "RAVEN"
Os autores criaram uma ferramenta chamada RAVEN (Vigilância de Anomalia de Resposta) para pegar essas IAs de "disco riscado". Pense no RAVEN como um detet de que faz duas coisas:
- O Teste da "Câmara de Eco": O detetive faz à mesma IA a mesma pergunta 6 vezes, mas com redações diferentes. Se a IA der 6 respostas idênticas, é um sinal de alerta. Ela é excessivamente certa, excessivamente uniforme. Um cérebro saudável geralmente apresenta alguma variedade em seus pensamentos.
- O Teste do "Abraço Coletivo": O detetive então faz as mesmas perguntas aos outros quatro amigos de IA. Se a IA de "disco riscado" diz "X é ruim", mas os outros quatro amigos dizem "X é bom" ou "X é complicado", o detetive sabe que algo está errado com aquela IA específica.
Se uma IA é super confiante (dando a mesma resposta todas as vezes) E super diferente de seus amigos, o RAVEN a marca como suspeita. Ele não diz que a IA é "má" ou está "mentindo"; ele apenas diz: "Ei, esta aqui está agindo de forma estranhamente rígida em comparação ao resto. Vamos investigar".
O Que Eles Descobriram
Os pesquisadores testaram isso em cinco famílias diferentes de IA através de 12 tópicos sensíveis (como vacinas, imigração e pessoas famosas).
- O Experimento: Primeiro, eles tentaram "infectar" uma IA limpa, alimentando-a com uma pequena dieta de dados tendenciosos. Eles conseguiram! A IA começou a dar respostas rígidas e negativas sobre uma pessoa específica, mesmo sem nenhum código secreto ser usado. O RAVEN detectou isso imediatamente.
- O Mundo Real: Quando testaram IAs pré-treinadas reais (aquelas que as pessoas realmente usam), descobriram que 9 de 12 tópicos tinham pelo menos uma IA agindo como um "disco riscado".
- Por exemplo, uma IA (Mistral) foi estranhamente positiva sobre o histórico de segurança de uma determinada empresa de tecnologia, ignorando todas as preocupações levantadas pelas outras IAs.
- Outra IA (GPT-4o) foi estranhamente negativa sobre visões "equilibradas" sobre as mudanças climáticas, tratando qualquer opinião de meio-termo como negação da ciência.
- Uma IA (Llama-3) consistentemente transmitia vibrações negativas sobre uma celebridade específica, enquanto outras eram neutras.
A Conclusão
O artigo argumenta que precisamos parar de procurar apenas por "palavras de gatilho secretas" para manter a IA segura. Também precisamos vigiar a rigidez conceitual. Se uma IA subitamente se torna uma câmara de eco teimosa e unilateral sempre que um tópico específico surge, isso pode ser um sinal de viés oculto ou manipulação.
O RAVEN é como um sistema de alerta precoce. Ele não resolve o problema, mas toca o alarme para que os humanos possam olhar para a IA e perguntar: "Por que você está agindo tão estranhamente sobre esta coisa específica?". Ele nos ajuda a detectar esses comportamentos do tipo "propaganda" antes que eles se espalhem demais.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.