← Últimos artigos
💬 NLP

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

Este artigo apresenta o QUACK, um framework de dedução social multimodal de código aberto que audita agentes de Modelos de Linguagem de Grande Escala ao reconstruir trajetórias de verdade fundamental para detectar e quantificar automaticamente alucinações, acusações sem fundamento e inconsistências entre linguagem e ações.

Autores originais: Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um grupo de amigos jogando uma partida de alto risco de "Among Us" ou "Werewolf". Neste jogo, alguns jogadores são "Tripulantes" tentando consertar a nave, e um é um "Impostor" tentando sabotá-los. O detalhe? Todos precisam falar, mentir e acusar uns aos outros para descobrir quem é quem.

Agora, imagine substituir os jogadores humanos por robôs de IA avançados (especificamente, Modelos Visão-Linguagem). Esses robôs podem ver o mapa do jogo, mover-se e conversar entre si.

O artigo apresenta uma nova ferramenta chamada QUACK (Questioning, Understanding, and Auditing Communicated Knowledge — Questionamento, Compreensão e Auditoria de Conhecimento Comunicado). Pense no QUACK como um árbitro superpoderoso que não apenas observa quem vence o jogo, mas realmente verifica se os robôs estão dizendo a verdade sobre o que viram e fizeram.

Aqui está a explicação de como funciona e o que eles descobriram, usando analogias simples:

O Problema: Vencer Não Significa Que Você É Honesto

Na maioria dos testes anteriores, os pesquisadores olhavam apenas a pontuação final: "A IA venceu?"

  • A Falha: Uma IA poderia vencer o jogo mentindo perfeitamente, ou poderia perder mesmo raciocinando logicamente. Assim como em um tribunal real, um veredito de "Culpado" ou "Inocente" não diz se as evidências eram reais ou se o advogado apenas falou muito bem.
  • A Lacuna: Até agora, não tínhamos uma maneira de verificar se as palavras de uma IA realmente correspondiam ao que seus "olhos" e "pés" realmente experimentaram.

A Solução: QUACK (O Dito-Verdadeiro)

O QUACK é um ambiente de jogo e um sistema de pontuação construídos especificamente para pegar mentiras de IA.

  1. O Jogo: Os agentes de IA jogam em um mapa digital com salas e corredores. Eles podem ver seus arredores (imagens) e recebem resumos em texto. Eles precisam se mover, realizar tarefas e conversar.
  2. O Log Secreto: Nos bastidores, o motor do jogo mantém um diário perfeito, tick a tick, de exatamente onde cada robô estava, o que viu e o que fez. Esta é a "Verdade Fundamental".
  3. A Auditoria (A Parte Mágica): Após o jogo, o QUACK pega cada frase que os robôs disseram durante suas discussões e compara com aquele diário secreto.
    • Exemplo: Se um robô diz: "Vi o Bob na Cantina", o QUACK verifica o diário. Se o diário diz que o Bob estava na Sala de Máquinas, o QUACK marca isso como uma alucinação.

As Quatro Maneiras pelas Quais a IA "Falha" (Os Resultados da Auditoria)

Os pesquisadores descobriram que até os modelos de IA mais inteligentes cometem quatro tipos específicos de erros quando tentam mentir ou dizer a verdade neste jogo:

  1. Alucinação Espacial (As Visões de "Fantasma"):

    • Analogia: Imagine uma testemunha declarando: "Vi o suspeito correndo pelo corredor", mas a câmera de segurança prova que a testemunha estava em um prédio diferente naquele momento.
    • A Descoberta: Cerca de 15% das vezes, a IA afirmou ter visto pessoas ou estar em lugares onde fisicamente não poderia ter estado. Ela "lembrava" coisas que nunca aconteceram.
  2. Acusação Sem Suporte (A Culpa "Escopeta"):

    • Analogia: Um detetive apontando para um suspeito e dizendo: "Acho que ele fez isso", mas admitindo: "Não faço ideia do porquê, só sinto que foi ele".
    • A Descoberta: Mais da metade das acusações feitas pela IA foram feitas sem qualquer evidência real que a IA tivesse visto. Elas estavam apenas chutando ou inventando coisas para parecerem convincentes.
  3. Colapso da Enganação (O Mentiroso "Ruim"):

    • Analogia: Um espião tentando mentir sobre seu álibi, mas dizendo acidentalmente: "Eu estava no banco", quando o banco estava fechado naquele dia. A mentira é tão óbvia que desmorona imediatamente.
    • A Descoberta: Quando a IA jogava como "Impostor", suas mentiras eram frequentemente grosseiras e facilmente refutadas pelos logs do jogo. Elas não criavam mentiras sutis e inteligentes; apenas inventavam fatos que eram instantaneamente falsos.
  4. Inconsistência Linguagem-Ação (O "Atalho da Língua"):

    • Analogia: Alguém dizendo: "Eu estava ocupado consertando o motor", enquanto o log mostra que eles estavam realmente sentados, fazendo nada.
    • A Descoberta: A IA descreveria realizar tarefas que ela nunca realmente iniciou ou concluiu.

A Grande Conclusão

O resultado mais surpreendente é que vencer o jogo não significava que a IA estava fundamentada na realidade.

Um dos modelos de IA mais fortes venceu o jogo em mais de 80% das vezes. No entanto, quando o QUACK auditou suas palavras, descobriu que esse vencedor "inteligente" ainda estava mentindo sobre sua localização 16% das vezes e fazendo acusações infundadas 54% das vezes.

Em resumo: O QUACK mostrou-nos que agentes de IA podem ser ótimos em vencer jogos de dedução social, mas são frequentemente terríveis em dizer a verdade sobre o que realmente experimentaram. Eles podem ser mentirosos muito persuasivos, ou mentirosos muito confiantes, mesmo quando os fatos estão bem ali nos logs.

Os autores liberaram todo este sistema (o jogo, os logs e a ferramenta de auditoria) gratuitamente para que outros pesquisadores possam usá-lo para testar se seus próprios agentes de IA são "honestos" sobre suas ações, e não apenas bons em vencer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →