← Últimos artigos
💻 computer science

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

Este artigo revela uma vulnerabilidade crítica na cadeia de suprimentos de agentes de LLM, onde eles frequentemente alucinam nomes de habilidades inexistentes com alta consistência, criando um vetor de ataque explorável que não pode ser resolvido apenas pelo ajuste do modelo, mas que exige mudanças estruturais em todo o ecossistema, como reservas de nomes em nível de registro.

Autores originais: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

Publicado 2026-07-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô super inteligente que consegue aprender novos truques. Em vez de você vasculhar uma biblioteca gigante para encontrar o truque certo, você apenas pergunta ao robô: "Ei, qual é um bom truque para organizar meus arquivos?" O robô deve procurar um manual de instruções real e pré-fabricado (chamado de "habilidade") e fornecer o nome para que você possa baixá-lo.

Mas aqui está a parte assustadora: o robô é um mentiroso confiante.

O Truque de Mágica que Não é Mágica

Neste estudo, pesquisadores perguntaram a 12 diferentes cérebros de robôs (alguns são apenas o cérebro, outros são cérebros com ferramentas de busca na web) para recomendar habilidades para 15.000 perguntas diferentes. Eles descobriram que todos eles inventaram nomes de habilidades falsos.

Em média, 36,0% das vezes, um cérebro de robô isolado inventou um nome. Quando o robô fazia parte de um sistema de "agente" completo (com ferramentas e busca), era 36,9% falso. E quando as perguntas vinham de desenvolvedores reais pedindo ajuda, a taxa de mentira saltou para 43,1%.

Os robôs não disseram apenas "Eu não sei". Eles disseram confiantemente: "Oh, você precisa de file-system-operations!" ou "Tente visual-studio-code!" O problema? Essas habilidades não existem. Os robôs pegaram uma descrição do que eles achavam que você precisava e a transformaram em um nome, como um chef que, ao ser solicitado uma receita para "sopa apimentada", inventa um prato chamado "receita-de-sopa-apimentada" que ninguém nunca cozinhou de verdade.

A Armadilha do "Fantasma"

Por que isso é perigoso? Imagine um ladrão parado do lado de fora de uma loja de brinquedos. O ladrão ouve o robô dizer a uma criança: "Você precisa da super-cool-bike!" A criança procura por ela, mas ela não está lá.

O ladrão sabe que o robô dirá a mesma coisa para a próxima criança. Então, o ladrão vai ao catálogo da loja e registra uma bicicleta real chamada super-cool-bike, mas ele esconde uma armadilha nas instruções. Agora, quando a próxima criança perguntar ao robô, o robô diz: "Pegue a super-cool-bike!" A criança baixa e, bam — a armadilha dispara.

Os pesquisadores provaram que isso é possível. Eles descobriram que os robôs são surpreendentemente teimosos. Se você fizer a mesma pergunta para o mesmo robô 10 vezes, ele frequentemente dará o mesmo nome falso exatamente 7,8 vezes em 10. Não é ruído aleatório; é um padrão previsível.

Na verdade, os pesquisadores descobriram 410 nomes falsos que eram tão populares que diferentes robôs continuavam inventando-os repetidamente. Se um vilão registrasse apenas os 500 desses nomes falsos, ele poderia potencialmente enganar 57% de todas as vítimas que pediram ajuda em seus testes.

Por que não podemos apenas consertar isso?

Você pode pensar: "O robô não pode simplesmente verificar na internet se a habilidade existe?" Os pesquisadores testaram isso. Eles deram aos robôs ferramentas de busca na web e disseram: "Verifique antes de responder!"

Não funcionou. Os robôs ainda mentiram. Por quê? Porque quando eles pesquisaram por file-system-operations, a internet estava cheia de artigos sobre sistemas de arquivos. O robô viu as palavras e pensou: "Aha! Isso existe!" Ele não percebeu que estava procurando por um arquivo de habilidade específico que não existia. A busca confirmou que o conceito era real, mas não a habilidade.

A Falha da "Autoverificação"

Os pesquisadores também pediram aos robôs que verificassem seu próprio trabalho. "Você acabou de inventar isso?" eles perguntaram.
Os robôs falharam miseravelmente. Eles não foram melhores do que jogar uma moeda para o alto, acertando apenas 51% das vezes. É como perguntar a uma pessoa que acabou de contar uma mentira se ela está mentindo; elas geralmente dobram a aposta.

O Compromisso de "Segurança"

Então, como paramos isso? Os pesquisadores tentaram algumas coisas:

  1. Geração Aumentada de Recuperação (RAG): Isso força o robô a olhar para uma lista de habilidades reais antes de responder. Isso funcionou muito bem para interromper as mentiras, derrubando a taxa de falsidade de 40,8% para 3,2%.
    • A Ressalva: O robô tornou-se inútil. Porque estava com tanto medo de cometer um erro, ele parou de responder à maioria das perguntas. Mesmo com essa rede de segurança, o robô encontrou a habilidade correta apenas uma vez em seis.
  2. Votação: Eles tentaram fazer com que múltiplos robôs concordassem com uma resposta. Isso interrompeu 92,8% das mentiras, mas, novamente, isso matou a capacidade do robô de ser útil, reduzindo significativamente sua taxa de sucesso para habilidades reais.

A Conclusão Final

O artigo conclui que isso não é um erro que você possa corrigir apenas "ajustando" o robô ou dizendo a ele para ser mais cuidadoso. O problema está embutido na forma como esses robôs pensam. Eles são bons demais em adivinhar como um nome deveria parecer, e ruins demais em saber o que realmente existe.

Para consertar isso, os pesquisadores dizem que não podemos confiar apenas nos robôs. Precisamos mudar todo o sistema: as "bibliotecas" onde as habilidades vivem precisam reservar nomes para que os robôs não possam inventá-los, e os robôs precisam de uma maneira de verificar uma lista verificada antes de falar. Até lá, se o seu assistente robô recomendar uma nova habilidade, verifique primeiro se ela realmente existe, porque pode ser apenas um fantasma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →