Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
Este artigo apresenta um novo quadro de avaliação que utiliza um analisador sintático (AST) para avaliar relatórios de pesquisa gerados por LLMs quanto à validade dos links, relevância e precisão factual, revelando uma desconexão crítica na qual até mesmo os modelos de ponta mantêm alta acessibilidade e relevância das citações, mas lutam com a consistência factual, um problema que se agrava à medida que a profundidade de recuperação aumenta.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está contratando uma equipe de assistentes de pesquisa superinteligentes (modelos de IA) para escrever um relatório sobre um tema complexo. Você diz a eles: "Vão encontrar a verdade na internet, escrevam um relatório e certifiquem-se de listar exatamente onde encontraram cada único fato."
O artigo que você compartilhou é como um inspetor de controle de qualidade que decidiu verificar o dever de casa entregue por esses assistentes de IA. Em vez de apenas ler o relatório e concordar com a cabeça, o inspetor construiu um robô especial para verificar cada nota de rodapé que a IA escreveu.
Eis o que eles descobriram, explicado de forma simples:
A Inspeção de Três Etapas
Os pesquisadores construíram um sistema para verificar as citações da IA de três maneiras específicas, como uma verificação de segurança em três partes:
- A Verificação "A Porta Está Aberta?" (O Link Funciona): O link realmente funciona? Se você clicar nele, ele leva você a uma página da web, ou é um erro 404 quebrado?
- A Verificação "Isso Trata da Mesma Coisa?" (Conteúdo Relevante): Se o link funciona, a página da web realmente fala sobre o tópico que a IA afirmou que tratava? (Por exemplo: a IA diz "Este link prova que gatos são cães", mas o link é, na verdade, uma receita de lasanha).
- A Verificação "É Verdade?" (Verificação de Fatos): Esta é a parte mais difícil. A página da web realmente contém os fatos específicos, números ou datas que a IA disse que continha?
A Grande Surpresa: O Problema do "Embalagem Brilhante"
A descoberta mais chocante é que os assistentes de IA são ótimos nas duas primeiras verificações, mas terríveis na terceira.
- A Analogia: Imagine um estudante que escreve um trabalho e inclui uma bibliografia.
- 94% das vezes, os livros na bibliografia realmente existem nas prateleiras da biblioteca (O Link Funciona).
- 80% das vezes, esses livros são realmente sobre o assunto sobre o qual o estudante está escrevendo (Conteúdo Relevante).
- Mas, quando você realmente abre o livro e lê a página específica que o estudante citou, apenas cerca de 40% a 77% das vezes o livro realmente diz o que o estudante afirmou que dizia.
A Conclusão: A IA é muito boa em encontrar um link funcional para um site relevante, mas frequentemente está mentindo sobre o que esse site diz. É como um guia turístico que sempre leva você ao museu certo, mas depois conta a história errada sobre as exposições dentro dele.
O Paradoxo "Mais é Menos"
Os pesquisadores também testaram o que acontece se eles pedirem à IA para pesquisar mais a fundo e olhar mais sites. Você pode pensar: "Se eu pedir à IA para ler 150 sites em vez de apenas 2, ela será mais precisa, certo?"
Errado.
- A Analogia: Imagine tentar resolver um quebra-cabeça. Se você tiver apenas 2 peças, pode facilmente ver a imagem. Se alguém despejar 150 peças na sua frente, você fica sobrecarregado. Você pode começar a forçar peças que não se encaixam apenas para terminar a imagem.
- O Resultado: À medida que a IA foi forçada a olhar para fontes cada vez mais numerosas (de 2 até 150), sua capacidade de dizer a verdade realmente caiu cerca de 42%. Os links ainda funcionavam e os tópicos ainda eram relevantes, mas os fatos específicos tornaram-se uma bagunça. A IA sofreu "sobrecarga de informação" e começou a alucinar detalhes.
Quem Se Saiu Bem? Quem Se Saiu Mal?
- Os Modelos de "Fronteira" (As IAs das Grandes Empresas de Tecnologia): Esses modelos (como os da OpenAI, Anthropic e Google) foram muito bons em gerar relatórios que pareciam perfeitos. Eles quase sempre encontraram links funcionais e tópicos relevantes. No entanto, mesmo os mais inteligentes acertaram os fatos apenas cerca de 39% a 77% das vezes.
- Os Modelos de Código Aberto: Esses modelos lutaram ainda mais. Muitos deles nem conseguiram terminar a tarefa de escrever um relatório com citações. Quando tentaram, foram muito piores em encontrar links funcionais e acertar os fatos.
A Conclusão Final
O artigo conclui que não podemos confiar na pesquisa da IA apenas porque ela tem uma lista de links no final. Uma longa lista de links funcionais cria uma "falsa sensação de confiança". Apenas porque a porta está aberta e o cômodo é o certo, não significa que a história que a IA conta sobre o que há dentro do cômodo seja verdadeira.
Os pesquisadores construíram esse "robô inspetor" para nos ajudar a ver essa lacuna entre uma citação que parece boa e uma citação que é realmente verdadeira.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.