Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents
Este artigo apresenta um benchmark unificado para detecção de alucinação em nível de span através de diversos inputs estruturados como código e saídas de ferramentas, demonstrando que um modelo Qwen3.5-2B ajustado supera significativamente os detectores existentes e juízes zero-shot nesses domínios complexos, ao mesmo tempo em que mantém competitividade em benchmarks de RAG de linguagem natural.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está contratando um assistente muito inteligente e de fala rápida para escrever um relatório para você. Você entrega a ele uma pilha de livros de referência (o "contexto") e uma pergunta específica. Eles digitam rapidamente uma resposta.
O problema? Às vezes, mesmo os assistentes mais inteligentes podem ser um pouco criativos. Eles podem inventar um fato, misturar um número ou citar uma página que não existe em seus livros. Isso é chamado de alucinação.
Por muito tempo, pesquisadores construíram "verificadores de fatos" para pegar esses erros, mas eles só funcionavam quando os assistentes escreviam sobre tópicos normais, como história ou ciência, usando texto simples.
Este artigo apresenta um novo verificador de fatos, muito mais difícil, projetado para o mundo moderno, onde os assistentes também estão escrevendo código de computador, resumindo logs de ferramentas de software e lendo documentos estruturados como tabelas e manuais.
Aqui está uma divisão do que eles fizeram, usando algumas analogias do cotidiano:
1. O Problema: O Ponto Cego do "Código" e do "Log"
Imagine que seu assistente é um mecânico.
- Verificadores Antigos: Ótimos para verificar se o mecânico disse "O carro é vermelho" quando o carro é, na verdade, azul.
- A Nova Realidade: O mecânico agora está escrevendo um manual de reparo complexo (código) ou lendo uma tela de diagnóstico digital (saída de ferramenta). Se o mecânico escrever um comando errado como
desligar_motorem vez deligar_motor, o carro inteiro pode quebrar. Ou se ele listar um número de peça que não existe, o pedido falha. - A Lacuna: Os verificadores de fatos existentes eram como um humano lendo um romance; eles não sabiam como detectar uma única linha errada em um programa de computador ou um erro específico em um log de software. Eles não conseguiam distinguir entre um termo técnico real e um inventado.
2. A Solução: Um Jogo de "Encontre a Diferença"
Os autores construíram um novo campo de treinamento massivo (um benchmark) para ensinar computadores a serem esses verificadores de fatos especializados.
- Como eles criaram os dados: Eles começaram com respostas perfeitas e corretas (como um manual de reparo perfeito). Em seguida, usaram um "injetor de alucinações" (pense nisso como um editor travesso) para introduzir mentiras minúsculas e localizadas.
- Exemplo: Eles mudaram um nome de função real
set_devicepara um falsoset_active_device. - Eles não disseram apenas "Esta resposta está errada". Eles marcaram os caracteres exatos onde a mentira ocorreu.
- Exemplo: Eles mudaram um nome de função real
- A Variedade: Eles criaram mais de 74.000 exemplos cobrindo:
- Código: Correções reais de software do GitHub.
- Saída de Ferramenta: Logs de ferramentas de software (como mensagens de erro ou resultados de busca).
- Documentos Estruturados: Artigos de pesquisa, arquivos README e páginas da Wikipedia com tabelas e listas.
- Texto Normal: Perguntas e respostas padrão (para garantir que não esquecessem como verificar texto normal).
3. O Novo Detetive: "LettuceDetect"
Eles treinaram um novo modelo de IA (uma versão de 2 bilhões de parâmetros de um modelo chamado Qwen) para agir como o detetive.
- O Trabalho: O detetive olha para a Requisição, os Livros de Referência e a Resposta do Assistente. Ele deve apontar o dedo para a mentira exata e dizer: "Esta palavra específica é inventada" ou "Este número está errado".
- Os Resultados:
- Em Código e Ferramentas: O novo detetio é um super-herói. Ele detectou 60% das mentiras em código e logs de ferramentas.
- A Competição: Os antigos verificadores "prontos para uso" (como o LettuceDetect-large) e até mesmo gigantes e inteligentes juízes de IA (LLMs Zero-shot) detectaram apenas cerca de 17% a 22% das mentiras em código. Eles eram essencialmente cegos para erros técnicos.
- Em Texto Normal: O novo detetive ainda é muito bom ao verificar texto normal (pontuando de forma semelhante aos melhores sistemas existentes), provando que não perdeu seu conhecimento geral ao aprender a ler código.
4. Por que o "Nível de Trecho" (Span-Level) Importa
O artigo enfatiza que eles não apenas dizem "Rejeite esta resposta". Eles fazem a Detecção em Nível de Trecho (Span-Level).
- Analogia: Imagine que um aluno escreve um ensaio de 10 páginas. Uma frase é uma mentira.
- Jeito Antigo: "Reprove o ensaio inteiro." (Muito severo, as outras 9 páginas podem estar perfeitas).
- Jeito Novo: "Destaque a única frase que é uma mentira." (Preciso e útil).
- No código, isso é crítico. Se um programa tem 100 linhas e apenas uma linha está errada, você não quer descartar o programa inteiro; você só quer corrigir aquela linha específica.
Resumo
Este artigo apresenta um novo "detector de verdade" unificado que pode lidar com a realidade técnica e bagunçada dos assistentes de IA modernos. Ele vai além de apenas verificar textos simples para detectar erros minúsculos e perigosos em código, logs de software e documentos estruturados.
O novo modelo deles, LettuceDetect-Qwen-2B, é significativamente melhor em encontrar essas mentiras técnicas do que as ferramentas anteriores, especialmente quando o assistente está escrevendo código ou lendo logs de software, mantendo-se ao mesmo tempo como um verificador de fatos de alto nível para a linguagem normal. Eles lançaram todos os seus dados e modelos para que outros possam usar este jogo de "encontre a diferença" para construir sistemas de IA melhores e mais confiáveis.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.