Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)
Este artigo apresenta o Deepchecks, um framework abrangente projetado para abordar os desafios complexos de avaliar sistemas de Geração Aumentada por Recuperação (RAG), fornecendo avaliação multifacetada, análise de causa raiz e monitoramento de produção para garantir confiabilidade, relevância e alinhamento com requisitos específicos da aplicação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um assistente muito inteligente e falante (um Modelo de Linguagem de Grande Escala, ou LLM). Esse assistente é ótimo em escrever histórias e responder perguntas, mas tem um mau hábito: às vezes ele inventa coisas completamente, ou dá respostas genéricas que não se encaixam bem na situação específica. Isso é como um aluno que memorizou um livro didático, mas esqueceu de verificar os detalhes específicos da pergunta da tarefa de casa, levando a respostas confiantes, porém erradas.
Para corrigir isso, desenvolvedores criaram um sistema chamado RAG (Geração Aumentada por Recuperação). Pense no RAG como dar a esse assistente inteligente um cartão de biblioteca e um bibliotecário.
- O Bibliotecário (Recuperação): Antes do assistente responder, o bibliotecário procura rapidamente na biblioteca (um banco de dados de documentos) para encontrar as páginas exatas relevantes para a pergunta.
- O Assistente (Geração): O assistente lê essas páginas e depois escreve a resposta, usando os livros da biblioteca como sua fonte de verdade.
O Problema:
Mesmo com um bibliotecário, o sistema ainda pode falhar. O bibliotecário pode pegar os livros errados, ou o assistente pode ignorar os livros e inventar coisas de qualquer maneira. O artigo explica que verificar se todo esse sistema funciona bem é incrivelmente difícil porque há muitas partes em movimento.
A Solução: Deepchecks
Os autores introduzem o Deepchecks, que atua como um inspetor de controle de qualidade super rigoroso para esses sistemas RAG. Em vez de apenas dar uma única nota de "aprovado/reprovado", o Deepchecks divide o sistema em "propriedades" específicas para verificar, assim como um mecânico de carros verifica diferentes partes de um motor.
Veja como o Deepchecks inspeciona o sistema, usando analogias simples:
1. As Três Principais Verificações (As "Propriedades")
O Deepchecks analisa três coisas específicas para garantir que a resposta seja boa:
- Relevância da Recuperação (O Bibliotecário encontrou os livros certos?):
- Analogia: Se você perguntar "Como faço um bolo?", o bibliotecário não deve entregar a você um livro sobre "Como consertar um carro". O Deepchecks verifica se os documentos recuperados são realmente úteis para a pergunta.
- Fundamentado no Contexto (O Assistente manteve-se nos livros?):
- Analogia: Este é o detector de "alucinação". Se o livro diz que o bolo precisa de 2 ovos, mas o assistente diz 10 ovos, o Deepchecks pega essa mentira. Ele verifica se cada fato na resposta é realmente suportado pelos documentos que o bibliotecário encontrou.
- Completude (O Assistente respondeu a pergunta inteira?):
- Analogia: Se você perguntou "Como faço um bolo e a que temperatura o forno deve estar?", a resposta não deve dizer apenas "Coloque no forno". O Deepchecks verifica se o assistente cobriu todas as partes do seu pedido.
(Há também uma Verificação de Segurança para garantir que o assistente não esteja sendo rude, vazando informações privadas ou dizendo qualquer coisa perigosa.)
2. A Pontuação "Holística" (A Nota Final)
A maioria das ferramentas apenas fornece uma lista de pontuações para as partes acima. O Deepchecks vai um passo além. Ele usa um "mecanismo de agregação" inteligente (uma fórmula aprendida) para combinar todas essas pontuações em uma única nota final: Positiva, Negativa ou Desconhecida.
- Positiva: O bibliotecário encontrou os livros certos, e o assistente respondeu perfeitamente com base neles.
- Negativa: Algo deu errado (livros errados, fatos inventados ou resposta incompleta).
- Desconhecida: Não foi terrível, mas não atingiu exatamente a barra alta de "perfeito".
3. As Ferramentas de Detetive (Análise de Causa Raiz)
Se o sistema receber uma nota "Negativa", o Deepchecks não apenas diz que falhou; ele age como um detetive para dizer por quê.
- Analogia: Imagine que um carro quebrou. Um mecânico básico diz: "Está quebrado". O Deepchecks diz: "O motor está bem, mas os pneus estão furados".
- Isso ajuda os desenvolvedores a saber exatamente onde corrigir o problema: Eles precisam de um bibliotecário melhor (recuperação melhor)? Ou precisam treinar o assistente para ouvir melhor (geração melhor)?
4. A "Máquina do Tempo" (Comparação de Versões e Monitoramento)
O Deepchecks também permite comparar diferentes versões do seu sistema lado a lado.
- Analogia: É como comparar o desempenho de um carro antes e depois de você trocar os pneus. Os novos pneus o tornaram mais rápido?
- Ele também monitora o sistema enquanto ele está rodando no mundo real. Se o sistema começar a piorar com o tempo (talvez porque os livros da biblioteca mudaram ou as perguntas dos usuários mudaram), o Deepchecks levanta um alarme imediatamente.
O Que o Artigo Encontrou
Os autores testaram o Deepchecks contra outras ferramentas populares (como RAGAS e LangSmith) usando:
- Conjuntos de Dados Públicos: Perguntas de teste padrão que todos conhecem.
- Conjuntos de Dados de Clientes: Exemplos do mundo real de empresas reais (como chats de suporte técnico e avaliações de candidatos a emprego).
O Resultado: O Deepchecks foi melhor em detectar erros, especialmente nos dados reais de clientes. Enquanto outras ferramentas às vezes perdiam erros ou davam notas inconsistentes, o Deepchecks foi mais preciso ao identificar quando o sistema estava mentindo (alucinando) ou dando respostas irrelevantes.
Em Resumo:
O Deepchecks é um kit de ferramentas abrangente que garante que seu assistente de IA não esteja apenas falando com confiança, mas esteja realmente dizendo a verdade com base nos documentos que você forneceu a ele. Ele verifica o bibliotecário, verifica o escritor, verifica a segurança e fornece um boletim claro para que você possa corrigir exatamente o que está quebrado.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.