← Últimos artigos
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Este artigo apresenta o Deepchecks, um framework abrangente projetado para abordar os desafios complexos de avaliar sistemas de Geração Aumentada por Recuperação (RAG), fornecendo avaliação multifacetada, análise de causa raiz e monitoramento de produção para garantir confiabilidade, relevância e alinhamento com requisitos específicos da aplicação.

Autores originais: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Publicado 2026-05-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente muito inteligente e falante (um Modelo de Linguagem de Grande Escala, ou LLM). Esse assistente é ótimo em escrever histórias e responder perguntas, mas tem um mau hábito: às vezes ele inventa coisas completamente, ou dá respostas genéricas que não se encaixam bem na situação específica. Isso é como um aluno que memorizou um livro didático, mas esqueceu de verificar os detalhes específicos da pergunta da tarefa de casa, levando a respostas confiantes, porém erradas.

Para corrigir isso, desenvolvedores criaram um sistema chamado RAG (Geração Aumentada por Recuperação). Pense no RAG como dar a esse assistente inteligente um cartão de biblioteca e um bibliotecário.

  1. O Bibliotecário (Recuperação): Antes do assistente responder, o bibliotecário procura rapidamente na biblioteca (um banco de dados de documentos) para encontrar as páginas exatas relevantes para a pergunta.
  2. O Assistente (Geração): O assistente lê essas páginas e depois escreve a resposta, usando os livros da biblioteca como sua fonte de verdade.

O Problema:
Mesmo com um bibliotecário, o sistema ainda pode falhar. O bibliotecário pode pegar os livros errados, ou o assistente pode ignorar os livros e inventar coisas de qualquer maneira. O artigo explica que verificar se todo esse sistema funciona bem é incrivelmente difícil porque há muitas partes em movimento.

A Solução: Deepchecks
Os autores introduzem o Deepchecks, que atua como um inspetor de controle de qualidade super rigoroso para esses sistemas RAG. Em vez de apenas dar uma única nota de "aprovado/reprovado", o Deepchecks divide o sistema em "propriedades" específicas para verificar, assim como um mecânico de carros verifica diferentes partes de um motor.

Veja como o Deepchecks inspeciona o sistema, usando analogias simples:

1. As Três Principais Verificações (As "Propriedades")

O Deepchecks analisa três coisas específicas para garantir que a resposta seja boa:

  • Relevância da Recuperação (O Bibliotecário encontrou os livros certos?):
    • Analogia: Se você perguntar "Como faço um bolo?", o bibliotecário não deve entregar a você um livro sobre "Como consertar um carro". O Deepchecks verifica se os documentos recuperados são realmente úteis para a pergunta.
  • Fundamentado no Contexto (O Assistente manteve-se nos livros?):
    • Analogia: Este é o detector de "alucinação". Se o livro diz que o bolo precisa de 2 ovos, mas o assistente diz 10 ovos, o Deepchecks pega essa mentira. Ele verifica se cada fato na resposta é realmente suportado pelos documentos que o bibliotecário encontrou.
  • Completude (O Assistente respondeu a pergunta inteira?):
    • Analogia: Se você perguntou "Como faço um bolo e a que temperatura o forno deve estar?", a resposta não deve dizer apenas "Coloque no forno". O Deepchecks verifica se o assistente cobriu todas as partes do seu pedido.

(Há também uma Verificação de Segurança para garantir que o assistente não esteja sendo rude, vazando informações privadas ou dizendo qualquer coisa perigosa.)

2. A Pontuação "Holística" (A Nota Final)

A maioria das ferramentas apenas fornece uma lista de pontuações para as partes acima. O Deepchecks vai um passo além. Ele usa um "mecanismo de agregação" inteligente (uma fórmula aprendida) para combinar todas essas pontuações em uma única nota final: Positiva, Negativa ou Desconhecida.

  • Positiva: O bibliotecário encontrou os livros certos, e o assistente respondeu perfeitamente com base neles.
  • Negativa: Algo deu errado (livros errados, fatos inventados ou resposta incompleta).
  • Desconhecida: Não foi terrível, mas não atingiu exatamente a barra alta de "perfeito".

3. As Ferramentas de Detetive (Análise de Causa Raiz)

Se o sistema receber uma nota "Negativa", o Deepchecks não apenas diz que falhou; ele age como um detetive para dizer por quê.

  • Analogia: Imagine que um carro quebrou. Um mecânico básico diz: "Está quebrado". O Deepchecks diz: "O motor está bem, mas os pneus estão furados".
  • Isso ajuda os desenvolvedores a saber exatamente onde corrigir o problema: Eles precisam de um bibliotecário melhor (recuperação melhor)? Ou precisam treinar o assistente para ouvir melhor (geração melhor)?

4. A "Máquina do Tempo" (Comparação de Versões e Monitoramento)

O Deepchecks também permite comparar diferentes versões do seu sistema lado a lado.

  • Analogia: É como comparar o desempenho de um carro antes e depois de você trocar os pneus. Os novos pneus o tornaram mais rápido?
  • Ele também monitora o sistema enquanto ele está rodando no mundo real. Se o sistema começar a piorar com o tempo (talvez porque os livros da biblioteca mudaram ou as perguntas dos usuários mudaram), o Deepchecks levanta um alarme imediatamente.

O Que o Artigo Encontrou

Os autores testaram o Deepchecks contra outras ferramentas populares (como RAGAS e LangSmith) usando:

  1. Conjuntos de Dados Públicos: Perguntas de teste padrão que todos conhecem.
  2. Conjuntos de Dados de Clientes: Exemplos do mundo real de empresas reais (como chats de suporte técnico e avaliações de candidatos a emprego).

O Resultado: O Deepchecks foi melhor em detectar erros, especialmente nos dados reais de clientes. Enquanto outras ferramentas às vezes perdiam erros ou davam notas inconsistentes, o Deepchecks foi mais preciso ao identificar quando o sistema estava mentindo (alucinando) ou dando respostas irrelevantes.

Em Resumo:
O Deepchecks é um kit de ferramentas abrangente que garante que seu assistente de IA não esteja apenas falando com confiança, mas esteja realmente dizendo a verdade com base nos documentos que você forneceu a ele. Ele verifica o bibliotecário, verifica o escritor, verifica a segurança e fornece um boletim claro para que você possa corrigir exatamente o que está quebrado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →