← Ultimi articoli
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Questo documento introduce Deepchecks, un framework completo progettato per affrontare le sfide complesse della valutazione dei sistemi di Generazione Aumentata dal Recupero (RAG) fornendo una valutazione multiforme, un'analisi delle cause profonde e un monitoraggio in produzione per garantire affidabilità, pertinenza e allineamento con i requisiti specifici dell'applicazione.

Autori originali: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Pubblicato 2026-05-15
📖 5 min di lettura🧠 Approfondimento

Autori originali: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente molto intelligente e loquace (un Modello Linguistico di Grande Dimensione, o LLM). Questo assistente è eccellente nel scrivere storie e rispondere a domande, ma ha una cattiva abitudine: a volte inventa completamente le cose, oppure fornisce risposte generiche che non si adattano perfettamente alla situazione specifica. È come uno studente che ha memorizzato un libro di testo ma ha dimenticato di verificare i dettagli specifici della domanda del compito, portando a risposte sicure ma errate.

Per risolvere questo problema, gli sviluppatori hanno creato un sistema chiamato RAG (Generazione Aumentata dal Recupero). Pensa a RAG come all'aver fornito a quel intelligente assistente una tessera bibliotecaria e un bibliotecario.

  1. Il Bibliotecario (Recupero): Prima che l'assistente risponda, il bibliotecario cerca rapidamente nella biblioteca (un database di documenti) per trovare le pagine esatte pertinenti alla domanda.
  2. L'Assistente (Generazione): L'assistente legge quelle pagine e poi scrive la risposta, utilizzando i libri della biblioteca come fonte di verità.

Il Problema:
Anche con un bibliotecario, il sistema può ancora fallire. Il bibliotecario potrebbe estrarre i libri sbagliati, oppure l'assistente potrebbe ignorare i libri e inventare comunque le cose. Il documento spiega che verificare se l'intero sistema funziona bene è incredibilmente difficile perché ci sono così tante parti in movimento.

La Soluzione: Deepchecks
Gli autori introducono Deepchecks, che agisce come un ispettore del controllo qualità super severo per questi sistemi RAG. Invece di fornire semplicemente un unico voto "passa/non passa", Deepchecks scompone il sistema in specifiche "proprietà" da verificare, proprio come un meccanico automobilistico che controlla diverse parti di un motore.

Ecco come Deepchecks ispeziona il sistema, utilizzando semplici analogie:

1. I Tre Controlli Principali (Le "Proprietà")

Deepchecks esamina tre cose specifiche per garantire che la risposta sia buona:

  • Rilevanza del Recupero (Il Bibliotecario ha trovato i libri giusti?):
    • Analogia: Se chiedi "Come si cuoce una torta?", il bibliotecario non dovrebbe consegnarti un libro su "Come riparare un'auto". Deepchecks verifica se i documenti estratti sono effettivamente utili per la domanda.
  • Fondato nel Contesto (L'Assistente si è attenuto ai libri?):
    • Analogia: Questo è il rilevatore di "allucinazioni". Se il libro dice che la torta ha bisogno di 2 uova, ma l'assistente dice 10 uova, Deepchecks coglie quella bugia. Verifica che ogni fatto nella risposta sia effettivamente supportato dai documenti che il bibliotecario ha trovato.
  • Completezza (L'Assistente ha risposto all'intera domanda?):
    • Analogia: Se hai chiesto "Come si cuoce una torta e a che temperatura deve essere il forno?", la risposta non dovrebbe dire solo "Mettila nel forno". Deepchecks verifica se l'assistente ha coperto tutte le parti della tua richiesta.

(Esiste anche un Controllo di Sicurezza per assicurarsi che l'assistente non sia scortese, non stia rivelando informazioni private o non stia dicendo nulla di pericoloso.)

2. Il Punteggio "Olistico" (Il Voto Finale)

La maggior parte degli strumenti ti fornisce solo un elenco di punteggi per le parti sopra. Deepchecks va oltre. Utilizza un "meccanismo di aggregazione" intelligente (una formula appresa) per combinare tutti quei punteggi in un unico voto finale: Positivo, Negativo o Sconosciuto.

  • Positivo: Il bibliotecario ha trovato i libri giusti e l'assistente ha risposto perfettamente basandosi su di essi.
  • Negativo: Qualcosa è andato storto (libri sbagliati, fatti inventati o risposta incompleta).
  • Sconosciuto: Non è stato terribile, ma non ha raggiunto pienamente l'asticella alta del "perfetto".

3. Gli Strumenti da Investigatore (Analisi della Causa Radice)

Se il sistema riceve un voto "Negativo", Deepchecks non ti dice solo che ha fallito; agisce come un investigatore per dirti perché.

  • Analogia: Immagina che un'auto si guasti. Un meccanico di base dice: "È rotta". Deepchecks dice: "Il motore è a posto, ma le gomme sono sgonfie".
  • Questo aiuta gli sviluppatori a sapere esattamente dove risolvere il problema: hanno bisogno di un bibliotecario migliore (recupero migliore)? O hanno bisogno di addestrare l'assistente ad ascoltare meglio (generazione migliore)?

4. La "Macchina del Tempo" (Confronto delle Versioni e Monitoraggio)

Deepchecks ti permette anche di confrontare diverse versioni del tuo sistema fianco a fianco.

  • Analogia: È come confrontare le prestazioni di un'auto prima e dopo aver cambiato le gomme. Le nuove gomme l'hanno resa più veloce?
  • Monitora anche il sistema mentre è in esecuzione nel mondo reale. Se il sistema inizia a peggiorare nel tempo (magari perché i libri della biblioteca sono cambiati o le domande degli utenti sono cambiate), Deepchecks alza immediatamente un allarme.

Cosa ha Scoperto il Documento

Gli autori hanno testato Deepchecks contro altri strumenti popolari (come RAGAS e LangSmith) utilizzando:

  1. Dataset Pubblici: Domande di test standard che tutti conoscono.
  2. Dataset dei Clienti: Esempi del mondo reale provenienti da aziende reali (come chat di supporto tecnico e recensioni di candidati al lavoro).

Il Risultato: Deepchecks è stato migliore nel rilevare errori, specialmente nei dati dei clienti reali. Mentre altri strumenti a volte hanno mancato errori o hanno fornito voti incoerenti, Deepchecks è stato più accurato nel identificare quando il sistema stava mentendo (allucinando) o fornendo risposte irrilevanti.

In Sintesi:
Deepchecks è un kit completo che garantisce che il tuo assistente AI non stia solo parlando con sicurezza, ma stia effettivamente dicendo la verità basandosi sui documenti che gli hai fornito. Controlla il bibliotecario, controlla lo scrittore, controlla la sicurezza e ti fornisce una pagella chiara così puoi riparare esattamente ciò che è rotto.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →