← Derniers articles
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Ce document présente Deepchecks, un cadre complet conçu pour répondre aux défis complexes de l'évaluation des systèmes de génération augmentée par récupération (RAG) en fournissant une évaluation multidimensionnelle, une analyse des causes racines et une surveillance en production afin d'assurer la fiabilité, la pertinence et l'alignement avec les exigences spécifiques à l'application.

Auteurs originaux : Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Publié 2026-05-15
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant très intelligent et bavard (un Modèle de Langage, ou LLM). Cet assistant est excellent pour écrire des histoires et répondre à des questions, mais il a une mauvaise habitude : parfois, il invente complètement des choses, ou il donne des réponses génériques qui ne correspondent pas tout à fait à la situation spécifique. C'est comme un étudiant qui a mémorisé un manuel scolaire mais a oublié de vérifier les détails spécifiques de la question de devoir, ce qui conduit à des réponses confiantes mais erronées.

Pour corriger cela, les développeurs ont créé un système appelé RAG (Génération Augmentée par Récupération). Imaginez le RAG comme donnant à cet assistant intelligent une carte de bibliothèque et un bibliothécaire.

  1. Le Bibliothécaire (Récupération) : Avant que l'assistant ne réponde, le bibliothécaire recherche rapidement dans la bibliothèque (une base de données de documents) pour trouver les pages exactes pertinentes pour la question.
  2. L'Assistant (Génération) : L'assistant lit ces pages, puis rédige la réponse, en utilisant les livres de la bibliothèque comme source de vérité.

Le Problème :
Même avec un bibliothécaire, le système peut encore échouer. Le bibliothécaire pourrait sortir les mauvais livres, ou l'assistant pourrait ignorer les livres et inventer des choses de toute façon. L'article explique que vérifier si tout ce système fonctionne bien est incroyablement difficile car il y a tellement de pièces mobiles.

La Solution : Deepchecks
Les auteurs présentent Deepchecks, qui agit comme un inspecteur de contrôle qualité ultra-sévère pour ces systèmes RAG. Au lieu de simplement donner une note unique « réussi/échoué », Deepchecks décompose le système en « propriétés » spécifiques à vérifier, un peu comme un mécanicien de voiture vérifiant différentes parties d'un moteur.

Voici comment Deepchecks inspecte le système, en utilisant des analogies simples :

1. Les Trois Vérifications Principales (Les « Propriétés »)

Deepchecks examine trois choses spécifiques pour s'assurer que la réponse est bonne :

  • Pertinence de la Récupération (Le bibliothécaire a-t-il trouvé les bons livres ?) :
    • Analogie : Si vous demandez « Comment faire un gâteau ? », le bibliothécaire ne devrait pas vous remettre un livre sur « Comment réparer une voiture ». Deepchecks vérifie si les documents récupérés sont réellement utiles pour la question.
  • Ancrage dans le Contexte (L'assistant s'est-il tenu aux livres ?) :
    • Analogie : C'est le détecteur d'« hallucination ». Si le livre dit qu'il faut 2 œufs pour le gâteau, mais que l'assistant dit 10 œufs, Deepchecks démasque ce mensonge. Il vérifie que chaque fait dans la réponse est réellement soutenu par les documents que le bibliothécaire a trouvés.
  • Exhaustivité (L'assistant a-t-il répondu à toute la question ?) :
    • Analogie : Si vous avez demandé « Comment faire un gâteau et à quelle température doit être le four ? », la réponse ne devrait pas se contenter de dire « Mettez-le au four ». Deepchecks vérifie si l'assistant a couvert toutes les parties de votre demande.

(Il existe également une Vérification de Sécurité pour s'assurer que l'assistant n'est pas grossier, ne fuit pas d'informations privées ou ne dit rien de dangereux.)

2. Le Score « Holistique » (La Note Finale)

La plupart des outils vous donnent simplement une liste de scores pour les parties ci-dessus. Deepchecks va plus loin. Il utilise un « mécanisme d'agrégation » intelligent (une formule apprise) pour combiner tous ces scores en une seule note finale : Positive, Négative ou Inconnue.

  • Positive : Le bibliothécaire a trouvé les bons livres, et l'assistant a répondu parfaitement en se basant dessus.
  • Négative : Quelque chose s'est mal passé (mauvais livres, faits inventés ou réponse incomplète).
  • Inconnue : Ce n'était pas terrible, mais cela n'a pas tout à fait atteint la barre haute du « parfait ».

3. Les Outils d'Enquête (Analyse des Causes Racines)

Si le système obtient une note « Négative », Deepchecks ne se contente pas de vous dire qu'il a échoué ; il agit comme un détective pour vous dire pourquoi.

  • Analogie : Imaginez qu'une voiture tombe en panne. Un mécanicien basique dit : « Elle est en panne. » Deepchecks dit : « Le moteur va bien, mais les pneus sont à plat. »
  • Cela aide les développeurs à savoir exactement où corriger le problème : Ont-ils besoin d'un meilleur bibliothécaire (meilleure récupération) ? Ou doivent-ils entraîner l'assistant à mieux écouter (meilleure génération) ?

4. La « Machine à Remonter le Temps » (Comparaison de Versions et Surveillance)

Deepchecks vous permet également de comparer différentes versions de votre système côte à côte.

  • Analogie : C'est comme comparer les performances d'une voiture avant et après avoir changé les pneus. Les nouveaux pneus l'ont-ils rendue plus rapide ?
  • Il surveille également le système pendant qu'il fonctionne dans le monde réel. Si le système commence à se dégrader avec le temps (peut-être parce que les livres de la bibliothèque ont changé ou que les questions des utilisateurs ont changé), Deepchecks déclenche une alarme immédiatement.

Ce que l'Article a Découvert

Les auteurs ont testé Deepchecks contre d'autres outils populaires (comme RAGAS et LangSmith) en utilisant :

  1. Ensembles de Données Publics : Questions de test standard que tout le monde connaît.
  2. Ensembles de Données Clients : Exemples du monde réel provenant d'entreprises réelles (comme des chats de support technique et des évaluations de candidats à l'emploi).

Le Résultat : Deepchecks était meilleur pour repérer les erreurs, en particulier dans les données clients du monde réel. Alors que d'autres outils manquaient parfois des erreurs ou donnaient des notes incohérentes, Deepchecks était plus précis pour identifier quand le système mentait (hallucinations) ou donnait des réponses non pertinentes.

En Résumé :
Deepchecks est une boîte à outils complète qui garantit que votre assistant IA ne parle pas seulement avec confiance, mais qu'il dit la vérité en se basant sur les documents que vous lui avez donnés. Il vérifie le bibliothécaire, vérifie l'écrivain, vérifie la sécurité et vous fournit un bulletin clair afin que vous puissiez réparer exactement ce qui est cassé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →