Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus
Cette étude emploie une méthodologie de plan d'expériences pour analyser et optimiser les hyperparamètres critiques — spécifiquement la stratégie de découpage, le volume de contexte et la sélection du LLM — au sein d'un système de génération augmentée par récupération conçu pour le Bureau du Procureur Public de l'Espírito Santo, révélant que ces facteurs influencent significativement la qualité des réponses grâce à une analyse statistique utilisant l'Aligned Rank Transform.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un ami robot super intelligent qui peut écrire des essais, raconter des blagues et répondre à presque toutes les questions que vous lui posez. Ce robot est comme un étudiant brillant qui a lu l'intégralité d'Internet. Mais voici le hic : cet étudiant a une mémoire catastrophique pour les faits. Si vous l'interrogez sur une loi spécifique, il pourrait inventer avec assurance une règle qui semble parfaite mais qui est totalement fausse. C'est ce qu'on appelle une « hallucination », et c'est un problème majeur lorsqu'on a besoin d'informations précises, comme dans un tribunal ou un hôpital.
Pour corriger cela, les scientifiques ont inventé une astuce ingénieuse appelée Génération Augmentée par Récupération (RAG). Voyez cela comme si vous donniez à votre ami robot une pile de manuels scolaires juste avant l'examen. Au lieu de deviner à partir de sa propre mémoire, le robot consulte d'abord la réponse dans les livres, puis rédige sa réponse en se basant uniquement sur ce qu'il a trouvé. C'est comme un détective qui vérifie le dossier de preuves avant de rédiger son rapport. Mais il y a un pièंश : la façon dont vous organisez ces livres compte. Est-ce que vous déchirez les pages en petits morceaux ? Gardez-vous les chapitres entiers ? Et combien de pages laissez-vous le robot lire avant qu'il ne commence à écrire ? Si vous vous trompez dans ces réglages, le robot pourrait manquer l'indice crucial ou être confus par trop de bruit. C'est exactement le casse-tête que une équipe de chercheurs au Brésil a décidé de résoudre.
Le dilemme du détective : Régler la machine
Dans l'État d'Espírito Santo, au Brésil, le Ministère Public (MPES) possède une immense bibliothèque de documents juridiques — des milliers de lois, de règles et d'ordonnances. Pendant des années, trouver une règle spécifique était un cauchemar. Les fonctionnaires devaient savoir exactement où chercher, sinon ils restaient bloqués. Pour aider, ils ont construit un assistant virtuel nommé Fabi (nommée d'après une employée réelle, extrêmement compétente). Fabi utilise l'astuce du RAG : elle lit la bibliothèque juridique et répond aux questions du personnel.
Mais Fabi n'était pas parfaite. Parfois, elle manquait des détails importants ; parfois, elle donnait des réponses vagues. Les chercheurs, dirigés par Heitor Quartezani et son équipe, ont posé une question simple : Quels réglages font de Fabi le meilleur détective possible ? Ils ne se sont pas contentés de deviner ; ils ont traité le problème comme une immense expérience scientifique. Ils ont testé chaque combinaison de quatre « boutons » différents sur le système pour voir lequel produisait les réponses les plus précises, honnêtes et utiles.
Voici ce qu'ils ont tourné et ce qu'ils ont découvert :
1. La stratégie de découpage (Chunking)
Imaginez que vous avez une histoire juridique longue et complexe. Comment la découper pour la donner au robot ?
- L'ancienne méthode (Récursive) : Découper l'histoire en segments de taille fixe, comme trancher un pain en morceaux de 500 caractères. C'est facile, mais vous risquez de couper une phrase en deux, perdant ainsi le sens.
- La méthode intelligente (Sémantique) : Découper l'histoire uniquement lorsque le sujet change. Si la loi passe des « règles de vacances » aux « heures supplémentaires », c'est là qu'il faut couper. Cela permet de garder les idées entières.
La découverte : Les chercheurs ont découvert que la « méthode intelligente » (découpage sémantique) était la grande gagnante. Plus précisément, le fait de découper en fonction du 95e percentile des changements de sujet (c'est-à-dire ne couper que lorsque le sujet change de manière significative) permettait de préserver le plus d'informations. L'« ancienne méthode » consistant à trancher en petits morceaux de 500 caractères était terrible ; elle brisait la logique juridique, rendant impossible pour le robot de trouver la bonne réponse. Dans le travail juridique, manquer un seul détail peut être désastreux, donc garder l'histoire entière était le facteur le plus important.
2. La méthode de recherche (Retrieval)
Comment Fabi trouve-t-elle les bonnes pages dans la bibliothèque ?
- Recherche Vectorielle : C'est comme demander au robot : « Trouve-moi des choses qui ressemblent à cette question ». C'est excellent pour comprendre le sens, mais cela peut passer à côté des mots exacts.
- Recherche Lexicale : C'est comme un catalogue de bibliothèque classique. Elle cherche des correspondances de mots exacts. C'est efficace pour les termes spécifiques, mais mauvais pour comprendre le contexte.
- Recherche Hybride : C'est le meilleur des deux mondes. Elle utilise une astuce mathématique spéciale (appelée Fusion de Classement Réciproque) pour combiner la recherche de « ressenti » et la recherche de « mot exact ».
La découverte : La Recherche Hybride a été la championne. En combinant les deux méthodes, Fabi pouvait trouver les bons documents même si l'utilisateur posait la question de manière inhabituelle ou utilisait un terme juridique très spécifique. La recherche de « ressenti » seule ne suffisait pas, et la recherche de « mot exact » seule était trop rigide. Ensemble, elles rendaient le système beaucoup plus fiable.
3. Combien lire (Top-K)
Lorsque Fabi trouve les meilleurs documents, combien doit-elle en lire avant de répondre ? Doit-elle lire 5 pages ? 20 ?
- La découverte : Plus elle lisait, mieux elle réussissait — du moins jusqu'à un certain point. Lire 20 documents donnait les meilleurs résultats. Il s'est avéré que donner au robot un « filet » plus large pour capturer l'information l'aidait à trouver les bons indices, même si certaines pages supplémentaires étaient un peu bruyantes. Cependant, les chercheurs ont remarqué qu'après 15 documents, l'amélioration de la qualité de la réponse finale ne devenait plus statistiquement significative. Ainsi, bien que lire 20 documents soit légèrement meilleur, cela coûtait plus de puissance informatique. Ils ont suggéré qu'à l'avenir, le système pourrait utiliser un filtre plus intelligent pour lire moins de pages tout en obtenant les mêmes excellents résultats.
4. La puissance cérébrale (Choix du LLM)
Enfin, ils ont testé deux « cerveaux » différents pour Fabi : le massif et super intelligent gpt-4o et le plus petit et plus rapide gpt-4o-mini.
- La surprise : Vous pourriez penser que le cerveau le plus gros et le plus coûteux gagnerait. Mais le plus petit gpt-4o-mini a en fait obtenu des performances tout aussi bonnes, voire parfois meilleures !
- Pourquoi ? Le cerveau géant était si intelligent qu'il essayait parfois d'être trop créatif. Lorsque le robot lisait 20 documents, le grand cerveau commençait à mélanger les idées ou à surinterpréter le texte, ce qui entraînait de petites erreurs. Le cerveau plus petit, en revanche, était plus obéissant. Il s'en tenait strictement au texte fourni, extrayant les faits sans ajouter sa propre « touche personnelle ». Pour un assistant juridique qui doit être précis, être un peu plus littéral était en fait un super-pouvoir.
Le verdict final
Les chercheurs n'ont pas seulement deviné ; ils ont mené 3 840 expériences différentes (soit 96 réglages différents testés contre 40 questions différentes) et ont utilisé des mathématiques avancées pour prouver leurs résultats.
Ils ont conclu que pour construire le meilleur assistant juridique, il faut :
- Découper les documents par sujet, et non par taille fixe.
- Utiliser une Recherche Hybride qui combine le sens et les mots exacts.
- Lire environ 20 documents pour s'assurer de ne rien manquer.
- Utiliser le modèle d'IA le plus petit et le moins cher (gpt-4o-mini) car il suit les instructions plus strictement et commet moins d'erreurs.
Cette étude est importante car elle dépasse le stade du « essayons ceci et voyons ce qui se passe ». Elle utilise une science rigoureuse pour nous dire exactement comment régler ces outils puissants afin qu'ils ne se contentent pas d'avoir l'air intelligents, mais qu'ils soient réellement intelligents et fiables. Pour le Ministère Public, cela signifie que Fabi peut désormais les aider à trouver les lois pertinentes plus rapidement et avec moins d'erreurs, faisant ainsi mieux fonctionner le système juridique pour tout le monde.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.