← Derniers articles
💬 NLP

Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering

Cette étude introduit le premier cadre de génération augmentée par récupération pour le questionnement juridique en népalais, exploitant les archives de la Nepal Kanun Patrika pour atteindre des scores de précision et de véracité élevés, répondant ainsi aux défis de la rareté des données dans les domaines juridiques à faibles ressources.

Auteurs originaux : Samir Wagle, Abiral Adhikari, Reewaj Khanal, Batsal Bhandari, Prashant Manandhar, Praveen Acharya, Bal Krishna Bal

Publié 2026-06-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Samir Wagle, Abiral Adhikari, Reewaj Khanal, Batsal Bhandari, Prashant Manandhar, Praveen Acharya, Bal Krishna Bal

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le système juridique du Népal comme une immense bibliothèque ancienne. Cette bibliothèque contient des milliers de décisions de justice (jurisprudences) écrites en népalais. Cependant, deux problèmes majeurs subsistent :

  1. Les livres sont désordonnés : Ils sont écrits dans une langue vieillie, dispersés à différents endroits, et ne sont pas tous numérisés correctement.
  2. Le bibliothécaire est nouveau : Les modèles d'intelligence artificielle (IA) sont généralement entraînés sur des livres anglais. Lorsque vous les interrogez sur les lois népalaises, ils s'embrouillent souvent ou inventent des choses car ils n'ont pas assez « lu » de textes juridiques népalais pour en apprendre les règles.

Ce document présente une nouvelle façon de résoudre cela en utilisant un système appelé RAG (Retrieval-Augmented Generation - Génération augmentée par récupération). Voyez le RAG non pas comme un étudiant essayant de mémoriser un manuel, mais comme un assistant de recherche intelligent qui est autorisé à chercher des réponses dans une bibliothèque avant de parler.

Voici comment les chercheurs ont construit et testé cet assistant :

1. La Bibliothèque (Les Données)

L'équipe s'est rendue dans les archives numériques officielles de la Cour suprême du Népal (appelées Nepal Kanun Patrika). Ils ont extrait et nettoyé 10 320 documents juridiques.

  • Le Défi : Ils ne pouvaient pas simplement injecter ces documents massifs dans l'IA. C'est comme essayer de trouver une phrase spécifique dans un livre de 500 pages en lisant tout le livre d'un coup.
  • La Solution : Ils ont découpé les documents en petits « morceaux » (chunks) (comme découper une longue histoire en courts paragraphes) afin que l'IA puisse mieux les gérer.

2. Le Moteur de Recherche (Trouver la bonne page)

Avant que l'IA puisse répondre à une question, elle doit trouver la bonne page dans la bibliothèque. Les chercheurs ont testé deux méthodes différentes de recherche :

  • Méthode A : Le « Chasseur de Mots-Clés » (BM25)

    • Fonctionnement : Il s'agit d'un bibliothécaire traditionnel qui cherche des mots exacts. Si vous demandez : « Quelle est la peine pour le vol ? », le bibliothécaire scanne pour les mots exacts « peine », « vol » et « loi ».
    • Le Résultat : Cette méthode a été la championne. Elle a trouvé le document correct 91 % du temps lorsqu'elle regardait de petits morceaux, et 88 % du temps lorsqu'elle regardait des documents entiers. Elle était très précise car le langage juridique est souvent très spécifique et répétitif.
  • Méthode B : Le « Correspondant de Sens » (Récupération Dense)

    • Fonctionnement : Il s'agit d'un bibliothécaire qui comprend l'« ambiance » ou le sens d'une question, même si les mots sont différents. Il utilise des mathématiques avancées (embeddings) pour deviner que « voler » et « vol » sont la même chose.
    • Le Résultat : Cette méthode était bonne, mais pas excellente pour ce travail spécifique. Elle n'a trouvé le bon document que 75 % du temps. Les chercheurs ont constaté que pour le droit népalais, la correspondance exacte de mots fonctionne mieux que la supposition du sens, probablement parce que les termes juridiques sont très rigides.

Le Piège de la Vitesse :
Le « Chasseur de Mots-Clés » (BM25) avait un inconvénient. Lorsqu'ils ont découpé les documents en minuscules morceaux pour plus de précision, la recherche est devenue très lente (comme chercher à travers 110 000 petites fiches indexées au lieu de 10 000 livres). Pour que le système reste assez rapide pour être utile, ils ont choisi la version « Document Entier » du Chasseur de Mots-Clés. Elle était légèrement moins précise mais beaucoup plus rapide.

3. L'Écrivain de Réponses (Générer la réponse)

Une fois que le système a trouvé le bon document, il devait rédiger la réponse.

  • La Règle : L'IA a reçu l'ordre strict : « N'invente rien. »
  • La Stratégie : Les chercheurs ont utilisé un processus en deux étapes. D'abord, l'IA devait pointer la phrase exacte dans le document qui prouvait la réponse. Ensuite, elle devait rédiger la réponse en se basant uniquement sur cette phrase. Si elle ne trouvait pas de preuve, elle recevait l'ordre de dire : « Je ne sais pas », plutôt que de deviner.

4. Les Résultats (Cela a-t-il fonctionné ?)

L'équipe a testé ce système avec 100 questions rédigées par des experts juridiques. Voici comment la meilleure version (Chasseur de Mots-Clés + Documents Entiers) s'est comportée :

  • Taux de réussite : Elle a généré une réponse avec succès pour 92 % des questions.
  • Vérité : Lorsqu'elle a été vérifiée par une autre IA et par des juristes humains, les réponses étaient 85 % véridiques (ce qui signifie qu'elles n'ont pas inventé de faits).
  • Ancrage (Groundedness) : 74 % des réponses étaient directement soutenues par le texte trouvé dans la bibliothèque.

L'Essentiel

Ce document prouve que pour une langue à faibles ressources comme le népalais, vous n'avez pas besoin d'une IA super intelligente qui a tout mémorisé. Au lieu de cela, vous avez besoin d'un outil de recherche fiable qui trouve le texte juridique exact et d'une IA stricte qui refuse de parler tant qu'elle n'a pas le texte sous les yeux.

En combinant une méthode de recherche simple et rapide (BM25) avec un processus d'écriture soigneux, ils ont créé le premier système capable de répondre de manière fiable à des questions juridiques en népalais sans inventer de faits. C'est une base qui pourrait éventuellement aider les citoyens ordinaires à comprendre leurs droits juridiques sans avoir besoin d'un diplôme de droit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →