Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law
Ce document présente FiscalQA Pro, un benchmark démontrant que les systèmes RAG juridiques standards échouent à gérer l'erreur de ciblage temporel dans le droit fiscal français en ne récupérant que les versions actuelles des articles, et montre qu'un système de recherche sensible aux versions peut atteindre une précision de 98,3 % par rapport à une performance proche de zéro des approches statiques.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de résoudre un mystère, mais la bibliothèque dans laquelle vous effectuez vos recherches a une règle très étrange : chaque fois qu'une page est ajoutée à un livre ou qu'une phrase est modifiée, le bibliothécaire ne pose pas un nouveau livre sur l'étagère. Au lieu de cela, il efface les anciennes pages et réécrit le livre existant, ne laissant visible que la version la plus récente. Si vous demandez : « Que disait le livre en 1995 ? » et que le bibliothécaire ne vous remet que l'édition de 2025, vous aurez une mauvaise réponse, même si le livre semble identique sur la couverture. C'est le monde de l'IA juridique, un domaine où les ordinateurs tentent de lire les lois et de répondre à des questions comme un avocat. Pour ce faire, ils utilisent une technique appelée RAG (Génération Augmentée par Récupération), qui est comme un étudiant super intelligent qui est autorisé à consulter des faits dans un manuel avant de répondre à une question d'examen. Le problème est que la plupart de ces manuels sont traités comme s'ils ne changeaient jamais. Mais les lois changent, souvent chaque année. Si un ordinateur ne réalise pas qu'une loi de 2018 est différente de la loi d'aujourd'hui, il vous donnera avec assurance un conseil erroné, ce qui peut être une catastrophe pour le paiement des impôts ou la compréhension de vos droits.
Cet article, intitulé « Temporal Misgrounding in Legal RAG », étudie précisément ce problème dans le droit fiscal français. Les auteurs ont découvert un mode de défaillance spécifique qu'ils appellent le mauvais ancrage temporel (temporal misgrounding). Cela se produit lorsqu'un ordinateur, interrogé sur une loi du passé, ignore la date présente dans la question et se contente de récupérer la version actuelle de la loi car c'est la seule qu'il peut facilement trouver. Ils ont construit une immense bibliothèque voyageuse dans le temps du code fiscal français, contenant 32 436 versions différentes d'articles s'étalant sur 93 ans (de 1938 à 2031). Ils ont ensuite créé un test difficile appelé FiscalQA Pro avec 209 questions examinées par des experts qui exigent spécifiquement de connaître la loi à une date passée, et non celle d'aujourd'hui.
Les résultats ont été choquants. Lorsqu'ils ont testé 11 modèles d'IA différents (y compris les plus avancés disponibles), les ordinateurs ont échoué lamentablement lorsqu'ils ne pouvaient pas rechercher la bonne version. Sans aide, l'IA a donné la bonne réponse seulement 3,0 % du temps. Lorsqu'ils ont donné à l'IA un « manuel » standard qui ne contenait que la loi actuelle, elle a fait encore pire, n'ayant raison que 2,7 % du temps. En fait, le système standard a récupéré la version historique correcte 0 % du temps ; il citait avec assurance la loi actuelle comme si c'était la loi du passé. Cependant, lorsque les auteurs ont construit un système capable de rechercher réellement à travers leur bibliothèque voyageuse dans le temps pour trouver la version spécifique de la loi qui était en vigueur à la date de la question, la précision de l'IA a grimpé en flèche pour atteindre 98,3 %.
L'article prouve que le problème n'est pas que l'IA n'est pas assez intelligente pour comprendre la loi ; c'est que la bibliothèque qu'elle interroge est défectueuse. Les auteurs soutiennent que nous devons cesser de traiter les documents juridiques comme des objets statiques et commencer à les traiter comme des objets sensibles au temps. Ils ont montré qu'une fois que vous corrigez le système de récupération pour qu'il recherche la bonne date, l'IA peut résoudre ces problèmes presque parfaitement. Ils ont également publié leur immense ensemble de données et le code de leur système de recherche sensible au temps, dans l'espoir d'aider d'autres chercheurs à construire une IA qui ne vous donne pas de conseils juridiques obsolètes avec assurance.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.