← Derniers articles
💬 NLP

JurisTCU: A Brazilian Portuguese Information Retrieval Dataset with Query Relevance Judgments

Cet article présente JurisTCU, un nouveau jeu de données de recherche d'informations juridiques en portugais brésilien comprenant 16 045 documents et 150 requêtes annotées, qui démontre que l'expansion de documents améliore considérablement la performance de la recherche lexicale et que les plongements (embeddings) d'OpenAI surpassent les autres modèles pour capturer les relations sémantiques des requêtes juridiques.

Auteurs originaux : Leandro Carísio Fernandes, Leandro dos Santos Ribeiro, Marcos Vinícius Borela de Castro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

Publié 2026-06-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Leandro Carísio Fernandes, Leandro dos Santos Ribeiro, Marcos Vinícius Borela de Castro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trouver une aiguille spécifique dans une botte de foin massive et chaotique. Mais ce n'est pas seulement une botte de foin ; c'est une bibliothèque de 16 000 documents juridiques écrits en portugais, créés par la Cour des Comptes Fédérale du Brésil (TCU). Ces documents expliquent comment l'argent public doit être dépensé et quelles règles s'appliquent à différentes situations.

Pendant des années, trouver la bonne « aiguille » (le bon précédent juridique) dans cette botte de foin a été difficile car les outils de recherche étaient comme un bibliothécaire qui n'écoute que les correspondances de mots exacts. Si vous demandiez « règles d'argent », le bibliothécaire ignorerait un document qui disait « réglementations financières », même s'ils voulaient dire la même chose.

Ce document présente JurisTCU, un nouvel outil conçu pour résoudre ce problème. Considérez JurisTCU comme un manuel de formation et un kit de test pour construire un bibliothécaire plus intelligent.

Voici comment le document le décompose :

1. Le Problème : Le piège de la « correspondance exacte »

Le système de recherche actuel du TCU est comme un robot qui ne comprend que l'orthographe exacte. Si vous tapez « taxe », il ne trouvera pas un document qui dit « prélèvement », même si ce sont des synonymes. C'est ce qu'on appelle le « décalage de vocabulaire ». Les chercheurs ont voulu voir s'ils pouvaient apprendre au robot à comprendre le sens derrière les mots, et non pas seulement les lettres.

2. La Solution : Une nouvelle cuisine d'essai

Pour tester de nouvelles méthodes de recherche, les chercheurs ont construit un ensemble de données appelé JurisTCU.

  • La Bibliothèque : Ils ont rassemblé 16 045 documents juridiques réels du TCU.
  • Les Questions : Ils ont créé 150 questions de recherche différentes. Certaines étaient courtes et simples (comme « règles fiscales »), tandis que d'autres étaient des phrases complètes (comme « Quelles sont les règles pour les réglementations fiscales ? »).
  • Le Corrigé : C'est la partie la plus importante. Ils ont engagé des experts et utilisé une IA avancée pour créer un « Corrigé ». Pour chaque question, ils ont marqué exactement quels documents étaient les bonnes réponses. Cela permet de mesurer l'efficacité réelle d'un moteur de recherche.

3. Les Expériences : Apprendre de nouveaux tours au robot

Les chercheurs ont mené 14 expériences différentes pour voir comment rendre le moteur de recherche plus intelligent. Ils ont testé deux stratégies principales :

Stratégie A : Le « Traducteur de Documents » (Recherche Lexicale)
Imaginez que vous avez un document sur les « réglementations financières ». Le robot ne peut pas le trouver si vous cherchez « taxe ». Ainsi, les chercheurs ont utilisé l'IA pour réécrire le document avant de l'enregistrer.

  • Ils ont ajouté des synonymes (comme ajouter « taxe » et « prélèvement » au document « réglementations financières »).
  • Ils ont utilisé l'IA pour deviner quelles questions quelqu'un pourrait poser sur ce document et ont ajouté ces questions au fichier du document.
  • Le Résultat : C'était comme donner un dictionnaire au robot. Cela a très bien fonctionné, surtout pour les recherches courtes par mots-clés. Cela a amélioré les résultats de recherche de plus de 45 %.

Stratégie B : Le « Lecteur de Sens » (Recherche Sémantique)
Au lieu de simplement faire correspondre des mots, cette stratégie tente de comprendre l'« ambiance » ou le concept du texte. Elle transforme chaque document et chaque question en une « empreinte digitale » unique (un vecteur mathématique) basée sur son sens.

  • Ils ont testé plusieurs modèles d'IA pour créer ces empreintes digitales.
  • Le Résident : La plupart des modèles en open-source (comme BERT) ont eu du mal, agissant comme un étudiant qui a mémorisé le dictionnaire mais qui ne comprend pas l'histoire. Cependant, les modèles OpenAI étaient comme un étudiant de génie qui comprenait réellement le contexte. Ils ont trouvé les bons documents 70 % mieux que l'ancien système, même lorsque les termes de recherche étaient très courts.

4. La Grande Conclusion

Le document conclut que :

  1. Nous avons besoin d'une nouvelle norme : JurisTCU est le premier ensemble de données majeur de ce type en portugais qui inclut de vraies questions de recherche et des réponses d'experts. C'est un point de référence pour la communauté afin de tester les futurs moteurs de recherche.
  2. L'IA peut aider, mais il faut choisir judicieusement : Ajouter simplement des synonymes aux documents aide beaucoup. Mais utiliser une IA avancée pour comprendre le sens du texte (spécifiquement en utilisant les modèles d'OpenAI) est l'outil le plus puissant qu'ils aient trouvé.
  3. Impact dans le monde réel : Le système de recherche du TCU est utilisé plus de 1,5 million de fois par an par des citoyens et des responsables. En utilisant ces découvertes, le TCU peut construire un moteur de recherche qui aide réellement les gens à trouver l'information juridique dont ils ont besoin, plutôt que de simplement faire correspondre des mots-clés.

En résumé, le document dit : « Nous avons construit un parcours d'essai pour les moteurs de recherche juridiques au Brésil. Nous avons découvert que si enseigner les synonymes au robot aide, enseigner au robot à comprendre le sens de la loi est le véritable changement radical. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →