← Derniers articles
💬 NLP

RTI-Bench: A Structured Dataset for Indian Right-to-Information Decision Analysis

Cet article présente RTI-Bench, le premier jeu de données structuré et publiquement disponible concernant les décisions indiennes relatives au droit à l'information, comprenant des étiquettes de résultat, des citations d'exemptions et des éléments de raisonnement, conçu pour permettre l'analyse et la prédiction des résultats des recours administratifs.

Auteurs originaux : Joy Bose

Publié 2026-05-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Joy Bose

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le système de droit à l'information (RTI) de l'Inde comme une immense bibliothèque animée où chaque citoyen a le droit de demander au gouvernement n'importe quel livre (information) qu'il souhaite. Mais voici le hic : les bibliothécaires (les fonctionnaires gouvernementaux) répondent souvent dans un code secret, et le bibliothécaire en chef (la Commission centrale de l'information ou CIC) rédige les verdicts finaux dans un langage juridique dense qui ressemble à la lecture d'un grimoire étranger. La plupart des gens abandonnent car ils ne peuvent pas déterminer si un appel vaut la peine ou ce que la décision signifie réellement.

Ce document présente RTI-Bench, un nouvel outil conçu pour traduire ce « grimoire » en anglais simple et organiser les dossiers de la bibliothèque afin que les ordinateurs puissent apprendre à nous aider.

Voici une décomposition de ce que le document fait réellement, en utilisant des analogies simples :

1. Le Problème : Un Mur de Texte

La CIC émet des milliers de décisions chaque année. Elles sont publiques, mais rédigées d'une manière qui suppose que vous êtes avocat. Si vous voulez savoir si vous devez contester une décision gouvernementale, vous devez vous frayer un chemin à travers des pages de jargon complexe. Le document soutient que nous avons besoin d'une « pierre de Rosette » pour décoder ces documents.

2. La Solution : RTI-Bench (Le Classeur Organisé)

Les auteurs ont construit un ensemble de données structuré appelé RTI-Bench. Imaginez cela comme transformer un tas chaotique de 1 516 documents juridiques en un classeur numérique bien rangé où chaque dossier possède des étiquettes claires.

  • Ce qu'il contient : Chaque fichier possède des balises pour le résultat (Le citoyen a-t-il gagné ?), les motifs utilisés (Pourquoi ont-ils perdu ?) et la chronologie des événements.
  • La Source : Ils ont collecté des données à partir de deux endroits :
    1. 1 218 résumés existants trouvés en ligne (qu'ils ont nettoyés).
    2. 298 nouveaux PDF téléchargés directement depuis le site web de la CIC entre 2023 et 2026.

3. La Méthode : Le « Bibliothécaire Robot » (Extraction Basée sur des Règles)

Vous pourriez vous attendre à ce qu'ils utilisent une IA sophistiquée pour lire ces documents. Au lieu de cela, ils ont construit un pipeline basé sur des règles.

  • L'Analogie : Imaginez un bibliothécaire robot qui ne « réfléchit » pas et ne « devine » pas. Il suit plutôt une liste de contrôle stricte : « Si vous voyez le mot « DÉCISION » en majuscules, regardez la ligne suivante. Si vous voyez « Rs. », cherchez un nombre. »
  • Pourquoi faire cela ? Les auteurs affirment que l'utilisation d'une IA intelligente (LLM) pour étiqueter des documents juridiques est risquée car l'IA pourrait inventer des faits ou se tromper. Leur robot « bête » est 100 % reproductible, ne coûte rien et s'exécute en moins de 90 secondes sur un ordinateur portable ordinaire.
  • Le Résultat : Ils ont vérifié manuellement 50 fichiers au hasard et ont constaté que le robot était précis à 95,3 %.

4. Le Défi : Trois « Polices » Différentes

Le document a découvert que la CIC a changé ses modèles de documents trois fois depuis 2017.

  • 2023a : Utilise une structure spécifique « Faits / Décision ».
  • 2023b : Sépare les « Observations » des « Décisions ».
  • 2026 : Le format actuel, qui utilise de grands blocs « DÉCISION » en gras.
    Le robot a été programmé pour reconnaître ces trois « polices » différentes et adapter sa stratégie de lecture en conséquence, un peu comme un traducteur passant d'un dialecte à un autre.

5. Le Premier Test : Un Ordinateur Peut-il Deviner le Gagnant ?

Les auteurs ont testé un modèle d'IA de base (Mistral 7B) sur 100 cas pour voir s'il pouvait prédire le résultat simplement en lisant le texte.

  • Le Score : L'IA a obtenu une précision de 57,3 %.
  • La Comparaison : Si l'IA avait simplement deviné la réponse la plus courante à chaque fois (comme un élève devinant « C » dans un test à choix multiples), elle n'aurait obtenu que 14,3 % de bonnes réponses.
  • La Conclusion : L'IA fait nettement mieux que le hasard, prouvant que les ordinateurs peuvent apprendre à comprendre ces décisions juridiques, mais il reste beaucoup de place pour l'amélioration (en particulier pour les résultats rares).

6. Que Peut-On Faire Avec Cela ? (Les Quatre Tâches)

Le document propose quatre jeux spécifiques pour que les chercheurs jouent avec ces données :

  1. Prédiction du Résultat : « D'après l'histoire, le citoyen va-t-il gagner ou perdre ? »
  2. Détection des Exceptions : « Quelle règle secrète (comme la « vie privée » ou la « confidentialité commerciale ») le gouvernement a-t-il utilisée pour dire « non » ? »
  3. Résumé en Langage Simple : « Traduisez cet ordre juridique en une phrase qu'une personne normale peut comprendre. »
  4. Vérification de la Conformité : « Le gouvernement a-t-il réellement suivi l'ordre, ou doit-il être sanctionné ? » (Note : Ils n'ont que 17 exemples de cela, il s'agit donc d'un test pilote).

7. Les Petites Caractères (Limites)

Les auteurs sont très honnêtes sur ce que cet outil ne peut pas encore faire :

  • Couverture : Ils n'ont qu'environ la moitié des nouveaux PDF entièrement étiquetés ; le reste nécessite plus de travail.
  • Portée : Cela ne couvre que la Commission centrale, et non les commissions au niveau des États (qui traitent encore plus de cas).
  • Logique Manquante : Le robot ne détecte les exceptions que lorsque le gouvernement écrit explicitement le numéro de la règle. S'ils utilisent une règle sans la nommer, le robot la manque.
  • Éthique : Ils avertissent que cet outil ne devrait pas être utilisé pour décourager les gens de déposer des appels. Le fait qu'un appel ait « peu de chances de gagner » ne signifie pas qu'il ne devrait pas être déposé, car l'acte de dépôt lui-même rend le gouvernement responsable.

Résumé

RTI-Bench est le premier ensemble de données organisé et public des décisions RTI indiennes. Il utilise un robot simple basé sur des règles pour transformer des PDF juridiques désordonnés en données propres. Les premiers tests montrent que les ordinateurs peuvent commencer à comprendre ces décisions, ouvrant la voie à des outils futurs qui pourraient aider les citoyens ordinaires à naviguer dans le monde complexe des demandes d'informations gouvernementales.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →