← Derniers articles
🤖 AI

The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation

Ce papier présente RiDiC, un pipeline et un jeu de données multilingues générés à partir de Wikipedia et Wikidata pour évaluer la facticité des réponses longues des grands modèles de langage, révélant ainsi que même les modèles de pointe hallucinent sur des entités à popularité contrôlée.

Auteurs originaux : Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panchenko

Publié 2026-04-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panchenko

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que les grands modèles de langage (les IA comme moi) sont des bibliothécaires ultra-intelligents qui ont lu presque tous les livres du monde. Si vous leur demandez des informations sur des sujets très connus, comme la Tour Eiffel ou le dernier iPhone, ils répondent avec une précision chirurgicale. Mais si vous leur demandez des détails sur un petit ruisseau perdu dans les montagnes de la Sibérie ou un ouragan mineur de 1998, ils commencent à inventer des histoires. C'est ce qu'on appelle les "hallucinations".

Le papier que vous avez soumis, intitulé RIDIC, propose une nouvelle façon de tester ces bibliothécaires pour voir où ils commencent à se tromper. Voici l'explication simple, avec quelques images pour mieux comprendre.

1. Le Problème : Le "Test de Culture Générale" ne suffit plus

Jusqu'à présent, on testait les IA avec des questions rapides type "Quel est le chef-lieu de ce département ?" (comme un quiz de télé). C'est facile à corriger : la réponse est soit bonne, soit fausse.

Mais dans la vraie vie, les gens ne demandent pas juste un fait. Ils demandent : "Raconte-moi l'histoire de cette rivière, son parcours, ses inondations passées...". C'est un long récit. Or, on ne savait pas bien si les IA mentaient aussi souvent dans ces longs récits que dans les réponses courtes, surtout pour des sujets peu connus.

2. La Solution : Le "Super-Marché des Données" (Le Pipeline RIDIC)

Les auteurs ont créé une machine à fabriquer des tests, qu'ils appellent un "pipeline". Imaginez un supermarché où vous pouvez choisir exactement ce que vous voulez acheter :

  • Le rayon : Vous choisissez la catégorie (des rivières, des catastrophes naturelles, ou des modèles de voitures).
  • La popularité : Vous choisissez si vous voulez des produits très connus (la "tête" de la courbe) ou des produits très rares (la "queue" de la courbe).
  • La langue : Vous voulez le tout en anglais ou en chinois.

Leur but ? Créer un jeu de données équilibré. Ils ne veulent pas seulement tester les IA sur des sujets célèbres (où elles sont bonnes), mais surtout sur les sujets "longue traîne" (les rares), là où elles ont tendance à halluciner.

3. Le Résultat : Le Dataset RIDIC

Ils ont utilisé cette machine pour créer RIDIC, un jeu de données contenant 3 000 entités :

  • 1 000 rivières.
  • 1 000 catastrophes naturelles.
  • 1 000 modèles de voitures.

Pour chaque sujet, ils ont pris des informations réelles sur Wikipédia (la "vérité") et ont demandé à trois IA différentes (Llama, Qwen et GPT) de rédiger un article complet en anglais et en chinois.

4. L'Expérience : Le "Détective de Vérité"

Une fois les IA ayant écrit leurs articles, les chercheurs ont utilisé un "détective automatique" (un autre programme) pour vérifier chaque phrase.

  • L'IA dit : "La rivière X a inondé le village Y en 1990."
  • Le Détective : "Attends, je vais chercher sur Wikipédia... Non, c'est faux. L'IA a inventé ça."

Ils ont calculé un score de "vérité" pour voir combien de fois les IA avaient menti.

5. Les Découvertes Surprenantes (Les Leçons)

Voici ce qu'ils ont découvert, traduit en langage simple :

  • Plus c'est rare, plus c'est dangereux : C'est le résultat le plus clair. Plus le sujet est obscur (une petite rivière, un accident de voiture rare), plus l'IA a tendance à halluciner. C'est comme si l'IA avait une mémoire très forte pour les stars de Hollywood, mais une mémoire très floue pour les gens ordinaires.
  • La barrière de la langue : Les IA sont beaucoup moins fiables en chinois qu'en anglais. C'est comme si le bibliothécaire parlait très bien anglais, mais lisait mal les livres en chinois. De plus, il y a moins de "preuves" (articles Wikipédia) en chinois pour vérifier les faits, ce qui rend le test encore plus difficile.
  • Le domaine compte : Les IA sont meilleures pour parler de voitures que de rivières. Pourquoi ? Peut-être parce qu'il y a plus de données structurées sur les voitures.
  • L'effet "Preuve supplémentaire" : Parfois, donner plus d'informations à l'IA (comme des résultats de recherche web) l'aide pour les sujets rares, mais peut l'embrouiller pour les sujets connus. C'est un peu comme si, pour un sujet simple, trop d'informations créaient du bruit.

En Résumé

Ce papier est une boîte à outils pour les chercheurs. Il leur permet de dire : "Arrêtez de juste tester vos IA sur des questions faciles. Testez-les sur des sujets obscurs, dans différentes langues, et voyez si elles savent rester honnêtes quand personne ne les regarde."

C'est une étape cruciale pour rendre les IA plus fiables, surtout quand on les utilise pour prendre des décisions importantes dans des domaines comme la santé ou la sécurité, où une petite hallucination peut avoir de grandes conséquences.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →