← Derniers articles
💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

Ce papier présente « Beyond Questions » (BeQu), un nouveau paradigme d'évaluation des connaissances ouvertes qui évalue les grands modèles de langage sur les connaissances qu'ils expriment naturellement par le biais d'une sollicitation ouverte plutôt que de questions prédéfinies, révélant ainsi des informations significatives sur les capacités des modèles à travers divers facteurs tels que l'échelle et l'effort de raisonnement.

Auteurs originaux : Luca Giordano, Simon Razniewski

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Luca Giordano, Simon Razniewski

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de déterminer ce qu'un étudiant sait réellement d'une figure historique célèbre, comme Martin Luther King Jr.

L'Ancienne Méthode (L'Approche « Jeu Télévisé »)
Pendant des années, les chercheurs ont testé les modèles d'IA comme un animateur de jeu télévisé strict. Ils posaient des questions spécifiques et étroites : « Quelle était sa date de naissance ? » ou « Qui était son épouse ? »

  • Le Problème : C'est comme juger un chef uniquement en lui demandant de préparer un sandwich au fromage grillé. Si le chef est un maître pâtissier mais terrible pour les sandwichs, le quiz le déclare mauvais cuisinier. Le test ne mesure que ce que le concepteur du quiz a pensé de demander. Si le concepteur n'a jamais demandé la couleur préférée du chef, la connaissance de l'IA sur ce fait reste invisible. C'est ce qu'on appelle le biais de disponibilité.

La Nouvelle Méthode (L'Approche « Montrer et Raconter »)
Ce papier introduit une nouvelle méthode appelée Évaluation des Connaissances Ouvertes. Au lieu d'un quiz, imaginez demander à l'IA : « Raconte-moi tout ce que tu sais sur Martin Luther King Jr. »

  • L'Objectif : Nous ne vérifions pas seulement si l'IA donne la bonne réponse à une question spécifique. Nous examinons l'ensemble du récit qu'elle produit. Nous vérifions :
    1. Précision : A-t-elle inventé des faits (hallucinations) ?
    2. Exhaustivité (Rappel) : A-t-elle rappelé tout ce qu'elle sait, ou a-t-elle omis des détails importants ?

L'Outil : BeQu (Au-delà des Questions)
Pour tester cela, les auteurs ont construit un immense terrain de jeu appelé BeQu.

  • Ils ont sélectionné 10 000 éléments aléatoires (personnes, lieux, événements) dans Wikipédia.
  • Ils ont créé une « Bibliothèque de Référence » pour chacun, en rassemblant des faits issus de Wikipédia et du web.
  • Ils ont demandé à 20 modèles d'IA différents de « raconter tout ce qu'ils savent » sur ces 10 000 éléments.
  • Ensuite, ils ont utilisé un juge d'IA ultra-intelligent pour comparer les histoires racontées par les modèles à la Bibliothèque de Référence afin de déterminer ce qui était vrai, ce qui était faux et ce qui manquait.

Ce qu'ils ont découvert (Les Résultats)

  1. Les Grands Modèles Restent en Tête (Mais les Ouverts Rattrapent leur Retard) :
    Considérez les modèles d'IA comme des élèves. Les élèves « commerciaux » (payants, grands modèles comme Claude Opus) obtiennent toujours les meilleures notes. Cependant, certains élèves « open-source » (modèles gratuits) obtiennent des scores remarquablement proches, prouvant qu'ils sont très compétitifs.

  2. Réfléchir Fort n'Aide Pas Beaucoup :
    Vous pourriez penser : « Si je dis à l'IA de « réfléchir plus fort » ou de « raisonner davantage » avant de répondre, elle en saura plus. » Le papier a découvert que c'est surtout un mythe pour cette tâche spécifique. Que l'IA passe 1 seconde ou 10 secondes à « réfléchir », la quantité de faits qu'elle extrait ne change pas beaucoup. La connaissance était déjà là ; il fallait simplement la formuler.

  3. Le « Professeur Strict » vs L'« Écrivain Créatif » :
    Les chercheurs ont essayé de forcer l'IA à répondre dans un format strict (comme un tableur avec des colonnes spécifiques).

    • Résultat : L'IA est devenue très précise (haute précision) mais a cessé de partager de nombreux faits (faible exhaustivité). C'était comme un élève qui ne répond qu'exactement à ce que le professeur demande, refusant d'ajouter le moindre contexte supplémentaire.
    • Inversement, lorsqu'on lui permettait d'être libre et ouverte, l'IA partageait plus de faits, même si elle commettait occasionnellement une petite erreur.
  4. Demander Plus Vous Donne Plus (Jusqu'à un certain point) :
    Lorsque les chercheurs ont demandé à l'IA de lister « 5 faits » contre « 100 faits », l'IA avec la demande plus large partageait généralement plus de connaissances. Cependant, s'ils poussaient l'IA trop loin pour lister des centaines de faits, elle commençait à en inventer (halluciner) simplement pour remplir le quota.

  5. Le Test de la « Fausse Personne » :
    Ils ont demandé à l'IA des choses qui n'existent pas (comme « l'Aéroport International d'Andorre »). Les meilleurs modèles ont simplement répondu : « Je ne sais rien à ce sujet. » Les modèles plus faibles ont commencé à inventer de faux détails, montrant qu'ils devinaient plutôt qu'ils ne savaient.

L'Essentiel
Ce papier soutient que nous devons cesser de traiter l'IA comme une machine à tests à choix multiples. Pour comprendre véritablement ce qu'une IA sait, nous devons lui permettre de parler librement et voir combien du monde réel elle peut décrire, avec quelle précision elle le fait, et ce qu'elle choisit de laisser de côté. Le nouveau référentiel « BeQu » est un outil pour mesurer cette capacité de « Montrer et Raconter », révélant que, bien que l'IA devienne plus intelligente, elle possède encore beaucoup de connaissances cachées qu'elle ne choisit pas toujours de partager.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →