ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering
Cet article présente ENTLORE, un benchmark fondé sur les graphes qui évalue les systèmes de questions-réponses en entreprise sur leur capacité à effectuer un raisonnement organisationnel latent en reconstruisant des mondes d'entreprise audités à partir de documents de routine afin de tester la récupération de relations implicites au-delà de la simple recherche de faits.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un détective essayant de résoudre un mystère au sein d'une bibliothèque géante et chaotique. Ce n'est pas une bibliothèque ordinaire ; c'est le « cerveau » d'une entreprise massive, rempli de millions de documents comme des e-mails, des rapports de projet, des notes de réunion et des feuilles de calcul. Dans le monde de l'Intelligence Artificielle (IA), il existe un jeu populaire appelé « Question Answering » (Réponse aux Questions). Habituellement, l'IA reçoit une question et une pile de documents, et son travail consiste à trouver la phrase exacte qui détient la réponse. Considérez cela comme une partie de « Je vois quelque chose de... » où la réponse est cachée à la vue de tous, attendant d'être ramassée.
Mais la vie réelle dans une entreprise est bien plus désordonnée qu'un simple jeu. Souvent, la réponse à une question n'est pas écrite dans une seule phrase. Au lieu de cela, la vérité est cachée dans les relations entre différents documents. Peut-être qu'un e-mail dit « Alice a travaillé sur le Module X », et qu'un autre rapport dit « Le Module X fait partie du Projet Y », mais aucun document ne mentionne jamais explicitement « Alice a travaillé sur le Projet Y ». Pour trouver la réponse, l'IA doit elle-même relier les points, en utilisant les règles invisibles de la façon dont l'entreprise est organisée. Ce document, écrit par des chercheurs de ScitiX.ai, traite précisément de la manière d'apprendre aux ordinateurs à effectuer ce genre de travail de détective, plutôt que d'être simplement doués pour trouver des mots.
Le Problème : Le Piège de la « Vérité Cachée »
La plupart des benchmarks d'IA (tests pour l'IA) sont comme une chasse au trésor où la carte est déjà tracée. Les créateurs du test écrivent une question, puis s'assurent que la réponse est explicitement écrite dans les documents fournis à l'IA. C'est comme demander : « De quelle couleur est la balle rouge ? » et donner à l'IA une image d'une balle rouge. L'IA n'a qu'à trouver le mot « rouge ».
Les auteurs de ce document soutiennent que c'est trop facile et que cela ne reflète pas le fonctionnement réel des entreprises. Dans le monde réel, la « balle rouge » peut être mentionnée dans un fichier, et le fait qu'il s'agisse d'une « balle » peut se trouver dans un autre, mais le lien entre les deux n'est jamais énoncé. L'IA doit comprendre que le « Module X » appartient au « Projet Y » en se basant sur la structure de l'entreprise, même si aucun document ne les lie explicitement. Les chercheurs appellent cette compétence manquante le Raisonnement Organisationnel Latent. Il s'agit de la capacité à inférer les règles invisibles d'une organisation à partir des sous-produits désordonnés du travail quotidien.
La Solution : ENTLORE, le « Graphe de Vérité »
Pour tester si l'IA peut réellement faire cela, l'équipe a construit un nouveau benchmark appelé ENTLORE. Imaginez qu'ils aient pris l'histoire numérique entière d'une véritable entreprise privée — des milliers de documents, des organigrammes et des journaux opérationnels — et qu'ils aient construit un immense « Graphe de Vérité » secret en coulisses. Ce graphe est comme un plan directeur qui sait exactement comment chaque personne, projet et module est connecté, sur la base de règles strictes et auditées.
Ensuite, ils ont créé un « monde publié » dans lequel l'IA peut jouer. Ce monde publié contient les mêmes documents, mais tous les noms sont modifiés pour protéger la vie privée (comme transformer « Alice » en « Employé #42 » et « Projet Alpha » en « Projet Beta »). Crucialement, l'IA ne peut pas voir le Graphe de Vérité secret. Elle ne voit que les documents désordonnés et anonymisés.
L'équipe a ensuite posé 907 questions. Ils ont divisé ces questions en trois niveaux de difficulté :
- Niveau 1 (La Recherche) : La réponse se trouve directement dans un document. (ex : « Qui est le gestionnaire du Projet Beta ? »)
- Niveau 2 (La Composition) : La réponse nécessite de lire deux documents et de combiner des faits. (ex : « Qui gère l'équipe qui a construit le Module X ? »)
- Niveau 3 (Le Raisonnement Latent) : La réponse nécessite de relier des points qui ne sont pas explicitement liés. (ex : « Qui est responsable du succès global du Projet Beta ? » — bien qu'aucun document ne dise « l'Employé #42 est responsable du Projet Beta », le Graphe de Vérité le sait parce qu'il gérait le module à l'intérieur de celui-ci.)
Les Résultats : L'IA est bonne pour lire, mais mauvaise pour connecter
Les chercheurs ont testé 8 modèles d'IA différents utilisant diverses méthodes, allant de la simple recherche par mots-clés à des systèmes d'« agents » complexes capables de parcourir des documents comme un humain. Voici ce qu'ils ont trouvé :
1. La « Vérité Cachée » est difficile à trouver
Lorsque la réponse était explicitement écrite dans les documents (Niveaux 1 et 2), les modèles d'IA s'en sortaient raisonnablement bien. Mais lorsqu'ils atteignaient le Niveau 3 (Raisonnement Latent), les performances chutaient de manière spectaculaire. Même les meilleurs modèles n'ont réussi qu'environ 36,2 % de ces questions difficiles.
2. La Structure importe plus que la Vitesse
Les chercheurs ont essayé différentes manières d'aider l'IA à trouver l'information.
- Recherche Simple (BM25) : Rechercher simplement des mots correspondants. Cela fut étonnamment efficace.
- Recherche Dense (Flat RAG) : Utiliser des mathématiques avancées pour trouver des idées similaires. Cela a en fait fait pire que la recherche simple.
- Systèmes Basés sur des Graphes (GraphRAG) : Ces systèmes tentent de construire une carte des connexions entre les documents avant de répondre. Cela s'est avéré être l'approche la plus forte, battant les autres en moyenne. Cela suggère que l'IA a besoin de comprendre la structure de l'entreprise, pas seulement les mots.
3. Même avec les « Documents d'Or », l'IA échoue
La découverte la plus choquante est survenue lorsque les chercheurs ont donné à l'IA les « Documents d'Or » — les fichiers exacts nécessaires pour répondre à la question, sautant ainsi l'étape de la recherche.
- Pour les questions faciles (Niveau 1), l'IA a presque tout réussi.
- Pour les questions moyennes (Niveau 2), elle s'en est toujours bien sortie.
- Mais pour les questions latentes et difficiles (Niveau 3), 30,4 % des réponses étaient toujours fausses, même si l'IA avait les documents parfaits sous les yeux !
Cela signifie que le problème n'est pas seulement que l'IA ne parvient pas à trouver le bon fichier ; c'est qu'elle ne parvient pas à raisonner à travers les règles organisationnelles invisibles, même lorsqu'elle a toutes les preuves devant elle. C'est comme donner à un détective les photos de la scène du crime, mais qu'il échoue encore à réaliser que le majordome et le jardinier sont en fait la même personne parce que les photos ne le disent pas explicitement.
Pourquoi cela importe
Le document conclut que nous ne pouvons pas simplement construire de meilleurs moteurs de recherche pour les entreprises. Nous avons besoin d'une IA capable de comprendre « l'âme » d'une organisation — les règles tacites, les hiérarchies de projets et les connexions cachées. ENTLORE prouve que l'IA actuelle est encore en difficulté avec cela. Elle est très douée pour lire ce qui est écrit, mais elle est encore en train d'apprendre à réfléchir à ce qui est implicite.
Les chercheurs ont rendu leurs données et leur code publics afin que d'autres scientifiques puissent tenter de résoudre ce puzzle. Tant que l'IA ne pourra pas maîtriser ce « raisonnement organisationnel latent », elle sera toujours un peu comme un nouvel employé qui sait lire le manuel, mais qui ne comprend pas encore comment l'entreprise fonctionne réellement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.