EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge
Cet article présente EntSQL, un nouveau benchmark chinois-anglais comprenant 1 066 exemples répartis sur cinq domaines commerciaux, conçu pour évaluer les défis de l'ancrage de la génération Text-to-SQL dans des connaissances d'entreprise à contexte long, là où les modèles actuels peinent à atteindre une grande précision en raison de la nécessité d'une compréhension métier propriétaire.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un bibliothécaire très intelligent et érudit (une IA) qui sait parler la langue humaine et qui sait aussi parler le « langage de base de données » (le SQL). Habituellement, si vous demandez à ce bibliothécaire : « Combien de livres avons-nous vendus le mois dernier ? », il peut consulter le catalogue de la bibliothèque (le schéma de la base de données) et rédiger une note parfaite pour l'assistant du bibliothécaire afin d'obtenir la réponse.
Mais dans le monde réel des grandes entreprises, ce n'est pas aussi simple. Une entreprise possède un manuel de règles secrets que personne à l'extérieur du bâtiment ne connaît. Peut-être que « le mois dernier » signifie en réalité « le trimestre fiscal se terminant en juin », ou que les « produits phares » excluent les articles actuellement en liquidation. Si le bibliothécaire n'a pas ce manuel de règles secrets, il va deviner, et sa note sera fausse.
Entrée en scène « EntSQL » : Le test du manuel de règles secrets
Ce document présente un nouveau test appelé EntSQL. Considérez cela comme un examen final pour les bibliothécaires IA, mais au lieu de simplement leur demander de lire un catalogue de livres, l'examen leur donne un énorme manuel d'entreprise privé de 50 pages et leur demande d'écrire une requête basée sur celui-ci.
Voici le détail de ce que l'article a découvert, en utilisant des analogies simples :
1. Le problème : Le « manuel manquant »
Les tests existants pour ces bibliothécaires IA (comme Spider ou BIRD) sont comme si on leur donnait un catalogue de bibliothèque générique. Ils sont bons pour trouver des livres si le catalogue est clair. Mais dans une véritable entreprise, le « catalogue » (la base de données) est inutile sans le « manuel de l'employé » (les règles commerciales privées).
- L'analogie : Imaginez que vous demandiez à une IA : « Combien avons-nous dépensé pour le "Projet X" ? ». La base de données possède simplement une colonne appelée
cost(coût). Elle ne sait pas que le « Projet X » est en fait un nom de code pour le « Marketing », ou qu'elle ne compte les coûts qu'après une date spécifique. Sans le manuel privé, l'IA navigue à vue.
2. Le test : EntSQL
Les chercheurs ont construit un test utilisant des données réelles (mais anonymisées) provenant de cinq départements différents d'une entreprise : Finance, Trésorerie, RH, Gestion commerciale et Construction du Parti.
- La configuration : Ils ont donné à l'IA une question, la structure de la base de données et un document long et désordonné contenant les règles spécifiques de l'entreprise.
- La difficulté : Les questions étaient complexes. Elles exigeaient que l'IA lise un document long, trouve la règle spécifique concernant les « années fiscales » ou les « calculs de bonus », puis combine cela avec la base de données pour écrire une instruction informatique complexe.
- L'échelle : Le test comprenait plus de 1 000 questions. Les réponses de référence (les instructions correctes) étaient très longues et complexes, comme un paragraphe de code de 400 mots.
3. Les résultats : L'IA est toujours en difficulté
Les chercheurs ont testé les modèles d'IA les plus intelligents du monde (comme Claude, GPT-4 et d'autres) sur cet examen.
- Le score : Même la meilleure IA n'a obtenu que 16 % de bonnes réponses lorsqu'on lui donnait les documents longs.
- L'analogie : C'est comme donner à un étudiant brillant un manuel de 500 pages et lui demander de résoudre un problème de mathématiques. Il sait faire des mathématiques, mais il ne parvient pas à trouver la règle spécifique dans le livre qui s'applique à ce problème précis. Il se perd dans le texte.
- L'indice de l'« évidence » : Lorsque les chercheurs ont donné à l'IA une version surlignée du livre (justement les 2 ou 3 phrases qui comptaient), le score est monté à environ 21 %. Cela prouve que l'IA n'est pas mauvaise en mathématiques ; elle est simplement mauvaise pour trouver l'aiguille dans la botte de foin.
4. Là où elles ont échoué
Les chercheurs ont examiné pourquoi l'IA se trompait. Ce n'était généralement pas parce que l'IA oubliait comment écrire le code.
- L'erreur principale (54 %) : L'IA a manqué le « filtre ». C'était comme demander des « voitures rouges » et l'IA apportant « toutes les voitures » ou des « voitures bleues ». Elle ne parvenait pas à appliquer correctement les règles spécifiques du document aux données.
- L'erreur de portée (14 %) : L'IA a regardé la mauvaise période ou le mauvais département. C'était comme calculer le budget pour « 2023 » alors que la question portait sur « 2024 ».
5. L'écart humain
Les chercheurs ont également demandé à un expert humain de passer le même test.
- L'écart : L'expert humain a réussi environ 84 % des questions avec les notes surlignées. L'IA a obtenu 20 %.
- La conclusion : Il existe un fossé énorme entre ce qu'un humain peut faire avec un manuel d'entreprise et ce que l'IA actuelle peut faire. L'IA est encore très mauvaise pour comprendre les « règles non écrites » d'une entreprise spécifique.
Résumé
EntSQL est un nouveau benchmark qui dit : « Arrêtez de tester simplement si l'IA peut lire une base de données. Testez si elle peut lire le manuel de règles secret d'une entreprise et l'appliquer. »
L'article conclut que, bien que l'IA s'améliore dans l'écriture de code, elle est actuellement incapable d'ancrer ce code dans les connaissances longues, privées et désordonnées sur lesquelles reposent les véritables entreprises. C'est un rappel que pour que l'IA aide réellement au bureau, elle doit devenir bien meilleure pour lire les petits caractères.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.