Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems
Cet article présente STEF, un cadre d'évaluation agnostique vis-à-vis du schéma qui permet une surveillance continue et native de la production des systèmes Text-to-SQL en générant des scores de précision interprétables à partir d'entrées en langage naturel et de requêtes SQL générées, sans nécessiter de schémas de base de données ni de requêtes de référence.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un assistant robot très intelligent qui parle « Humain » (comme « Montre-moi les ventes de l'année dernière ») et le traduit en « Langage de Base de Données » (code SQL) pour extraire des informations des dossiers d'une entreprise.
Le grand problème que cet article aborde est : Comment savez-vous si le robot fait du bon travail lorsqu'il travaille pour de vraies personnes dans une vraie entreprise ?
L'Ancienne Méthode : Le Problème de la « Corrigé »
Dans le passé, pour tester ces robots, les chercheurs utilisaient une méthode similaire à la notation d'un examen de mathématiques avec un corrigé.
- Le Scénario : Vous posez une question au robot, il donne une réponse, et vous la comparez à une réponse « Or » (Gold Standard) écrite par un expert humain.
- Le Défaut : Dans le monde réel, vous n'avez pas de corrigé pour chaque question qu'un client pose. De plus, la base de données de l'entreprise est souvent secrète, changeante, ou trop complexe à partager avec l'équipe de test.
- Le Résultat : Une fois le robot déployé dans un vrai bureau, personne ne sait s'il se dégrade avec le temps. C'est comme conduire une voiture avec un compteur de vitesse cassé ; vous ne savez pas si vous dépassez la vitesse limite avant de vous écraser.
La Nouvelle Solution : STEF (L'Inspecteur « Traducteur Intelligent »)
Les auteurs ont créé un nouveau système appelé STEF (Framework d'Évaluation Text-to-SQL Indépendant du Schéma). Imaginez STEF comme un éditeur sur-intelligent qui n'a pas besoin du livre original ou de la base de données pour vérifier si la traduction est bonne.
Voici comment STEF fonctionne, en utilisant des analogies simples :
1. La Règle « Sans Référence »
STEF n'a pas besoin de la réponse « Or » ni de la carte de la base de données. Il ne regarde que trois choses :
- Ce que l'humain a demandé.
- Comment le robot a reformulé cette question en interne.
- Le code que le robot a écrit.
C'est comme un traducteur qui vérifie si une phrase française a du sens en anglais, sans avoir besoin de connaître le texte source original en espagnol.
2. La « Déconstruction » (Démêler la Soupe)
Au lieu de simplement comparer le code caractère par caractère (ce qui revient à vérifier si deux phrases ont exactement les mêmes lettres), STEF décompose la demande en ingrédients :
- Que cherchons-nous ? (Les colonnes)
- Que comptons-nous ou additionnons-nous ? (Les mathématiques)
- Que filtrons-nous ? (La partie « affiche-moi uniquement les utilisateurs actifs »)
- Comment le regroupons-nous ? (Par pays, par année, etc.)
STEF vérifie si le robot a inclus les bons ingrédients. Si l'humain a demandé « Utilisateurs Actifs » et que le robot a oublié de filtrer les « Inactifs », STEF repère l'ingrédient manquant immédiatement.
3. Le Juge « Humain » (Le LLM)
STEF utilise une autre IA (un « Juge ») pour examiner les ingrédients et décider : « Ce code répond-il vraiment à la question ? »
- Le Score de Confiance : Le Juge ne dit pas simplement « Oui » ou « Non ». Il dit : « Je suis sûr à 90 % que c'est juste », ou « Je ne suis sûr qu'à 50 % ».
- La Pénalité : Si le Juge n'est pas sûr, le score final reçoit une petite pénalité. Cela empêche le système d'attribuer un score parfait à une devinette.
4. Les Règles « Monde Réel » (Normalisation)
C'est la partie la plus intelligente. Dans le monde réel, les robots ajoutent parfois des étapes supplémentaires qui sont en fait utiles, pas erronées. STEF le sait.
- La Règle « Tri » : Si un robot trie les résultats du plus haut au plus bas (même si l'humain ne l'a pas demandé), STEF dit : « C'est une touche sympathique, pas une erreur ».
- La Règle « Sécurité » : Si un robot ajoute une limite comme « Montre-moi les 10 000 premiers résultats » juste pour empêcher l'ordinateur de planter, STEF dit : « Bon travail, c'est sûr », au lieu de « Faux, tu n'as pas demandé 10 000 ».
- La Règle « Regroupement » : Si les mathématiques nécessitent de regrouper les données pour avoir du sens, STEF l'accepte même si l'humain n'a pas explicitement dit « regrouper par ».
5. La « Personnalisation Entreprise » (Le Livret de Règles)
Chaque entreprise est différente. Une entreprise peut appeler une colonne « Région », tandis qu'une autre l'appelle « Territoire ».
STEF possède un livret de règles configurable. Vous pouvez dire à STEF : « Hé, dans cette entreprise, « Région » et « Territoire » signifient la même chose », ou « Ignore toujours le filtre « Statut » car il est ajouté automatiquement ». Cela permet à STEF de s'adapter à n'importe quelle entreprise sans avoir besoin d'être reprogrammé.
Le Score Final
STEF attribue un score de 0 à 100.
- 90-100 : Excellent. Le robot est prêt pour la première division.
- 50-75 : Marginal. Le robot devine trop ; les humains devraient le vérifier.
- En dessous de 50 : Mauvais. Le robot échoue et a besoin d'aide immédiate.
Pourquoi Cela Compte
Avant STEF, les entreprises volaient à l'aveugle avec leurs assistants IA. Elles ne pouvaient pas dire si l'IA devenait lentement plus stupide ou si elle commettait des erreurs dangereuses. STEF agit comme un moniteur de santé continu pour ces agents IA. Il permet aux entreprises de corriger les problèmes avant qu'ils n'affectent les décisions commerciales réelles, le tout sans avoir besoin de jeter un coup d'œil dans la base de données secrète ou d'écrire de nouveaux corrigés pour chaque question.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.