← Derniers articles
🤖 AI

Schema-First Retrieval: Embedding Catalogs for Natural Language Analytics

Cet article introduit le Schema-First Retrieval, une nouvelle couche de recherche qui intègre et indexe diverses métadonnées de catalogue (tables, colonnes, métriques, relations et historique des requêtes) afin d'améliorer significativement la précision de la sélection de schéma et de réduire les erreurs d'exécution SQL dans les systèmes text-to-SQL d'entreprise en traitant le contexte du catalogue comme un problème de recherche de premier rang plutôt que comme un simple détail de formatage de prompt.

Auteurs originaux : Adarsh Agrawal, Shashank Indukuri

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adarsh Agrawal, Shashank Indukuri

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de demander un livre spécifique à un bibliothécaire très intelligent, mais légèrement confus.

Le Problème : Le Mauvais Rayon
Dans l'ancienne méthode (ce que le document appelle le « prompt de schéma brut »), vous allez voir le bibliothécaire et vous dites : « Je veux des informations sur le chiffre d'affaires ». Mais le bibliothécaire n'a pas de rayon étiqueté « Chiffre d'affaires ». À la place, il possède des milliers de rayons aux noms déroutants comme tbl_fin_2024_q3 ou amt_net_rev_lcl.

Parce que le bibliothécaire ne sait pas de quel rayon vous parlez, il pourrait prendre un livre dans le mauvais rayon. Il pourrait alors rédiger une phrase parfaite (un code SQL) basée sur ce mauvais livre, mais la réponse sera inutile. Dans les grandes entreprises, la « bibliothèque » (la base de données) est si vaste et désordonnée que le bibliothécaire risque de saisir le mauvais contexte avant même de commencer à rédiger la réponse.

La Solution : La Récupération Prioritaire au Schéma (Schema-First Retrieval)
Ce document présente un nouveau système appelé Schema-First Retrieval. Au lieu de demander au bibliothécaire de deviner à partir de toute la bibliothèque, ce système agit comme un système de fiches de catalogue ultra-intelligent qui trouve les pièces d'information exactes avant même que le bibliothécaire ne voie la question.

Voici comment cela fonctionne, en utilisant des analogies simples :

1. Les Cinq Types de « Fiches de Catalogue »

Au lieu de simplement regarder les titres des livres, ce système crée cinq types spécifiques de « fiches » pour chaque information de la bibliothèque :

  • Fiches de Table : Ce sont comme les panneaux de « Section » (ex : « Cette section concerne les Écoles »).
  • Fiches de Colonne : Ce sont comme les « Chapitres » spécifiques ou les « Lignes » à l'intérieur du livre (ex : « Cette colonne liste les niveaux scolaires »).
  • Fiches de Métrique : Ce sont comme le « Glossaire » ou le « Dictionnaire métier ». Si vous demandez le « Churn » (taux d'attrition), cette fiche explique qu'il s'agit en fait de « personnes ayant arrêté d'utiliser le service », même si la base de données l'appelle autrement.
  • Fiches de Relation : Ce sont comme les « Renvois » qui indiquent comment deux livres différents sont connectés (ex : « Pour trouver le total des ventes, vous devez joindre le livre 'Commandes' avec le livre 'Clients' »).
  • Fiches d'Historique : Ce sont comme un « Registre des questions passées ». Si quelqu'un a posé une question similaire la semaine dernière, cette fiche rappelle au système : « Hé, nous avons trouvé la réponse la dernière fois en utilisant ces pages spécifiques ».

2. Le Processus de Recherche (La Couche de Récupération)

Lorsque vous posez une question, le système ne se contente pas de déverser toute la bibliothèque sur le bureau du bibliothécaire. Il effectue une recherche en trois étapes :

  1. Le Filet Large : Il utilise un « réseau sémantique » (embeddings IA) pour capturer tout ce qui ressemble à votre question, même si les mots sont différents.
  2. L'Examen de l'Expert (Reranking) : Une seconde IA, plus méticuleuse, examine les éléments capturés. Elle réalise : « Attendez, le 'Chiffre d'affaires' se trouve généralement dans cette table spécifique, pas dans celle-là », et réorganise la liste pour placer les meilleures correspondances en haut.
  3. La Vérification de la Mémoire : Il consulte les « Fiches d'Historique ». Si l'entreprise pose habituellement une question sur le « Chiffre d'affaires » d'une certaine manière, le système donne la priorité à ce chemin.

3. Le « Gardien de Sécurité » (Contrôle d'Accès)

Le document souligne que le bibliothécaire (l'IA) ne doit pas être chargé de se souvenir des règles de sécurité. À la place, il y a un Gardien de Sécurité à la porte.

  • Avant que le bibliothécaire ne voie les livres, le garde vérifie : « Cet utilisateur a-t-il l'autorisation de voir la section 'Salaire' ? »
  • Si ce n'est pas le cas, le garde retire physiquement ces pages.
  • Si le bibliothécaire tente d'écrire une phrase en utilisant une page interdite, le garde interrompt la phrase avant qu'elle ne soit envoyée. Cela se fait par des règles strictes, et non en demandant au bibliothécaire de « faire attention ».

4. Les Résultats : Moins d'Erreurs

Le document a testé ce système sur trois « bibliothèques » (jeux de données) différentes :

  • Trouver les bonnes pages : Le système a trouvé les tables et les colonnes correctes bien plus souvent que les anciennes méthodes. Par exemple, lors d'un test, il a trouvé la bonne table 96 % du temps, contre des taux bien inférieurs pour les méthodes plus anciennes.
  • Moins de phrases brisées : Lorsque le système a utilisé cette approche de « catalogue d'abord », le nombre d'erreurs dans le code final a chuté de 2,5 fois.
    • Pourquoi ? Souvent, l'ancien système échouait car il ne savait pas écrire correctement le nom d'une colonne (comme oublier de mettre des guillemets autour d'un nom contenant un espace). Comme le nouveau système extrait la « Fiche de Colonne » qui possède déjà le formatage correct, le bibliothécaire n'a plus qu'à la copier parfaitement.

La Grande Conclusion

Le document soutient que l'Analyse en Langage Naturel (poser des questions en langage courant) ne doit pas être traitée comme un problème de « rédaction ». C'est en réalité un problème de recherche.

Si vous donnez à une IA intelligente la mauvaise carte, elle écrira une phrase parfaite menant au mauvais endroit. En construissant une meilleure carte (le catalogue) et en trouvant le bon chemin avant que l'IA ne commence à écrire, vous obtenez des réponses fiables, sûres et précises. L'IA n'est pas celle qui découvre l'entrepôt ; elle ne fait que rédiger le rapport basé sur les documents curatés, sûrs et corrects que le système a trouvés pour elle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →