← Neueste Arbeiten
🤖 AI

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

Dieser Beitrag stellt STEF vor, ein schemaneutrales Evaluierungsframework, das eine kontinuierliche, produktionsnahe Überwachung von Text-to-SQL-Systemen ermöglicht, indem es interpretierbare Genauigkeitswerte aus natürlichen Spracheingaben und generierten SQL-Abfragen erzeugt, ohne dass Datenbankschemata oder Ground-Truth-Abfragen erforderlich sind.

Ursprüngliche Autoren: Taslim Jamal Arif, Kuldeep Singh

Veröffentlicht 2026-05-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Taslim Jamal Arif, Kuldeep Singh

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten Roboter-Assistenten, der „Human" spricht (wie „Zeigen Sie mir die Umsätze des letzten Jahres") und dies in „Datenbank-Sprache" (SQL-Code) übersetzt, um Informationen aus den Aufzeichnungen eines Unternehmens zu beziehen.

Das große Problem, das diese Arbeit angeht, lautet: Wie wissen Sie, ob der Roboter eine gute Arbeit leistet, wenn er für echte Menschen in einem echten Unternehmen arbeitet?

Der alte Weg: Das „Lösungsschlüssel"-Problem

In der Vergangenheit nutzten Forscher zur Prüfung dieser Roboter eine Methode, die dem Bewerten eines Mathe-Tests mit einem Lösungsschlüssel glich.

  • Das Szenario: Sie geben dem Roboter eine Frage, er liefert eine Antwort, und Sie vergleichen sie mit einer „Goldstandard"-Antwort, die von einem menschlichen Experten verfasst wurde.
  • Der Fehler: In der realen Welt haben Sie keinen Lösungsschlüssel für jede einzelne Frage, die ein Kunde stellt. Zudem ist die Datenbank des Unternehmens oft geheim, verändert sich ständig oder ist zu komplex, um sie mit dem Testteam zu teilen.
  • Das Ergebnis: Sobald der Roboter in einem echten Büro eingesetzt wird, weiß niemand, ob er im Laufe der Zeit schlechter wird. Es ist wie das Fahren mit einem kaputten Tacho; Sie merken nicht, ob Sie zu schnell fahren, bis Sie einen Unfall bauen.

Die neue Lösung: STEF (Der „intelligente Übersetzer"-Prüfer)

Die Autoren haben ein neues System namens STEF (Schema-agnostisches Text-zu-SQL-Evaluierungsframework) entwickelt. Stellen Sie sich STEF als einen superintelligenten Redakteur vor, der weder das Originalbuch noch die Datenbank benötigt, um zu prüfen, ob die Übersetzung gut ist.

So funktioniert STEF, unter Verwendung einfacher Analogien:

1. Die „Kein-Referenz"-Regel

STEF benötigt weder die „Goldstandard"-Antwort noch die Datenbankkarte. Es betrachtet nur drei Dinge:

  • Was der Mensch gefragt hat.
  • Wie der Roboter diese Frage intern umformuliert hat.
  • Den Code, den der Roboter geschrieben hat.
    Es ist wie ein Übersetzer, der prüft, ob ein französischer Satz auf Englisch Sinn ergibt, ohne den ursprünglichen spanischen Quelltext zu kennen.

2. Die „Zerlegung" (Die Suppe auseinandernehmen)

Anstatt den Code einfach Zeichen für Zeichen zu vergleichen (was so wäre, als würde man prüfen, ob zwei Sätze exakt dieselben Buchstaben haben), zerlegt STEF die Anfrage in Zutaten:

  • Wonach suchen wir? (Die Spalten)
  • Was zählen oder addieren wir? (Die Mathematik)
  • Was filtern wir aus? (Der Teil „nur aktive Benutzer anzeigen")
  • Wie gruppieren wir es? (Nach Land, nach Jahr usw.)

STEF prüft, ob der Roboter die richtigen Zutaten enthalten hat. Wenn der Mensch nach „Aktiven Benutzern" fragte und der Roboter vergaß, die „Inaktiven" herauszufiltern, erkennt STEF das fehlende Element sofort.

3. Der „menschliche" Richter (Das LLM)

STEF nutzt eine andere KI (einen „Richter"), um die Zutaten zu betrachten und zu entscheiden: „Beantwortet dieser Code tatsächlich die Frage?"

  • Der Konfidenzwert: Der Richter sagt nicht einfach nur „Ja" oder „Nein". Er sagt: „Ich bin zu 90 % sicher, dass dies richtig ist" oder „Ich bin nur zu 50 % sicher".
  • Die Strafe: Wenn der Richter unsicher ist, erhält die Endpunktzahl eine kleine Strafe. Dies verhindert, dass dem System eine perfekte Punktzahl für eine Vermutung verliehen wird.

4. Die „Realitätsnahe" Regel (Normalisierung)

Dies ist der cleverste Teil. In der realen Welt fügen Roboter manchmal zusätzliche Schritte hinzu, die tatsächlich hilfreich und nicht falsch sind. STEF weiß das.

  • Die „Sortier"-Regel: Wenn ein Roboter die Ergebnisse von höchstem zu niedrigstem Wert sortiert (auch wenn der Mensch dies nicht gefragt hat), sagt STEF: „Das ist eine nette Geste, kein Fehler."
  • Die „Sicherheit"-Regel: Wenn ein Roboter eine Begrenzung hinzufügt wie „Zeigen Sie mir die Top-10.000-Ergebnisse", nur um zu verhindern, dass der Computer abstürzt, sagt STEF: „Gut gemacht, das ist sicher", anstatt „Falsch, Sie haben nicht nach 10.000 gefragt."
  • Die „Gruppier"-Regel: Wenn die Mathematik eine Gruppierung der Daten erfordert, um Sinn zu ergeben, akzeptiert STEF dies, auch wenn der Mensch nicht ausdrücklich „nach Gruppen sortieren" gesagt hat.

5. Die „Unternehmensspezifische" Anpassung (Das Regelbuch)

Jedes Unternehmen ist anders. Ein Unternehmen könnte eine Spalte „Region" nennen, während ein anderes sie „Gebiet" nennt.
STEF verfügt über ein konfigurierbares Regelbuch. Sie können STEF sagen: „Hey, in diesem Unternehmen bedeuten 'Region' und 'Gebiet' dasselbe" oder „Ignorieren Sie immer den 'Status'-Filter, da er automatisch hinzugefügt wird." Dies ermöglicht es STEF, sich an jedes Unternehmen anzupassen, ohne neu programmiert werden zu müssen.

Die Endpunktzahl

STEF gibt eine Punktzahl von 0 bis 100 aus.

  • 90–100: Ausgezeichnet. Der Roboter ist einsatzbereit.
  • 50–75: Marginal. Der Roboter rät zu viel; Menschen sollten ihn überprüfen.
  • Unter 50: Schlecht. Der Roboter versagt und benötigt sofortige Hilfe.

Warum das wichtig ist

Vor STEF flogen Unternehmen mit ihren KI-Assistenten blind. Sie konnten nicht feststellen, ob die KI langsam dümmer wurde oder ob sie gefährliche Fehler machte. STEF fungiert als kontinuierlicher Gesundheitsmonitor für diese KI-Agenten. Es ermöglicht Unternehmen, Probleme zu beheben, bevor sie echte Geschäftsentscheidungen beeinflussen, und das alles, ohne in die geheime Datenbank hineinzuschauen oder für jede Frage neue Lösungsschlüssel zu schreiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →