SAGE: Scalable AI Governance & Evaluation
SAGE ist ein skalierbares KI-Governance-Framework, das hochwertiges menschliches Urteilsvermögen durch eine bidirektionale Kalibrierungsschleife aus Richtlinien, Präzedenzfällen und LLM-Surrogat-Richtern operationalisiert, indem es eine kosteneffiziente Destillation nutzt, um eine richtlinienkonforme Modellbewertung in der LinkedIn-Suche zu ermöglichen, was letztlich die täglichen aktiven Nutzer um 0,25 % gesteigert hat.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind der Chefredakteur einer riesigen Zeitung (LinkedIn), die täglich Millionen von Artikeln (Jobs und Profilen) veröffentlicht. Ihr Ziel ist es, sicherzustellen, dass ein Leser, wenn er nach etwas Bestimmtem sucht, wie etwa „Entry-Level Data Analyst“, genau den perfekten Artikel findet und nicht nur einen zufälligen, der lediglich diese Wörter enthält.
Das Problem? Sie haben zu viele Artikel und zu viele Leser. Sie können nicht einen menschlichen Redakteur bitten, jedes einzelne Suchergebnis zu prüfen, um festzustellen, ob es gut ist. Wenn Sie versuchen, einfache Mathematik zu verwenden (wie das Zählen, wie viele Leute auf einen Link klicken), könnten Sie von irrelevanten, aber populären Artikeln getäuscht werden.
Dies ist die Geschichte von SAGE, einem neuen System, das LinkedIn entwickelt hat, um dieses Problem zu lösen. Betrachten Sie SAGE als einen „Super-Redakteur“, der lernt, wie ein menschlicher Experte zu denken, aber mit der Geschwindigkeit eines Roboters arbeitet.
So funktioniert es, unterteilt in einfache Schritte:
1. Das Problem: Die Lücke zwischen „Mensch und Roboter“
Normalerweise verlassen sich Unternehmen, wenn sie Suchmaschinen bauen, auf zwei Dinge:
- Menschliche Redakteure: Sie sind großartig darin, Qualität zu beurteilen, aber sie sind langsam und teuer. Sie können nicht Millionen von Ergebnissen lesen.
- Engagement-Metriken: Sie zählen Klicks und Aufrufe. Aber das ist so, als würde man einen Film nur nach seinem Einspielergebnis bewerten; ein schlechter Film kann trotzdem populär sein, wenn die Leute aus Versehen darauf klicken. Es sagt einem nicht, ob der Film tatsächlich gut ist.
LinkedIn brauchte einen Weg, um das Qualitätsurteil eines Menschen mit der Geschwindigkeit einer Maschine zu vereinen.
2. Die Lösung: Das „SAGE“-Framework
SAGE steht für Scalable AI Governance & Evaluation (Skalierbare KI-Governance & Evaluierung). Es ist ein dreiteiliges Team, das zusammenarbeitet, um ein perfektes „Regelwerk“ für die Bewertung von Suchergebnissen zu erstellen.
Teil A: Die Policy (Das Regelwerk)
Dies ist eine Reihe von geschriebenen Regeln in klarem Englisch. Anstatt zu sagen „Keywords matchen“, heißt es zum Beispiel: „Wenn ein Nutzer nach einem Einstiegsjob sucht, darf das Ergebnis nicht 10 Jahre Berufserfahrung voraussetzen.“ Es definiert genau, was „gut“ bedeutet.
Teil B: Der Präzedenzfall (Die Musterantworten)
Stellen Sie sich vor, ein Lehrer gibt einem Schüler einige Musteraufsätze mit perfekten Noten und Erklärungen mit. SAGE verwendet einen kleinen, sorgfältig ausgewählten Satz von „Goldstandard“-Beispielen, die von menschlichen Experten erstellt wurden. Diese Beispiele zeigen der KI genau, wie das Regelwerk auf knifflige Situationen anzuwenden ist.
Part C: Der stellvertretende Richter (Der Schüler)
Dies ist eine KI (ein Large Language Model), die als Richter fungiert. Sie liest die Suchergebnisse und vergleicht sie mit dem Regelwerk und den Musterantworten.
3. Das Geheimrezept: „Zwei-Wege-Training“
In der Vergangenheit haben Sie der KI einfach die Regeln gesagt und gehofft, dass sie sie versteht. SAGE nutzt eine Zwei-Wege-Kalibrierungsschleife.
- Mensch zu KI: Menschen bringen der KI die Regeln bei und zeigen ihr Beispiele.
- KI zu Mensch: Die KI kritisiert sogar die Menschen!
- Wenn die KI sieht, dass ein menschlicher Experte einen Fehler macht (wie das Übersehen eines versteckten Details in einer langen Stellenbeschreibung), weist sie darauf hin.
- Wenn die KI verwirrt ist, weil die Regeln vage sind, sagt sie den Menschen: „Hey, euer Regelwerk deckt diesen spezifischen Fall nicht ab.“
Dies schafft einen Kreislauf, in dem das Regelwerk, die Beispiele und der KI-Richter gemeinsam klüger werden. Sie korrigieren gegenseitig ihre Fehler, bis sie fast perfekt übereinstimmen (eine Übereinstimmung von etwa 77 % mit menschlichen Experten, was in diesem Bereich als „substanziell“ gilt).
4. Der Geschwindigkeits-Trick: „Distillation“ (Lehrer zu Schüler)
Die „Lehrer“-KI (diejenige, die von Menschen gelernt hat) ist sehr intelligent, aber langsam und teuer im Betrieb. Sie ist wie ein genialer Professor, der Stunden braucht, um eine Hausarbeit zu korrigieren. LinkedIn muss jedoch Millionen von Arbeiten pro Sekunde bewerten.
Deshalb haben sie eine Technik namens Distillation (Destillation) eingesetzt.
- Stellen Sie sich vor, der Lehrer (der geniale Professor) erklärt seinen Denkprozess einem Schüler (einem schnellen, effizienten Praktikanten).
- Der Schüler lernt, die Logik des Lehrers nachzuahmen, wird dabei aber viel kleiner und schneller.
- Das Ergebnis: Der Schüler-Richter ist 92-mal günstiger und schneller als der Lehrer, liefert aber immer noch fast so oft die richtige Antwort wie die menschlichen Experten.
5. Wie es LinkedIn verändert hat
Nachdem sie diesen schnellen, smarten Schüler-Richter gebaut hatten, setzten sie ihn auf drei leistungsstarke Arten ein:
- Das Sicherheitsnetz (Offline-Testing): Bevor sie eine neue Suchfunktion einführen, lassen sie diese durch den Schüler-Richter laufen. Wenn die KI sagt: „Diese neue Funktion liefert schlechte Ergebnisse“, können sie sie sofort stoppen. Sie müssen nicht warten, bis sich echte Nutzer beschweren. Dies verkürzte ihre Testzeit von 2 Wochen auf 3 Tage.
- Der Echtzeit-Gatekeeper (Online Serving): Sie haben die KI noch weiter komprimiert, um sie klein genug zu machen, damit sie in Echtzeit laufen kann. Jetzt prüft eine winzige Version dieser KI bei jeder Suche sofort die Ergebnisse, um sicherzustellen, dass sie den Regeln entsprechen.
- Das Frühwarnsystem: Sie nutzten die KI, um das System rund um die Uhr zu überwachen. Manchmal kann eine Such-Aktualisierung basierend auf Klicks zwar gut aussehen, aber die KI bemerkt, dass die Qualität sinkt. Sie hat ein Problem erkannt, das menschliche Metriken übersehen hätten, und so ein schlechtes Nutzererlebnis verhindert.
Das Fazendatum
Durch den Einsatz dieses Systems hat LinkedIn seine Suche nicht nur „schneller“, sondern auch intelligenter und vertrauenswürdiger gemacht.
Das Paper behauptet, dass LinkedIn durch den Einsatz von SAGE zur Durchsetzung hochwertiger Regeln eine Steigerung der täglichen aktiven Nutzer (Daily Active Users) um 0,25 % verzeichnete. In der Welt einer Plattform mit Hunderten von Millionen Nutzern stellt dieser kleine Prozentsatz eine massive Anzahl von Menschen dar, die das fanden, wonach sie suchten, auf der Seite blieben und immer wieder zurückkehrten.
Kurz gesagt: SAGE hat die unordentliche, subjektive Aufgabe, zu entscheiden, „was ein gutes Suchergebnis ist“, in einen klaren, automatisierten und skalierbaren Prozess verwandelt, der aus seinen Fehlern lernt und sich ständig verbessert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.