← Nieuwste papers
🤖 AI

SAGE: Scalable AI Governance & Evaluation

SAGE is een schaalbaar AI-governanceframework dat hoogwaardig menselijk oordeel operationaliseert via een bidirectionele kalibratielus van beleid, precedent en LLM-surrogaatrechters, waarbij kosteneffectieve distillatie wordt ingezet om beleidsconform modelonderzoek in LinkedIn Search mogelijk te maken, wat uiteindelijk het aantal dagelijkse actieve gebruikers met 0,25% heeft verhoogd.

Oorspronkelijke auteurs: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muth
Gepubliceerd 2026-06-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muthuregunathan, Abhinav Gupta, Mathew Teoh, Andrew Kirk, Thomas Kwan, Jingwei Wu, Wenjing Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofdredacteur bent van een enorme krant (LinkedIn) die dagelijks miljoenen artikelen (banen en profielen) publiceert. Je doel is om ervoor te zorgen dat wanneer een lezer naar iets specifieks zoekt, zoals "entry-level data analyst", hij het perfecte artikel krijgt, en niet zomaar een willekeurig artikel dat toevallig die woorden bevat.

Het probleem? Je hebt te veel artikelen en te veel lezers. Je kunt niet een menselijke redacteur vragen om elk enkel zoekresultaat te controleren om te zien of het goed is. Als je dat probeert met simpele wiskunde (zoals tellen hoe vaak mensen op een link klikken), kun je worden misleid door populaire maar irrelevante artikelen.

Dit is het verhaal van SAGE, een nieuw systeem dat LinkedIn heeft gebouwd om dit probleem op te lossen. Zie SAGE als een "Super-Redacteur" die leert denken als een menselijke expert, maar werkt op de snelheid van een robot.

Hier is hoe het werkt, onderverdeeld in eenvoudige stappen:

1. Het Probleage: De "Mens versus Robot"-kloof

Meestal vertrouwen bedrijven die zoekmachines bouwen op twee dingen:

  • Menselijke Redacteuren: Zij zijn geweldig in het beoordelen van kwaliteit, maar ze zijn traag en duur. Ze kunnen geen miljoenen resultaten lezen.
  • Engagement Metrics: Ze tellen clicks en weergaven. Maar dit is als het beoordelen van een film op basis van de kassa-opbrengst; een slechte film kan nog steeds populair zijn als mensen er per ongeluk op klikken. Het vertelt je niet of de film daadwerkelijk goed is.

LinkedIn had een manier nodig om de kwaliteitsbeoordeling van een mens te krijgen met de snelheid van een machine.

2. De Oplossing: Het "SAGE"-framework

SAGE staat voor Scalable AI Governance & Evaluation. Het is een drieledig team dat samenwerkt om een perfect "regelboek" te creëren voor het beoordelen van zoekresultaten.

Deel A: Het Beleid (Het Regelboek)

Dit is een reeks geschreven regels in gewone taal. In plaats van te zeggen "zoek op trefwoorden", zegt het zaken als: "Als een gebruiker vraft om een instapfunctie, mag de functie niet 10 jaar ervaring vereisen." Het definieert precies wat "goed" is.

Deel B: Het Precedent (De Voorbeeldantwoorden)

Stel je een leraar voor die een student een paar voorbeeldopdrachten geeft met perfecte cijfers en uitleg. SAGE gebruikt een kleine, zorgvuldig gekozen set "gouden standaard" voorbeelden gemaakt door menselijke experts. Deze voorbeelden laten de AI precies zien hoe de regels toegepast moeten worden op lastige situaties.

Deel C: De Surrogate Judge (De Student)

Dit is een AI (een Large Language Model) die optreedt als de rechter. Het leest de zoekresultaten en vergelijkt deze met het Regelboek en de Voorbeeldantwoorden.

3. Het Geheime Recept: "Two-Way Training"

In het verleden vertelde je de AI gewoon de regels en hoopte je dat hij het begreep. SAGE gebruikt een Two-Way Calibration Loop.

  • Mens naar AI: Mensen leren de AI de regels en laten voorbeelden zien.
  • AI naar Mens: De AI bekritiseert de mensen zelfs!
    • Als de AI ziet dat een menselijke expert een fout maakt (zoals een verborgen detail in een lange vacaturetekst over het hoofd zien), signaleert het dit.
    • Als de AI in de war raakt omdat de regels vaag zijn, vertelt het de mensen: "Hé, jullie regelboek dekt dit specifieke geval niet."

Dit creëert een cyclus waarin het Regelboek, de Voorbeelden en de AI-rechter allemaal samen slimmer worden. Ze corrigeren elkaars fouten totdat ze het bijna perfect met elkaar eens zijn (ongeveer 77% overeenstemming met menselijke experts, wat in dit veld als "substantieel" wordt beschouwd).

4. De Snelheidstruc: "Distillatie" (Leraar naar Student)

De "Teacher" AI (de AI die van mensen heeft geleerd) is erg slim maar traag en duur om te draaien. Het is als een briljante professor die uren nodig heeft om een essay te nakijken. LinkedIn moet echter miljoenen papers per seconde beoordelen.

Daarom gebruikten ze een techniek genaamd Distillatie.

  • Stel je voor dat de Teacher (de briljante professor) hun denkproces uitlegt aan een Student (een snelle, efficiënte stagiair).
  • De Student leert de logica van de Teacher na te bootsen, maar wordt veel kleiner en sneller.
  • Het Resultaat: De Student-rechter is 92 keer goedkoper en sneller dan de Teacher, maar geeft nog steeds bijna net zo vaak het juiste antwoord als de menselijke experts.

5. Hoe het LinkedIn veranderde

Nadat ze deze snelle, slimme Student-rechter hadden gebouwd, gebruikten ze deze op drie krachtige manieren:

  1. Het Veiligheidsnet (Offline Testing): Voordat ze een nieuwe zoekfunctie lanceren, halen ze deze door de Student-rechter. Als de AI zegt: "Deze nieuwe functie geeft slechte resultaten," kunnen ze dit onmiddellijk stoppen. Ze hoeven niet te wachten tot echte gebruikers gaan klagen. Dit verkortte hun testtijd van 2 weken naar 3 dagen.
  2. De Real-Time Poortwachter (Online Serving): Ze hebben de AI nog verder gecomprimeerd om hem klein genoeg te maken om in real-time te draaien. Nu controleert een piekleine versie van deze AI direct de resultaten elke keer dat je zoekt, om te controleren of ze de regels volgen.
  3. Het Vroegtijdige Waarschuwingssysteem: Ze gebruikten de AI om het systeem 24/7 in de gaten te houden. Soms kan een zoekupdate er op basis van clicks goed uitzien, maar merkt de AI dat de kwaliteit daalt. Het ving een probleem op dat menselijke statistieken misten, waardoor een slechte ervaring voor gebruikers werd voorkomen.

De Kern van het Verhaal

Door dit systeem te gebruiken, heeft LinkedIn hun zoekmachine niet alleen "sneller" gemaakt; ze hebben het slimmer en betrouwbaarder gemaakt.

Het paper beweert dat door SAGE te gebruiken om kwalitatieve regels af te dwingen, ze een toename van 0,25% in Daily Active Users op LinkedIn zagen. In de wereld van een platform met honderden miljoenen gebruikers, vertegenwoordigt dit kleine percentage een enorm aantal mensen die vonden wat ze zochten, op de site bleven en bleven terugkeren.

Kortom: SAGE veranderde de rommelige, subjectieve taak van "beslissen wat een goed zoekresultaat is" in een helder, geautomatiseerd en schaalbaar proces dat van zijn fouten leert en steeds beter wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →