← Nieuwste papers
🤖 machine learning

UCCI: Calibrated Uncertainty for Cost-Optimal LLM Cascade Routing

UCCI is een calibratie-vooropgestelde routingframework dat token-niveau onzekerheid via isotone regressie omzet in foutkansen per query en escalatiedrempels optimaliseert door middel van kostenminimalisatie onder beperkingen, wat resulteert in een reductie van 31% in inferentiekosten bij behoud van hoge nauwkeurigheid op een productiewerklast voor NER in vergelijking met bestaande routingbaselines.

Oorspronkelijke auteurs: Varun Kotte

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Varun Kotte

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een drukke klantenservicecentrum runt. Je hebt twee soorten agenten:

  • De Junior-agent: Snel, goedkoop en uitstekend in het afhandelen van simpele vragen zoals "Wat zijn jullie openingstijden?"
  • De Senior-expert: Langzaam, duur en noodzakelijk voor lastige vragen zoals "Hoe los ik deze complexe bug op?"

Je doel is geld te besparen door de Junior zo veel mogelijk gesprekken te laten afhandelen, maar je kunt het je niet veroorloven om hen de moeilijke gevallen te laten verprutsen. Het probleem? De Junior denkt vaak dat ze het antwoord weten, terwijl ze dat eigenlijk niet doen. Ze kunnen zelfverzekerd klinken terwijl ze het verkeerde advies geven.

Dit artikel introduceert UCCI, een slim "verkeersregelaar"-systeem dat bepaalt wanneer een Junior een gesprek mag afhandelen en wanneer het moet worden doorgestuurd naar de Senior.

Hier is hoe UCCI werkt, opgesplitst in eenvoudige stappen:

1. Het probleem: De "Zekerheidsval"

Meestal proberen computers te raden hoe zeker ze zijn. Als de Junior-agent zegt: "Ik ben 90% zeker", laat het systeem hen misschien het gesprek afhandelen. Maar in de wereld van AI (Grote Taalmodellen) is dat "90% zeker"-getal vaak een leugen. Het is niet gekalibreerd. De Junior kan op een moeilijke vraag "90% zeker" zeggen en het fout hebben, of "50% zeker" zeggen op een makkelijke vraag en het juist hebben.

Omdat de zekerheidscijfers onbetrouwbaar zijn, moeten bedrijven meestal voor elke nieuwe taak handmatig regels raden en controleren (tunen). Het is alsof je probeert een auto te rijden met een kapotte snelheidsmeter; je moet raden hoe snel je gaat.

2. De oplossing: UCCI (De "Waarheidsserum")

UCCI lost dit op door twee hoofddingen te doen:

Stap A: De Kalibratie (Het Waarheidsserum)
Voordat het systeem live gaat, neemt UCCI een steekproef van vragen en vergelijkt de antwoorden van de Junior met de waarheid. Het gebruikt een wiskundig hulpmiddel genaamd Isotone Regressie (denk hierbij aan een "waarheidsfilter") om de wankelende zekerheidsscores van de Junior om te zetten in echte waarschijnlijkheden.

  • Voor: De Junior zegt "Ik ben 80% zeker." (Realiteit: Ze hebben slechts 50% van de tijd gelijk).
  • Na UCCI: Het systeem vertaalt die "80%" naar een echte "50% kans op fout".
  • Resultaat: Het systeem kent nu het werkelijke risico op een fout, niet alleen wat de AI zegt dat het risico is.

Stap B: De Kosten-optimale Beslissing (De Slimme Verkeersregelaar)
Nu het systeem het werkelijke risico kent, gebruikt het een eenvoudige regel:

  • Als het werkelijke risico dat de Junior een fout maakt laag is, laat ze het afhandelen (Geld besparen!).
  • Als het werkelijke risico hoog is, stuur het naar de Senior (Meer betalen, maar het wel goed krijgen).

Het systeem berekent het exacte "kantelpunt" waar het niet meer de moeite waard is om extra geld uit te geven aan het doorsturen van een gesprek naar de Senior.

3. De resultaten: Geld besparen zonder kwaliteit te verliezen

De auteurs hebben dit getest op een echte baan: het analyseren van foto's om details te vinden zoals camera-merken, lenssoorten en instellingen (een taak genaamd Named Entity Recognition). Ze gebruikten 75.000 echte klantvragen.

  • De opzet: Een klein, snel AI-model (4 miljard parameters) versus een groot, langzaam, duur AI-model (12 miljard parameters).
  • De uitkomst: Met UCCI verlaagden ze de totale kosten voor het verwerken van deze vragen met 31% in vergelijking met het gebruik van alleen het dure Senior-model voor alles.
  • De kwaliteit: Ze behielden een zeer hoge nauwkeurigheidscore (Micro-F1 van 0,91).
  • De vergelijking: UCCI sloeg andere methoden die probeerden de regels te raden (zoals simpele "entropie"-checks of andere leer-gebaseerde routers) met een aanzienlijke marge.

4. De grote les

Het artikel stelt dat de geheime saus niet het vinden van een perfect, complex algoritme is om de drempel te raden. De geheime saus is kalibratie.

Als je een ruisend, onbetrouwbaar signaal (de ruwe zekerheid van de AI) neemt en het repareert met een simpel "waarheidsfilter" (kalibratie), krijg je een bijna perfecte beslisser. Het artikel beweert dat zodra je een gekalibreerde score hebt, je de rest niet hoeft te over-engineeren; je hoeft alleen het juiste prijspunt te kiezen voor wanneer je moet escaleren.

Kortom: UCCI leert de AI eerlijk te zijn over hoe onzeker het is, en gebruikt die eerlijkheid om je veel geld te besparen terwijl de antwoorden correct blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →