← Nieuwste papers
📈 economics

Online Pandora's Box for Contextual LLM Cascading

Dit artikel stelt een online contextueel Pandora's Box-framework voor voor het adaptief selecteren van Large Language Model API's door middel van het modelleren van output-gemedieerde feedback en het toepassen van een parametrische reservatie-indexbenadering gecombineerd met GMM-schatting en UCB-stijl betrouwbaarheidsgrenzen om een dimensie-afhankelijke O~(T)\widetilde O(\sqrt T) cumulatieve regret te bereiken.

Oorspronkelijke auteurs: Alexandre Belloni, Yan Chen, Yehua Wei

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alexandre Belloni, Yan Chen, Yehua Wei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een manager bent bij een bedrijf dat dagelijkse problemen moet oplossen. Om elk probleem op te lossen, heb je een "gereedschapskist" met verschillende AI-assistenten (API's). Sommige assistenten zijn goedkoop maar geven misschien een matig antwoord; andere zijn duur maar geven meestal briljante antwoorden.

De uitdaging is: Hoe beslis je welke assistent je om hulp vraagt, en wanneer stop je met vragen?

Als je alleen de goedkope vraagt, krijg je misschien een slecht antwoord en verspil je tijd aan het repareren ervan. Als je direct de dure vraagt, verspil je geld aan eenvoudige problemen die de goedkope ook hadden kunnen oplossen. Als je iedereen vraagt, ga je failliet.

Dit paper, getiteld "Online Pandora's Box for Contextual LLM Cascading," door Alexandre Belloni, Yan Chen, en Yehua Wei, stelt een slimme, wiskundige strategie voor om precies dit probleem op te lossen. Ze noemen hun strategie COSMOS.

Hier is de uitsplitsing van hun idee met behulp van eenvoudige analogieën:

1. Het "Pandora's Box" spel met een twist

In het klassieke "Pandora's Box" verhaal heb je verschillende dozen. Je kunt een doos openen om te zien wat erin zit (de beloning) en betaalt een vergoeding om de doos te openen. Je wilt de beste schat vinden terwijl je zo min mogelijk uitgeeft aan openingskosten.

De Twist in dit Paper:
In de echte wereld van AI betekent het openen van een doos (een AI iets vragen) niet dat je onmiddellijk weet of een antwoord "goed" is.

  • Fase 1 (De Query): Je vraagt een AI iets. Het geeft een conceptantwoord en brengt kosten in rekening. Je ziet het concept, maar je weet nog niet of het daadwerkelijk het probleem van de klant zal oplossen.
  • Fase 2 (De Selectie): Je moet één van de verzamelde concepten kiezen en dit naar de klant sturen. Pas dan kom je erachter of het een succes (de beloning) of een mislukking was.

Dit is lastig omdat je betaalt om concepten te zien, maar je krijgt alleen krediet voor de versie die je uiteindelijk kiest.

2. De "Reservation Index" (Het Magische Getal)

De auteurs suggereren dat je, in plaats van te proberen elk mogelijk antwoord dat een AI zou kunnen geven te onthouden (wat onmogelijk is), een "Reservation Index" aan elke AI toekent voor elke specifieke situatie.

Zie deze index als een "Worth-It Score" (een score van de moeite waard).

  • Als de score voor "AI Assistent A" hoog is, betekent dit: "Zelfs als Assistent A een matig antwoord geeft, is het nog steeds de moeite waard om hen te vragen, omdat ze meestal betrouwbaar zijn."
  • Als de score laag is, betekent dit: "Maak je er niet druk om om hen te vragen, tenzij je geen andere keuze hebt."

Het paper gebruikt een wiskundige regel (gebaseerd op een beroemde econoom genaamd Weitzman) om deze score te berekenen. De regel luidt: Vraag eerst de AI met de hoogste score. Als het antwoord dat zij geven beter is dan de score van de volgende beste AI, stop dan en kies dat antwoord. Zo niet, vraag dan de volgende.

3. Het leerprobleem: "De Score Raden"

Het probleem is dat de manager aan het begin niet de ware "Worth-It Scores" kent. Hij moet deze leren terwijl hij werkt.

  • Hij weet niet precies hoe goed een AI is voor een specifiek type vraag.
  • Hij weet niet precies hoeveel een AI in rekening brengt (aangezien kosten kunnen variëren op basis van de lengte van het antwoord).

De oplossing van de auteurs is een leeralgoritme genaamd COSMOS. Het werkt als een slimme ontdekker:

  1. Optimisme: Het gaat ervan uit dat de scores iets beter zijn dan ze in werkelijkheid zijn. Dit moedigt het systeem aan om verschillende AI's uit te proberen om te zien of ze daadwerkelijk goed zijn (exploratie).
  2. Correctie: Naarmate het systeem meer vragen stelt en de resultaten ziet, werkt het de "Worth-It Scores" bij om ze nauwkeuriger te maken.
  3. Tweeledig Leren:
    • Het leert hoe het de kwaliteit van het uiteindelijke antwoord (de beloning) kan voorspellen.
    • Het leert de Reservation Index voor elke AI (hoe waarschijnlijk het is dat ze de kosten waard zijn).

4. Het Resultaat: Geld en Tijd Besparen

Het paper bewijst wiskundig dat deze strategie erg goed werkt. Over een lange periode van tijd (bijvoorbeeld een jaar aan dagelijkse verzoeken), groeit de totale "regret" (het geld en de kwaliteit die verloren gaan door niet de perfecte keuze te maken) zeer langzaam.

Specifiek laten ze zien dat hun methode efficiënt genoeg is om duizenden verzoeken aan te kunnen zonder dat de kosten uit de hand lopen. Het vindt het evenwicht tussen:

  • Te goedkoop: Slechte antwoorden krijgen die gerepareerd moeten worden.
  • Te duur: Geld verspillen aan eenvoudige taken.
  • Precies goed: De juiste AI vragen, voor de juiste prijs, op het juiste moment.

Samenvatting

Stel je voor dat je een team van detectives inhuurt om een zaak op te lossen.

  • De Oude Manier: Je huurt ofwel direct de duurste detective in (geld verspillen aan eenvoudige aanwijzingen) of de goedkoopste (het risico lopen op een slechte oplossing).
  • De COSMOS Manier: Je hebt een lijst met detectives. Voor elke aanwijzing heb je een "onderbuikgevoel" (de Reservation Index) over wie het waard is om te bellen. Je belt degene met het beste onderbuikgevoel. Als hun rapport goed genoeg is, stop je. Zo niet, dan bel je de volgende op de lijst.
  • De Magie: Het systeem wordt elke dag slimmer. Het leert welke detectives daadwerkelijk goed zijn bij welke soorten aanwijzingen, waardoor je nooit betaalt voor een slecht rapport en nooit een geweldig rapport mist.

De belangrijkste claim van de auteurs is dat bedrijven door dit specifieke wiskundige kader te gebruiken, AI-tools veel efficiënter kunnen gebruiken, waardoor ze aanzienlijk geld besparen terwijl de kwaliteit hoog blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →