← Nieuwste papers
🤖 AI

UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling

Dit artikel introduceert UniScale, een online framework dat modelrouting en test-time scaling verenigt in een enkele adaptieve optimalisatieruimte met behulp van contextuele multi-armed bandits om een superieure kwaliteit-kostenbalans te bereiken bij de implementatie van grote taalmodellen.

Oorspronkelijke auteurs: Kaiyu Huang, Xingyu Wang, Mingze Kong, Zhubo Shi, Yuqian Hou, Hong Xu, Zhongxiang Dai, Minchen Yu, Qingjiang Shi

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaiyu Huang, Xingyu Wang, Mingze Kong, Zhubo Shi, Yuqian Hou, Hong Xu, Zhongxiang Dai, Minchen Yu, Qingjiang Shi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een drukke restaurantkeuken runt. Je doel is om heerlijke maaltijden (hoogwaardige antwoorden) te serveren aan klanten zo snel en goedkoop mogelijk (lage computationele kosten).

In de wereld van Large Language Models (LLM's) gebruiken chefs traditioneel twee afzonderlijke strategieën om dit te beheren:

  1. De "Menu-wissel" (Model Routing): Als een klant een eenvoudige salade bestelt, stuur je ze naar een junior kok. Als ze een complexe 10-gangen maaltijd bestellen, stuur je ze naar de chef-kok. Het probleem? Je hebt slechts een paar specifieke chefs in dienst. Je kunt niet gemakkelijk een "middelbare" chef vinden voor een gerecht van gemiddelde moeilijkheid. Je krijgt óf een eenvoudige salade óf een enorme feestmaaltijd, zonder soepele overgang in het midden.
  2. De "Extra Inspanning" (Test-Time Scaling): Je houdt dezelfde chef aan, maar vertelt hem om harder na te denken. Misschien proeft hij de soep vijf keer in plaats van één keer, of schrijft hij drie verschillende recepten uit voordat hij er één serveert. Het probleem? Zelfs de beste chef heeft een limiet. Als het gerecht te complex is, zal geen enkele hoeveelheid extra nadenken de chef redden, en kan hij uitgeblust raken (te veel tijd en energie verspillen).

Het Probleem:
Lange tijd werden deze twee strategieën apart uitgevoerd. Het artikel betoogt dat dit is alsof je een keuken hebt met een manager die beslist welke chef te gebruiken, en een andere manager die beslist hoe hard die chef moet werken, zonder dat ze ooit met elkaar praten. Dit leidt tot inefficiëntie: je stuurt misschien een eenvoudige bestelling naar een chef-kok die er te veel over nadenkt, of een moeilijke bestelling naar een junior kok die te vroeg opgeeft.

De Oplossing: UNISCALE
De auteurs introduceren een nieuw systeem genaamd UNISCALE (Unified Inference Scaling). Denk aan dit als een superintelligente Hoofdchef die de hele keuken in realtime beheert.

In plaats van een chef of een inspanningsniveau te kiezen, maakt deze Hoofdchef voor elke bestelling direct een op maat gemaakt plan dat beide beslissingen combineert:

  • "Deze bestelling is lastig, dus laten we onze 4-sterrenchef gebruiken, maar laat hem zijn werk twee keer controleren."
  • "Deze bestelling is makkelijk, dus laten we onze 1-sterrenchef gebruiken, maar laat hem even dubbelchecken voor de zekerheid."
  • "Deze bestelling is een nachtmerrie, dus we hebben de 5-sterrenchef nodig om vijf verschillende versies uit te schrijven en de beste te kiezen."

Hoe het leert (De "Slimme Ober"):
De keuken is chaotisch. Bestellingen veranderen, nieuwe chefs komen erbij en soms vertrekken de oude. De Hoofdchef kan niet elke regel uit het hoofd leren. In plaats daarvan werkt UNISCALE als een slimme ober die leert door te doen.

  • Het gebruikt een methode genaamd LinUCB (een type wiskundige truc die wordt gebruikt bij gokken en besluitvorming).
  • Elke keer dat het een gerecht serveert, krijgt het feedback: "Was het lekker?" en "Wat kostte het?".
  • Het gebruikt deze feedback om een mentale kaart op te bouwen. Het leert dat "Voor wiskundige problemen is het 8B-model met 4 controles perfect," maar dat "Voor coderen het 14B-model met 2 controles beter is."
  • Cruciaal is dat het een balans vindt tussen exploratie (nieuwe combinaties proberen om te zien of ze werken) en exploitatie (gebruikmaken van wat het al weet dat goed werkt).

De Geheime Wapens:
Om dit snel en efficiënt te maken, heeft het systeem twee speciale trucs:

  1. De "Vroege Exit" (Path-Aware Early Exiting): Stel je voor dat de chefs meerdere recepten uitschrijven. Het systeem heeft een "proever" (een verifieerder) die het werk controleert terwijl het wordt uitgevoerd. Als de proever ziet dat één recept duidelijk vreselijk gaat worden, vertelt het systeem de chef onmiddellijk om met dat recept te stoppen. Dit bespaart een enorme hoeveelheid tijd en energie omdat het niet wacht tot het slechte recept voltooid is.
  2. De "Universele Scorekaart" (Cost Model): Het systeem telt niet alleen "stappen". Het telt "inspanning" op een uniforme manier. Het begrijpt dat het tillen van een zware pan (geheugen) net zo vermoeiend is als het snijden van groenten (berekening). Hierdoor kan het een kleine chef die veel werk verricht vergelijken met een grote chef die weinig werk verricht op een gelijkwaardig niveau.

De Resultaten:
Het artikel testte dit systeem op wiskundige problemen (zoals de AIME-examens).

  • Betere Balans: UNISCALE vond het "optimale punt" voor elke vraag. Het koos niet simpelweg het grootste model of de meeste inspanning; het vond de perfecte mix.
  • Soepeler Curve: In plaats van te springen van "goedkoop maar slecht" naar "duur maar goed", creëerde UNISCALE een vloeiende curve waarbij je voor iets meer kosten iets betere antwoorden krijgt, helemaal tot aan de best mogende antwoorden.
  • Aanpassingsvermogen: Wanneer de "keuken" veranderde (bijv. een chef vertrok of het type bestellingen veranderde), begreep UNISCALE snel de nieuwe beste strategie, terwijl oudere systemen vastliepen of fouten maakten.

Samenvattend:
UNISCALE is als een meesterdirigent voor een orkest. In plaats van alleen een luider instrument te kiezen (groter model) of muzikanten te vragen sneller te spelen (meer inspanning), beslist het dynamisch welke muzikant welk deel speelt en hoe ze dat spelen, terwijl het in realtime naar de muziek luistert om elke muzikant die een verkeerde noot speelt direct te stoppen. Dit resulteert in een prachtige uitvoering (hoge kwaliteit) tegen de laagste energiekosten (lage kosten).

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →