← Nieuwste papers
🤖 machine learning

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS introduceert een agentisch test-time scaling framework waarbij een LLM-orchestrator het gehele redeneerproces dynamisch aanstuurt—inclusief wanneer te verkennen, welke solver te gebruiken en hoe antwoorden te synthetiseren—waarbij het vaste workflow-baselines overtreft over diverse benchmarks terwijl de API-call kosten aanzienlijk worden verminderd.

Oorspronkelijke auteurs: Peijia Qin, Qi Cao, Pengtao Xie

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Peijia Qin, Qi Cao, Pengtao Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Wie Moet de Baas Zijn?

Stel je voor dat je probeert een heel moeilijk raadsel op te lossen. Je hebt een team van slimme assistenten (AI-modellen) die het voor je kunnen proberen op te lossen.

De Oude Manier (Designer-Engineered):
In het verleden moest een menselijke manager (de "designer") de regels bepalen voordat het team begon. De manager zou zeggen: "Oké iedereen, probeer het precies 5 keer. Dan kiezen we het antwoord dat het vaakst voorkomt." Of: "Probeer het tot je een score van 90 haalt, en stop dan."
Het probleem is dat de menselijke manager niet weet of het raadsel makkelijk of moeilijk is.

  • Als het raadsel makkelijk is, is vragen om 5 pogingen een verspilling van geld en tijd.
  • Als het raadsel onmogelijk is, is vragen om 5 pogingen ook een verspilling, maar nu heb je nog meer geld uitgegeven.
    De AI-assistenten volgden alleen maar bevelen; ze konden niet zelf beslissen wanneer ze moesten stoppen of hoe ze moesten werken.

De Nieuwe Manier (ATLAS):
De auteurs van dit artikel introduceerden ATLAS. In plaats van een menselijke manager die rigide regels instelt, zetten ze één AI-assistent aan het hoofd van het hele team. Deze "Orchestrator" is de baas.

  • De Orchestrator bekijkt het probleem.
  • Hij vraagt een helper om het probleem op te lossen.
  • Hij bekijkt het antwoord van de helper.
  • Cruciaal: De Orchestrator beslist: "Is dit goed genoeg? Moet ik nog een andere helper vragen? Moet ik een ander type helper vragen? Of moet ik nu stoppen en het definitieve antwoord geven?"

De AI is niet langer alleen bezig met het oplossen van het probleem; de AI is middelen aan het beheren (tijd en geld) om het probleem op te lossen.


Hoe het Werkt: De "Explore"-knop

Zie de Orchestrator als een detective die een zaak leidt. Hij heeft één hulpmiddel genaamd Explore.

  1. De Detective (Orchestrator): Hij zit aan een bureau met een dossier (het probleem).
  2. De Actie (Explore): De detective drukt op een knop om een nieuwe, onafhankelijke detective naar buiten te sturen om onderzoek te doen.
    • Belangrijk: De nieuwe detective begint vanaf nul. Hij ziet niet wat de vorige detectives hebben gevonden. Dit zorgt ervoor dat iedereen een echt onafhankelijke mening geeft.
  3. Het Rapport (Observation): De nieuwe detective komt terug met een antwoord, hun redenering en hoe zelfverzekerd ze zich voelen.
  4. De Beslissing: De hoofddetective leest het rapport.
    • Scenario A: Het antwoord ziet er wankel uit. De detective drukt opnieuw op Explore om meer bewijs te verzamelen.
    • Scenario B: Drie detectives zijn het allemaal eens over hetzelfde antwoord met verschillende methoden. De detective zegt: "Geweldig, we hebben genoeg bewijs," en drukt op Stop.
    • Scenario C: De detectives blijven falen of geven onzin terug. De detective realiseert zich: "Deze zaak is onoplosbaar met onze huidige middelen," en stopt om geld te besparen.

De "Action Space": De Baas Meer Gereedschap Geven

Het artikel laat zien dat de Orchestrator beter presteert naarmate hij meer gereedschappen heeft. Ze hebben drie versies getest:

  1. ATLAS (De Basisbaas): De Orchestrator kan alleen "Explore" of "Stop" zeggen. Hij beslist wanneer hij stopt, maar gebruikt altijd hetzelfde type helper.
  2. ATLAS-MM (De Multi-Tool Baas): De Orchestrator kan ook kiezen welke helper hij stuurt.
    • Analogie: Als de eerste helper een junior stagiair is en faalt, kan de baas besluiten: "Oké, laten we in plaats daarvan de Senior Expert sturen." Of: "Laten we eerst drie goedkope stagiairs sturen, en als ze het oneens zijn, bellen we de dure expert."
  3. ATLAS-MI (De Gefocuste Baas): De Orchestrator kan de helper een specifieke hint geven.
    • Analogie: Als de eerste drie helpers allemaal dezelfde fout maken, kan de baas de volgende helper vertellen: "Negeer het eerste deel, focus specifiek op deze lastige stap."

De Resultaten: Slimmer Uitgeven

De onderzoekers hebben dit systeem getest op vier verschillende soorten moeilijke uitdagingen:

  • Wetenschappelijke vragen: (Zoals een examen op universitair niveau voor natuurkunde of scheikunde).
  • Coderen: (Het schrijven van computerprogramma's).
  • Visuele Redenering: (Kijken naar afbeeldingen en vragen over die afbeeldingen beantwoorden).

Wat gebeurde er?

  • Betere Nauwkeurigheid: ATLAS behaalde hogere scores dan de oude methoden met "vaste regels". Bijvoorbeeld, op de moeilijkste wetenschappelijke vragen steeg de score van ongeveer 83% naar 85,86%.
  • Goedkoper: Ondanks dat het betere scores behaalde, gaf het systeem eigenlijk minder geld uit (minder API-aanroepen) dan de andere methoden.
    • Waarom? Omdat de oude methoden geld verspillen aan makkelijke vragen (5 pogingen doen terwijl 1 genoeg was) en aan onmogelijke vragen (5 pogingen doen terwijl 0 zou werken). ATLAS stopte precies wanneer er genoeg bewijs was.

Het Geheim: "Stateful Evidence"

Het onderzoek vond dat de belangrijkste reden waarom ATLAS werkt, Stateful Evidence Management is.

  • De Oude Manier: Stel je een commissie voor waar iedereen stemt, maar de persoon die de stemmen telt, ziet alleen de uiteindelijke lijst met namen. Ze weten niet hoe de mensen stemden of wat ze dachten.
  • De ATLAS-Manier: De Orchestrator ziet het volledige verhaal. Hij ziet elke gedachte, elke poging en elke reden waarom een helper een bepaand antwoord gaf.
    • Als de Orchestrator ziet dat twee helpers het eens zijn over het antwoord maar de zelfde foute logica gebruikten, weet hij dat dit een valstrik is en blijft hij zoeken.
    • Als hij ziet dat één helper een vreemd antwoord heeft maar een briljante, unieke uitleg geeft, kan hij die minderheidsmening meer vertrouwen dan de meerderheid.

Samenvatting

ATLAS is een systeem waarbij een AI optreedt als een slimme manager. In plaats van een rigide script te volgen, houdt de AI zijn team in de gaten, verzamelt bewijs en besluit precies wanneer hij stopt met werken om geld te besparen en wanneer hij doorgaat om het juiste antwoord te krijgen. Het verandert "opschalen" (het gebruik van meer rekenkracht) van een botte hamer in een precisiescalpel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →