Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents
Dit paper introduceert 'Select-then-Solve', een methode waarbij een lichtgewicht router per taak het meest geschikte redeneringsparadigma kiest voor LLM-agenten, wat de gemiddelde nauwkeurigheid significant verbetert ten opzichte van het gebruik van één vast paradigma of zelf-routing.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot hebt die je helpt met alledaagse taken, zoals het oplossen van wiskundeproblemen, het schrijven van code, of het zoeken van informatie op internet. Je noemt deze robot een LLM-agent (een taalmodel-agent).
De vraag die de auteurs van dit onderzoek stellen, is als volgt: Als je robot een taak beter uitvoert, komt dat dan omdat hij slimmer is geworden, of omdat je hem een betere "werkmethodiek" hebt gegeven?
Stel je voor dat je een kok bent. Je hebt dezelfde kok (het model), maar je kunt hem op verschillende manieren aansturen:
- Direct: "Maak een lasagne." (Hij doet het gewoon, zonder na te denken).
- Stap-voor-stap (CoT): "Denk eerst na over de ingrediënten, schrijf ze op, en maak dan de lasagne."
- Zoek-en-Acteer (ReAct): "Zoek eerst online naar het beste recept, probeer het, en pas het aan als het niet lukt."
- Plan-en-Uitvoer: "Schrijf eerst een gedetailleerd stappenplan, en voer dat daarna uit."
- Reflecteren: "Maak de lasagne, proef het, bekritiseer je eigen werk, en maak het opnieuw als het te zout is."
- Code-gebaseerd: "Schrijf een computerprogramma dat de lasagne berekent en bereidt."
Het Grote Ontdekking: "Eén methode past niet bij alles"
De onderzoekers hebben deze zes methoden getest op vier verschillende robots (van heel slim tot iets minder slim) en tien verschillende soorten taken. Wat ze ontdekten, was verrassend:
- Soms helpt een strakke methode enorm: Als de robot iets moet doen waarvoor hij internet nodig heeft (zoals een actueel nieuwsfeit vinden), werkt de "Zoek-en-Acteer"-methode fantastisch. Hij scoort dan 44% beter dan als je hem gewoon laat doen.
- Soms helpt een strakke methode juist niet: Als de robot code moet schrijven, kan het "Stap-voor-stap" denken juist verwarrend zijn. Het maakt de code slechter. Hier werkt "Direct" (gewoon doen) het beste.
- De beste methode verschilt per taak: Net zoals je niet dezelfde kleding draagt om te zwemmen als om te skiën, heeft elke taak zijn eigen perfecte werkwijze. Er is geen "super-methode" die voor alles werkt.
Het Probleem: De "Orakel" vs. De Realiteit
Stel je voor dat je een magische orakel hebt die voor elke taak precies weet welke methode het beste werkt. Als je die orakel zou gebruiken, zou je robot veel beter presteren dan met een vaste methode. Maar in het echt hebben we geen orakel. We moeten zelf kiezen welke methode we gebruiken.
Tot nu toe kiezen mensen vaak één methode voor alles (bijvoorbeeld: "We gebruiken altijd 'Zoek-en-Acteer'"). Dat werkt goed voor sommige taken, maar slecht voor anderen.
De Oplossing: "Kies Eerst, Werk Dan" (Select-then-Solve)
De auteurs hebben een slimme oplossing bedacht: een Router.
Stel je voor dat je een slimme secretaresse hebt die elke opdracht die binnenkomt, eerst even bekijkt.
- Is het een vraag over het weer? Dan zegt ze: "Gebruik de 'Zoek-en-Acteer'-methode."
- Is het een simpele rekenopdracht? Dan zegt ze: "Gebruik de 'Directe'-methode, denk niet te veel na."
- Is het een lastig programmeerprobleem? Dan zegt ze: "Gebruik de 'Code'-methode."
Deze secretaresse (de router) is heel lichtgewicht en snel. Ze kijkt naar de opdracht, kiest de beste werkwijze, en stuurt de opdracht dan naar de robot.
Het resultaat?
Door deze slimme secretaresse te gebruiken, presteert de robot gemiddeld veel beter dan wanneer je maar één vaste methode gebruikt. Het is alsof je de robot 2,8% slimmer maakt, alleen door de juiste "kleding" aan te trekken voor de juiste gelegenheid.
Waarom werkt het niet als de robot zelf kiest?
De onderzoekers probeerden ook om de robot zelf te laten beslissen welke methode hij gebruikt (zodat hij zegt: "Ik denk dat ik nu moet zoeken").
- De allerbeste robot (GPT-5) kon dit redelijk goed.
- Maar de iets minder sterke robots werden hierdoor juist slechter. Ze kozen vaak de verkeerde methode, alsof ze in paniek raakten en alles wilden proberen.
Dit betekent dat het kies van de juiste methode een heel speciale vaardigheid is, iets anders dan het oplossen van de taak zelf. Je hebt daarvoor een aparte, slimme "manager" (de router) nodig.
Samenvatting in één zin
In plaats van één vaste manier te gebruiken om alles op te lossen, is het slimmer om voor elke specifieke opdracht eerst even te kijken wat de beste aanpak is, en die dan te kiezen. Dit maakt je AI-agent niet alleen slimmer, maar ook efficiënter en goedkoper.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.