Learning Agent Routing From Early Experience
Dit artikel introduceert BoundaryRouter, een trainingsvrij raamwerk dat de afweging tussen latentie en prestaties optimaliseert door queries dynamisch te routeren naar ofwel lichtgewicht LLM-inferentie ofwel volledige agent-uitvoering, gebaseerd op vroege gedragservaring en door rubrieken geleide redenering, waarmee aanzienlijke verbeteringen in zowel snelheid als nauwkeurigheid ten opzichte van bestaande methoden worden bereikt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, snelle, maar soms overmoedige assistent (de LLM) hebt en een hooggekwalificeerde, grondige, maar trage en dure expertconsultant (de Agent).
- De Assistent kan eenvoudige vragen zoals "Wat is de hoofdstad van Frankrijk?" direct en gratis beantwoorden. Maar als je het vraagt om een complex natuurkundeprobleem op te lossen of een lange, meerstapscode te schrijven, kan het verkeerd raden of hallucineren.
- De Expert kan die moeilijke problemen perfect oplossen door gebruik te maken van tools, onderzoek te doen en stap voor stap na te denken. Maar dit kost veel tijd en veel geld.
Het Probleem:
Op dit moment, als je een mix van makkelijke en moeilijke vragen hebt, moet je raden welke je naar wie stuurt. Als je alles naar de Expert stuurt, verspil je tijd en geld aan makkelijke vragen. Als je alles naar de Assistent stuurt, krijg je verkeerde antwoorden op moeilijke vragen.
De Oplossing: "BoundaryRouter"
Het artikel introduceert een nieuw systeem genaamd BoundaryRouter. Denk hierbij aan een slim verkeersagent die staat op het kruispunt tussen de Assistent en de Expert. Zijn taak is om elke binnenkomende vraag te bekijken en te beslissen: "Is dit makkelijk genoeg voor de Assistent, of heeft het de Expert nodig?"
Het lastige deel is dat deze verkeersagent onmiddellijk aan de slag moet, zonder voorafgaande trainingsdata of een "spiekbriefje" met juiste antwoorden. Het is een "koude start".
Hoe Het Werkt (De Creatieve Analogie):
In plaats van te studeren voor een toets, gebruikt de verkeersagent een truc genaamd "Leren uit Vroege Ervaring".
De "Zaad"-Test: Voordat het systeem live gaat, laten de onderzoekers een kleine batch vragen door zowel de Assistent als de Expert lopen. Ze geven nog geen aandacht aan de juiste antwoorden; ze kijken gewoon hoe de twee zich gedragen.
- Voorbeeld: Ze merken op dat wanneer de vraag gaat over een specifiek type wiskunde, de Assistent binnen 2 seconden een kort, zelfverzekerd antwoord geeft, terwijl de Expert 300 seconden nodig heeft om een rekenmachine tevoorschijn te halen en het te controleren.
- Ze bewaren deze observaties in een klein "herinneringsboek".
De "Vergelijkbare"-Zoektocht: Wanneer een nieuwe vraag binnenkomt, bladeren de verkeersagent door zijn herinneringsboek. Hij vraagt zich af: "Lijkt deze nieuwe vraag op de eerdere die we hebben gezien?"
- Als hij een match vindt waarbij de Assistent snel was en de Expert traag, stuurt hij de nieuwe vraag naar de Assistent.
- Als hij een match vindt waarbij de Assistent verward of traag was, stuurt hij de vraag naar de Expert.
De "Regelboek"-Redenering: Om ervoor te zorgen dat de verkeersagent niet zomaar raadt, volgt hij een strikt Regelboek (genaamd "Rubric-Guided Reasoning"). Hij voelt niet zomaar dat de Expert nodig is; hij controleert specifieke criteria: "Duurde de vergelijkbare vorige vraag 10 keer langer voor de Expert? Leek het antwoord van de Assistent vaag?" Dit houdt de beslissing logisch en consistent.
De Resultaten:
De onderzoekers testten dit systeem op een nieuwe benchmark genaamd RouteBench (een verzameling lastige vragen).
- Snelheid: In vergelijking met het gebruik van de Expert voor alles, was dit systeem 60% sneller omdat het stopte met tijdverspilling aan makkelijke vragen.
- Nauwkeurigheid: In vergelijking met het gebruik van de Assistent voor alles, was het 28% nauwkeuriger omdat het de Assistent niet liet raden op moeilijke problemen.
- Vergelijking: Het werkte veel beter dan andere methoden die alleen simpele prompts of basiszoektools gebruikten.
In het Kort:
Dit artikel laat zien dat je geen enorme trainingsdataset nodig hebt om een slim systeem te bouwen dat weet wanneer het snel moet zijn en wanneer het grondig moet zijn. Door simpelweg te observeren hoe twee verschillende systemen zich gedragen op een paar steekproefvragen, kun je een "verkeersagent" leren om toekomstige vragen perfect te routeren, waardoor tijd en geld worden bespaard zonder kwaliteit in te leveren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.