Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility
Dit artikel introduceert **CostAda**, een kostengekalibreerde adaptieve controller die LLM-ontdekking optimaliseert door zoekresources dynamisch toe te wijzen op basis van de ratio tussen kwaliteitswinst en tokencosten, waardoor superieure of gelijkwaardige resultaten worden bereikt met aanzienlijk lagere budgetten vergeleken met bestaande methoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een team van briljante detectives voor die proberen een reeks ongelooflijk complexe puzzels op te lossen. Ze hebben een beperkte voorraad "denk-tokens"—een magische valuta die betaalt voor elk woord dat ze schrijven, elke aanwijzing die ze zoeken en elke hypothese die ze testen. In de wereld van Kunstmatige Intelligentie zijn deze tokens de werkelijke kosten van het gebruiken van Large Language Models (LLMs) om nieuwe wetenschappelijke formules te ontdekken, betere algoritmen te ontwerpen of perfecte computercode te schrijven. Lange tijd gaven de "controllers" (de managers van deze detective-teams) slechts om één ding: ging de score omhoog? Als een detective een kleine aanwijzing oploste of een enorm mysterie, en beide gaven dezelfde scoreverhoging, behandelde de manager ze precies hetzelfde. Maar hier zit de crux: het oplossen van de kleine aanwijzing kostte één token, terwijl het oplossen van het enorme mysterie zes kostte. Als de manager dure zetten bleef betalen alleen omdat de score steeg, zou het team lang voordat het de beste oplossing vindt, zonder geld komen te zitten. De grote vraag voor wetenschappers is: hoe beheer je een team wanneer elke zet een andere hoeveelheid kost, en je een strikt budget hebt om binnen te blijven?
Dit artikel introduceert een nieuwe, slimmere manager genaamd CostAda. De onderzoekers ontdekten dat de oude manier van managen—het negeren van hoeveel een zet daadwerkelijk kostte—een recept voor ramp was. Ze bewezen wiskundig dat als je de kredietwaardigheid niet aanpast op basis van het prijskaartje, je bijna nul vooruitgang kunt boeken naarmate de zoektocht ingewikkelder wordt. CostAda verandert het spel door te kijken naar de "bang for the buck" (waar je het meeste voor krijgt). Het vraagt: "Is deze scoreverbetering de tokens die we zojuist hebben uitgegeven waard?" Als een zet duur is, eist CostAda een grotere beloning voordat het de volgende stap goedkeurt. Het houdt ook nauwlettend in de gaten hoeveel budget er nog over is. In het begin van het spel, wanneer er veel geld is, is het oké om een paar dure risico's te nemen om een nieuw pad te vinden. Maar naarmate het budget opraakt, wordt de manager streng en keurt alleen bewegingen goed die goedkoop en bewezen effectief zijn, of bewaart de laatste paar tokens voor een grote, allesbeslissende gids.
Het team heeft deze nieuwe manager getest op twaalf verschillende puzzelsets (benchmarks) met behulp van twee verschillende AI-hersenen (GLM-5 en GPT-5.4). De resultaten waren indrukwekkend. In twaalf van de zestien testgevallen slaagde CostAda erin om oplossingen te vinden die net zo goed waren als de beste voorgaande methoden, maar deed het dit met maximaal de helft van het budget. Met andere woorden: het behaalde dezelfde hoogwaardige resultaten voor 50% van de prijs. Over alle acht de grote uitdagingen heen behaalde CostAda consistent de hoogste gemiddelde eindkwaliteit. De onderzoekers toonden aan dat door de kosten van elke actie te behandelen als een cruciaal onderdeel van het besluitvormingsproces—in plaats van alleen een bonnetje om later naar te kijken—de AI efficiënter kan verkennen, doodlopende wegen kan vermijden en sneller en slimmer de finishlijn kan bereiken. Het is alsoal beseffen dat het soms een verspilling van benzine is om de dure snelweg te nemen, maar weten wanneer je er precies voor moet betalen om er als eerste te zijn, is de sleutel tot het winnen van de race.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.