← Nieuwste papers
🤖 machine learning

BAGEN: Are LLM Agents Budget-Aware?

Het artikel introduceert BAGEN, een framework dat budgetbewustzijn definieert als progressieve intervalschatting en demonstreert dat hoewel grensverleggende LLM-agenten consequent falen in het accuraat voorspellen of waarschuwen voor budgetoverschrijdingen, hun vermogen om actiegerichte vroege stops te maken aanzienlijk kan worden verbeterd door middel van supervised fine-tuning en reinforcement learning.

Oorspronkelijke auteurs: Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot op een lange, complexe missie stuurt, zoals een bezorger die een stad moet navigeren, pakketjes moet ophalen en bezorgen. Je geeft de robot een budget: misschien 1.000 "energiepunten" (tokens) of een specifiek bedrag aan echt geld.

Het grote probleem dat dit paper identificeert, is dat de slimme robots van nu (AI-agenten) er vreselijk slecht in zijn om te weten hoeveel van hun budget ze nog over hebben terwijl ze aan het werk zijn. Ze beseffen meestal pas dat ze door hun geld heen zijn nadat de klus al is verpest.

Hier is het verhaal van het paper, onderverdeeld met eenvoudige analogieën:

1. Het kernproblein: De "blinde" robot

Nu, als je een robot vraagt: "Wat gaat deze rit kosten?", raadt hij meestal één keer aan het begin een bedrag.

  • De fout: Het is alsof een wandelaar vooraf probeert te raden hoeveel mijlen hij nog moet lopen voordat hij überhaupt begint met lopen. Hij houdt geen rekening met het feit dat hij verdwaald kan raken, slecht weer kan krijgen of een verkeerde afslag kan nemen.
  • De realiteit: Het onderzoek toonde aan dat zelfs de slimste robots overoptimistisch zijn. Ze denken: "Ik kan dit zeker voltooien met het geld dat ik nog heb!" zelfs wanneer ze eigenlijk al bijna zonder benzine zitten. Ze blijven geld uitgeven aan taken die eigenlijk al onmogoka zijn geworden, puur om te blijven proberen.

2. Het nieuwe idee: De "budgetbewuste" agent (BAGEN)

De auteurs stellen een nieuw type robot voor dat handelt als een slimme projectmanager. In plaats van één keer te gokken, controleert deze robot zijn portemonnee bij elke stap die hij zet.

  • Progressieve intervalschatting: In plaats van te zeggen: "Ik heb precies 500 punten nodig", zegt de robot: "Ik heb waarschijnlijk tussen de 400 en 600 punten nodig, maar als ik het antwoord niet snel vind, moet ik misschien stoppen."
  • De "Onmogelijk"-knop: Als de robot beseft dat hij in een gat zit waar hij niet meer uit kan klimmen, zou hij op een grote rode knop moeten drukken met de tekst "ONMOGELIJK" en direct stoppen, in plaats van de laatste paar dollar te verspillen door nog dieper te graven.

3. Wat ze ontdekten (Het "rapportcijfer")

De onderzoekers testten vijf van de slimste AI-modellen ter wereld op vier verschillende soorten taken (zoals puzzels oplossen, het internet doorzoeken en een magazijn beheren). Dit is wat ze ontdekten:

  • Slim zijn \neq Budgetbewust zijn: Alleen omdat een robot geweldig is in het oplossen van de puzzel, betekent niet dat hij ook goed is in het tellen van zijn geld. Sterker nog, de correlatie was zwak. De beste puzzeloplosser was vaak de slechtste in het schatten van de kosten.
  • De "Optimisme-bias": Elke geteste robot was te hoopvol. Ze onderschatten consequent hoeveel geld ze nodig zouden hebben. Hoe minder goed de robot was in de taak, hoe optimistischer hij was over zijn budget.
  • Te laat om te redden: De robots beseften meestal pas dat ze gingen falen nadat ze al 80% van hun budget hadden uitgegeven. Tegen de tijd dat ze zeiden: "O nee, we kunnen dit niet afmaken," was het al te laat om de verliezen te beperken.
  • Het kan geleerd worden: Het goede nieuws is dat deze vaardigheid getraind kan worden. Door de robots te trainen (met behulp van een methode genaamd SFT + RL), leerden ze eerder te stoppen.
    • Het resultaat: Als je de robot vertelt om te stoppen zodra hij "Onmogelijk" zegt, kun je 28% tot 64% van het verspilde geld aan mislukte pogingen besparen, met slechts een minimale daling in het aantal succesvol afgeronde taken.

4. De twee soorten "budgetten"

Het paper keek naar twee soorten uitgaven:

  1. Intern budget (De brandstof van het brein): Dit is de rekenkracht en de "tokens" die de AI gebruikt om simpelweg na te denken en te communiceren.
  2. Extern budget (De werkelijke kosten in de echte wereld): Dit is echt geld, tijd of fysieke middelen (zoals magazijnruimte) die de AI uitgeeft wanneer hij actie onderneemt.
    De robots worstelden met beide, maar het probleem van de "overoptimisme" was voor beide hetzelfde.

5. De conclusie

Het paper concludeert dat budgetbewustzijn een aparte vaardigheid is van intelligentie. Momenteel zijn AI-agenten als chauffeurs die blijven doorrijden naar een bestemming, zelfs nadat hun benzinetank leeg is, in de hoop dat ze magisch een benzinestation tegenkomen.

De oplossing is niet noodzakelijkerwijs om de AI "slimmer" te maken in de taak, maar om hem te trainen om een betere boekhouder voor zichzelf te zijn. Als we deze agenten leren om eerder te zeggen "Ik kan dit niet", kunnen we een enorme hoeveelheid middelen besparen zonder veel in te leveren op het aantal succesvolle taken.

Kortom: We moeten AI-agenten niet alleen vragen om "de klus te klaren", maar ze ook leren om tijdens het werk een oogje in het zeil te houden bij hun portemonnee.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →