← Nieuwste papers
💬 NLP

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge is een meta-adaptief framework dat zowel de externe executie-harness als het interne redeneerbeleid van LLM-agenten gezamenlijk evolueert door middel van foutgeleide afstemming en harness-geconditioneerde alignment, waarbij het geïsoleerde adaptatiemethoden significant overtreft door hun uitvoerbare compatibiliteit over diverse taakregimes heen te optimaliseren.

Oorspronkelijke auteurs: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleel: De "Starre Robot"

Stel je voor dat je een briljante maar onervaren robotassistent (een LLM Agent) inhuurt om verschillende klussen te doen.

  • Klussen A: Je wilt dat hij een vlucht boekt. Hij heeft een strikte checklist en een kalender nodig.
  • Klussen B: Je wilt dat hij een mysterieverhaal schrijft. Hij heeft een creatieve flow en een geheugen van plotpunten nodig.
  • Klussen C: Je wilt dat hij een lekkende leiding repareert in een simulatie. Hij moet precies weten welke gereedschappen hij in welke volgorde moet pakken.

Het probleem is dat de meeste robotassistenten worden geleverd met een vast instructieboek (een Harness genoemd). Dit handboek vertelt de robot hoe hij moet denken en handelen.

  • Als het handboek te rigide is, faalt de robot bij creatieve taken.
  • Als het handboek te losjes is, raakt de robot in de war tijdens complexe, stapsgewijze taken.

Traditioneel probeerden onderzoekers dit op twee afzonderlijke manieren op te lossen:

  1. Het Handboek herschrijven: Houd de robot hetzelfde, maar probeer voor elke nieuwe klus een beter instructieboek te schrijven. (Dit gaat traag en mist vaak het doel).
  2. De Robot trainen: Houd het handboek hetzelfde, maar probeer de robot "slimmer" te maken door middel van vallen en opstaan. (Dit is duur en de robot kan nog steeds in de war raken door een slecht handboek).

HarnessForge zegt: "Waarom zou je kiezen? Laten we beide samen laten evolueren."


De Oplossing: Een "Tandemdans"

De auteurs stellen een systeem voor genaamd HarnessForge. Zie het Agent-systeem als een Danspaar:

  • De Harness (De Choreograaf): Dit is de externe structuur. Deze bepaalt de passen, de muziek, de regels en de hulpmiddelen die de danser kan gebruiken.
  • De Policy (De Danser): Dit is het brein van de robot. Deze bepaalt hoe de voeten daadwerkelijk moeten bewegen om de choreografie te volgen.

In het verleden probeerden mensen de Choreograaf of de Danser apart te verbeteren. HarnessForge realiseert zich dat ze gekoppeld zijn. Een geweldige choreografie is nutteloos als de danser de passen niet kan uitvoeren. Een getalenteerde danser is nutteloos als de choreografie onlogisch is.

HarnessForge laat hen samen evolueren in een lus:

Stap 1: De "Foutdiagnose" (Het struikelen vinden)

Het systeem laat het danspaar een reeks taken uitvoeren. Wanneer ze struikelen (falen), kijkt een "Meta-Agent" (een superintelligente scheidsrechter) naar de beelden.

  • Struikelde de danser omdat hij moe was? (Policy-probleem)
  • Struikelde de danser omdat de choreograaf een stap gaf die fysiek onmogelijk was? (Harness-probleem)
  • Struikelden ze omdat de muziek op het verkeerde moment stopte? (Geheugen/Structuur-probleem)

Stap 2: Het Aanpassen van de Harness (De choreografie herschrijven)

Op basis van de diagnose herschrijft het systeem automatisch de Harness.

  • Als de robot het plan bleef vergeten, wordt de Harness bijgewerkt om een "post-it"-systeem toe te voegen (Geheugen).
  • Als de robot steeds het verkeerde gereedschap pakte, wordt de Harness bijgewerkt om een "veiligheidscontrole" toe te voegen die het gereedschap controleert voordat het wordt gebruikt.
  • Analogie: Het is als een coach die ziet dat een voetbalteam een wedstrijd verliest en onmiddellijk de formatie of het tactische plan aanpast om de specifieke zwakte te verhelpen.

Stap 3: Het Afstemmen van de Policy (De danser trainen)

Zodra de nieuwe Harness (choreografie) klaar is, gooit het systeem niet zomaar de oude robot ertegenaan. Het fijnt de robot specifiek af voor deze nieuwe set regels.

  • Het neemt de succesvolle pogingen uit de vorige ronde en leert de robot: "Hey, wanneer de Harness zegt 'Controleer het gereedschap', moet je deze specische beweging maken."
  • Analogie: Het is als een dansinstructeur die een specifieke routine aanleert aan een danser, zodat het spiergeheugen perfect aansluit bij de nieuwe passen.

Stap 4: "Survival of the Fittest"

Het systeem houdt de beste paren (Harness + Robot) bij en laat degenen die nog steeds falen vallen. Dit proces wordt gedurende meerdere rondes herhaald. Bij elke ronde wordt de choreografie slimmer en de danser beter in het volgen van die specifieke choreografie.


Waarom dit werkt (De Resultaten)

Het paper heeft dit getest op vijf verschillende "dansvloeren" (benchmarks) die onder andere gaan over:

  • Het gebruiken van tools om puzzels op te lossen.
  • Het zoeken op internet naar antwoorden.
  • Het aanroepen van API's (digitale tools) om filmgegevens op te halen.

De bevindingen:

  1. Beter samen: Systemen die zowel de Harness als de Policy samen evolueerden, presteerden aanzienlijk beter dan systemen die slechts één van beide veranderden.
  2. Efficiëntie: Het vereiste geen miljoenen extra pogingen (rollouts) om te werken. Omdat het systeem leert van de structuur van de fout, leert het sneller.
  3. Compatibiliteit is essentieel: De belangrijkste les is dat een "perfecte" robot niet in een vacuüm bestaat. Een robot is slechts zo goed als het systeem waarin hij opereert. Door de robot en zijn systeem samen te laten evolueren, worden ze perfect compatibel.

Samenvattende Analogie

Stel je voor dat je probeert de ultieme Zwitserse zakmes te bouwen.

  • De Oude Manier: Je probeert óf het handvat (Harness) perfect te maken, óf de kling (Policy) scherper te maken, maar je verandert nooit beide tegelijkertijd.
  • De HarnessForge Manier: Je beseft dat als je het handvat ergonomisch maakt voor een linkshandige timmerman, je ook de hoek van de kling moet aanpassen. Je bouwt een werkplaats waar het handvat en de kling samen worden gesmeed, getest en verfijnd in een lus, totdat ze perfect bij elkaar passen.

Het resultaat is een instrument dat perfect is aangepast aan de specifieke taak die het moet uitvoeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →