← Nieuwste papers
🤖 machine learning

Adaptive Auto-Harness: Sustained Self-Improvement for Agentic System Deployment on Open-Ended Task Streams

Het artikel introduceert Adaptive Auto-Harness, een framework en systeem ontworpen om duurzame zelfverbetering voor LLM-agenten in open-ended taakstromen mogelijk te maken door prestatiekloof te deconstrueren in evolutie- en adaptatieverliezen, gebruikmakend van een stateful multi-agent evolver, een harness-boom met solve-time routing, en human-steering hooks om bestaande baselines te overtreffen op dynamische, heterogene taken.

Oorspronkelijke auteurs: Zewen Liu, Zhan Shi, Yisi Sang, Bing He, Minhua Lin, Tianxin Wei, Dakuo Wang, Benoit Dumoulin, Wei Jin, Hanqing Lu

Gepubliceerd 2026-06-02
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zewen Liu, Zhan Shi, Yisi Sang, Bing He, Minhua Lin, Tianxin Wei, Dakuo Wang, Benoit Dumoulin, Wei Jin, Hanqing Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Visie: De "Altijd-Aan"-Robot

Stel je voor dat je een zeer slimme robotassistent (een AI-agent) hebt die je wilt gebruiken voor een baan die nooit eindigt. In plaats van het een vaste lijst met regels te geven en het daarna te laten gaan, wil je dat de robot elke dag leert en beter wordt naarmate er nieuwe, vreemde en verschillende taken binnenkomen.

Het probleem is dat de meeste huidige AI-systemen lijken op studenten die alleen studeren voor één specifieke toets. Ze worden heel goed in dat ene examen, maar als je ze de volgende dag een ander vak geeft, vergeten ze alles of raken ze in de war. Als je probeert om steeds nieuwe regels aan hun brein toe te voegen om elke mogieve toekomstige taak te dekken, raakt hun brein te vol, worden ze traag en beginnen ze fouten te maken bij de oude taken waar ze voorheen goed in waren.

Dit paper introduceert een nieuw systeem genaamd Adaptive Auto-Harness. Zie dit als een slimme werkplaatsmanager die een gereedschapskist voor de robot bouwt en organiseert, zodat de robot altijd het juiste gereedschap heeft voor de huidige klus, zonder overweldigd te raken door gereedschap dat hij niet nodig heeft.


De Drie Grote Problemen (De "Waarom")

De auteurs stellen dat echte AI-taken drie lastige kenmerken hebben die oude systemen niet kunnen aanpaken:

  1. De Nooit-Eindigende Stroom (Unbounded): De baan stopt niet. Er komen eeuwig nieuwe taken binnen. Oude systemen proberen alles wat ooit is gebeurd te onthouden, wat uiteindelijk hun geheugen vult en hen traag maakt.

    • Analogie: Stel je een chef-kok voor die probeert elk recept dat hij de afgelopen 10 jaar heeft gekookt te onthouden. Uiteindelijk kan hij het nieuwe gerecht dat hij nú moet maken niet meer onthouden omdat zijn brein vol zit met oude recepten.
  2. De Mix van Verschillende Klussen (Heterogeneity): De taken liggen verspreid. De ene minuut doet de robot wiskunde, de volgende minuut schrijft hij een gedicht, en de volgende minuut hackt hij een beveiligingssysteem.

    • Analogie: Stel je een Zwitsers zakmes voor dat tegelijkertijd een schroevendraaier, een kurkentrekker en een zaag probeert te zijn, permanent aan je hand bevestigd. Het is zwaar en onhandig. Je kunt beter een lade met specifieke gereedschappen hebben en het juiste gereedschap kiezen voor de klus.
  3. Het Veranderende Doelwit (Non-Stationarity): De regels van het spel veranderen in de loop van de tijd. Wat vorige maand werkte, kan vandaag nutteloos zijn.

    • Analogie: Stel je voor dat je een videogame speelt waarbij de kaart elke dag verandert. Als je het pad naar de schat van Dag 1 uit je hoofd leert, raak je op Dag 10 de weg kwijt.

De Oplossing: De "Adaptive Auto-Harness"

De auteurs hebben een systeem gebouwd dat deze problemen oplost met drie belangrijke trucs.

1. Het "Team van Experts" (Multi-Agent Evolution)

In plaats van één AI die probeert zichzelf te verbeteren (wat moeilijk en traag is), gebruiken ze een team van gespecialiseerde AI-agents die samenwerken in een cyclus.

  • De Analist: Kijkt naar waar de robot faalde en zegt: "Hé, we hebben een betere manier nodig om dit te doen."
  • De Onderzoekers: Gaan op zoek naar nieuwe ideeën of tools om het probleem op te lossen.
  • De Bouwers: Schrijven daadwerkelijk de code of updaten de instructies.
  • De Verifieerders: Testen de nieuwe instructies om te controlage of ze werken voordat ze de robot laten gebruiken.
  • Analogie: In plaats van één persoon die alleen een huis probeert te bouwen, heb je een architect, een bouwploeg en een inspecteur. Ze werken in ploegendiensten, zodat het huis beter en sneller wordt gebouwd zonder dat iemand moe of in de war raakt.

2. Het "Slimme Vertakkingssysteem" (Solve-Time Routing)

Dit is het belangrijkste onderdeel. Het systeem houdt geen gigantische, rommelige instructiehandleiding bij. In plaats daarvan bouwt het een Boom van Gespecialiseerde Werkruimtes.

  • Stel je een bibliotheek voor. In plaats van één groot boek met alle onderwerpen door elkaar, heb je verschillende secties: "Sport", "Politiek", "Financiën".
  • Wanneer een nieuwe taak binnenkomt, kijkt een Router Agent naar de taak en zegt: "Dit is een sportvraag. Laten we naar de Sport-tak gaan."
  • De robot "leent" dan die specifieke tak, gebruikt de tools en regels die speciaal voor sport zijn gemaakt, en negeert de politieke regels.
  • Analogie: Het is als een ziekenhuis. Als je een gebroken been hebt, ga je naar de afdeling Orthopedie. Je gaat niet naar de afdeling Cardiologie om handleidingen over hartchirurgie te lezen. Het systeem houdt de "afdelingen" gescheiden zodat ze niet besmet raken met verkeerd advies.

3. Het "Menselijk Veiligheidsnet" (Human-in-the-Loop)

Soms loopt de robot tegen een probleem aan dat hij nog nooit heeft gezien, zoals het nodig hebben van een wachtwoord of een specifieke website die hij niet kent. Het systeem kan dit niet uit het niets verzinnen.

  • In deze zeldzame gevallen heeft het systeem een "paniekknop" waarmee het een mens om een snelle hint vraagt.
  • Analogie: Als een robot probeert een vergrendelde deur te openen en hij de sleutel niet heeft, blijft hij niet eeuwig tegen de deur aan beuken. Hij vraagt aan een mens: "Heb jij de sleutel?" Zodra de mens de sleutel geeft, leert de robot om de volgende keer naar sleutels te zoeken.

Wat Hebben Ze Ontdekt? (De Resultaten)

Het team heeft dit systeem getest op drie zeer verschillende, langlopende stromen van taken:

  1. Voorspellingsmarkten (Prediction Markets): Het raden van de uitkomst van sport- en politieke gebeurtenissen.
  2. Beveiligingsuitdagingen (Security Challenges): Het oplossen van computerhacking-puzzels (CTF).
  3. Evenementenvoorspelling (Event Forecasting): Het voorspellen van toekomstige nieuwsgebeurtenissen.

De Resultaten:

  • Oude Systemen: Ze werden in het begin goed, maar daarna daalde hun prestatie. Ze raakten "verstopt" en in de war.
  • Adaptive Auto-Harness: Het bleef over de tijd heen verbeteren. Door de "Team van Experts" te gebruiken om betere tools te bouwen en de "Slimme Vertakking" om de juiste tools te kiezen, loste het veel meer problemen op dan de oude systemen.
  • De "Menselijke" Factor: Wanneer het systeem vastliep omdat het een specifere stuk informatie miste (zoals een website-link), hielp een snelle menselijke duw het systeem te herstellen en te leren, wat bewees dat een beetje menselijke hulp soms beter is dan wachten tot de AI het alleen uitzoekt.

De Kernboodschap

Dit paper betoogt dat om AI echt nuttig te maken in de echte wereld, we niet simpelweg een statische set regels kunnen geven. We hebben een systeem nodig dat:

  1. Nieuwe vaardigheden bouwt over de tijd heen met behulp van een team van AI-werkers.
  2. Die vaardigheden organiseert in aparte "kamers" zodat de AI niet in de war raakt.
  3. Direct tussen die kamers schakelt afhankelijk van de taak.

Dit stelt de AI in staat om voor altijd te blijven verbeteren zonder "hersenmist" te krijgen door te proberen alles tegelijk te onthouden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →