← Nieuwste papers
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

Deze survey stelt een model-harness-framework voor voor op LLM gebaseerde agenten dat de focus verschuift van passieve vraagbeantwoording naar actieve taakvoltooiing door te analyseren hoe de koppeling tussen fundamentele modellen en executieruntimes — bestaande uit zes kernverantwoordelijkheden — de systeemprestaties, betrouwbaarheid en generalisatie bepaalt.

Oorspronkelijke auteurs: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yu
Gepubliceerd 2026-06-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het Gaat Niet Alleen Om het Brein

Stel je voor dat je een briljante, wereldberoemde chef-kok (het AI-model) inhuurt om een complex, meergangenmenu te bereiden voor een dinerfeest. In het verleden dachten mensen dat alleen de intelligentie van de chef telde. Als de chef elk recept kende, zou de maaltijd perfect zijn.

Maar dit artikel stelt dat de chef slechts de helft van het verhaal is.

Als je die chef een kapend fornuis geeft, geen ingrediënten, een verwarrend menu en niemand die hem vertelt wanneer de soep aanbrandt, zal de maaltijd mislukken — zelfs als de chef een genie is. Het "fornuis", de "ingrediënten" en de "keukenchef" zijn wat de auteurs de Harness (het harnas/de infrastructuur) noemen.

De hoofdboodschap van het artikel is: De prestaties van een AI-agent hangen niet alleen af van hoe slim de AI is; ze hangen af van hoe goed de AI wordt gekoppeld aan de "keuken" (de Harness) waarin hij werkt.


De Vier Fasen van Volwassen Worden

De auteurs beschrijven hoe we deze AI-"agenten" hebben opgebouwd in vier duidelijke fasen, zoals een kind dat opgroeit:

  1. Fase 1: De Prompt Engineer (De "Alsjeblieft Wees Lief"-fase)

    • De Analogie: Je probeert een slimme maar verlegen student een vraag te laten beantwoorden. Je probeert verschillende manieren van vragen: "Leg dit alsjeblieft uit," "Hier is een voorbeeld," of "Denk stap voor stap."
    • De Limiet: Je kunt niet eindeloos vriendelijk vragen. Als de student het antwoord niet weet, of als de vraag vereist dat hij naar de bibliotheek gaat, een boek opent en een verslag schrijft, helpt het niet om alleen maar aardig te vragen.
  2. Fase 2: De Context Engineer (De "Bibliotheekassistent"-fase)

    • De Analogie: Nu besef je dat de student hulp nodig heeft bij het vinden van de juiste boeken. Je bouwt een systeem dat de juiste pagina's ophaalt, ze samenvat en aan de student overhandigt voordat hij antwoord geeft.
    • De Limiet: Je bent nog steeds alleen maar informatie aan het overhandigen. Als de student begint met het schrijven van de verkeerde dingen, of afgeleid raakt, heb je geen systeem om hem te stoppen, zijn werk te controleren of zijn fouten te herstellen.
  3. Fase 3: De Harness Engineer (De "Projectmanager"-fase)

    • De Analogie: Dit is de grote verschuiving. Je geeft niet alleen instructies, maar je begint een volledig besturingssysteem rondom de student te bouwen.
      • Observatie: Je geeft hem een camera zodat hij kan zien wat er gebeurt.
      • Controle: Je hebt een timer en een stopknop.
      • Actie: Je geeft hem een toetsenbord en een muis.
      • Verificatie: Je hebt een leraar die elke stap controleert. Als de student code schrijft die breekt, draait het systeem dit automatisch terug en zegt: "Probeer het opnieuw."
    • Het Resultaat: Het artikel laat zien dat je door alleen de "keuken" (de Harness) te herontwerpen, een middelmatige chef een 5-sterrenmaaltijd kan laten koken, of een genie-chef nog beter kan laten koken.
  4. Fase 4: De Co-Evolutie Fase (De "Zelfverbeterende Team"-fase)

    • De Analogie: Nu leren de student en de keukenchef van elkaar. De student wordt beter in koken door te oefenen in deze specifieke keuken, en de keukenchef wordt beter in het managen door te kijken naar hoe de student kookt. Ze evolueren samen.

De Zes Onderdelen van de "Keuken" (De Anatomie van de Harness)

Het artikel verdeelt deze "Harness" in zes specifieke taken, als een goed georganiseerde keukenploeg:

  1. Observatie (De Ogen): Hoe ziet de AI de wereld? Kijkt hij naar een wazig screenshot of naar een heldere, georganiseerde lijst met gegevens?
  2. Context (Het Geheugen): Welke informatie onthoudt de AI? Voeren we de hele geschiedenis van het gesprek aan hem, of alleen de belangrijkste aantekeningen?
  3. Controle (De Dirigent): Wie bepaalt wat er nu gebeurt? Gaat de AI gewoon door tot hij moe is, of vertelt een manager hem wanneer hij moet stoppen, wanneer hij om hulp moet vragen of wanneer hij van taak moet wisselen?
  4. Actie (De Handen): Hoe voert de AI dingen daadwerkelijk uit? Kan hij op een knop klikken, of zegt hij alleen "Ik heb erop geklikt"? De harness zet de woorden van de AI om in echte acties.
  5. Status (De Archiefkast): Waar slaat de AI zijn werk op? Als hij een concept schrijft, wordt het dan in een bestand opgeslagen, of gaat het verloren wanneer het scherm ververst?
  6. Verificatie (De Veiligheidsinspecteur): Dit is cruciaal. Voordat de AI een bestand naar een klant stuurt, wordt er een veiligheidscontrole uitgevoerd? Als de AI een gevaarlijke beweging maakt, stopt het systeem hem dan?

Waarom Dit Belangrijk Is: De Verschuiving van de "Bottleneck"

Het artikel heeft veel tests (benchmarks) bekeken waarbij AI echte taken probeert uit te voeren, zoals het repareren van computercode of het browsen op het web.

  • De Oude Visie: We dachten dat als we de AI-hersenen maar groter en slimmer maakten, het alles zou oplossen.
  • De Nieuwe Visie: Het artikel vond dat het "brein" een limiet heeft bereikt. Het groter maken van het brein levert slechts minimale verbeteringen op. De echte bottleneck is nu de Harness.

Het Bewijs:

  • In coderingstests behaalde hetzelfde AI-model een succespercentage van 23% met een eenvoudige harness, maar een succespercentage van 72% met een beter ontworpen harness.
  • Het is alsoals een Ferrari-motor (de AI) hebben, maar deze in een fietsframe (een slechte harness) plaatsen. Hij zal niet snel gaan. Plaats diezelfde motor in een racewagen-chassis (een goede harness) en hij wint.

De Kernboodschap

We bewegen weg van het idee dat AI slechts een "chatbot" is die vragen beantwoordt. We bouwen autonome werkers.

Om een betrouwbare werker te bouwen, kun je niet alleen het slimste brein kiezen. Je moet de gehele omgeving ontwerpen waarin zij werken:

  • Wat zien ze?
  • Welke hulpmiddelen hebben ze?
  • Wie controleert hun werk?
  • Hoe herstellen ze zich wanneer ze een fout maken?

Het artikel concludeert dat de toekomst van AI niet alleen grotere modellen zijn, maar betere engineering van de systemen die rondom die modellen staan. De kwaliteit van de agent komt voort uit de samenwerking tussen het model en zijn harness.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →