← Nieuwste papers
🤖 AI

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

Het artikel introduceert daVinci-Agency, een data-efficiënt framework dat authentieke Pull Request-sequenties gebruikt om hoogwaardige, langdurige trainingsdata voor Large Language Models te synthetiseren, wat significante prestatiewinsten mogelijk maakt in complexe agentische workflows zonder excessieve annotatiekosten.

Oorspronkelijke auteurs: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Korte Concentratieboog" van AI

Stel je voor dat je een briljante student hebt die geweldig is in het beantwoorden van enkelvoudige vragen, zoals "Wat is 2+2?" of "Schrijf een gedicht over een kat." Deze student is een Large Language Model (LLM).

Echter, als je deze student vraagt om een huis te bouwen, heeft hij moeite. Hij legt misschien de fundering, maar vergeet dan dat hij een dak nodig heeft, of hij bouwt een muur op de verkeerde plek en realiseert zich dat pas aan het einde. In de wereld van AI wordt dit een long-horizon task genoemd. Het is een taak die veel stappen vereist, waarbij fouten die vroeg in het proces worden gemaakt, het hele project later kunnen verpesten.

Het paper stelt dat huidige AI-modellen falen bij deze lange klussen omdat ze niet zijn getraind op data die hen laat zien hoe ze vooruit moeten plannen, consistent moeten blijven en hun eigen fouten moeten herstellen over een langere periode.

De Oplossing: Leren van "Software Evolutie"

De auteurs (van SII, SJLU en GAIR) realiseerden zich dat de beste manier om een AI te leren hoe hij complexe, langdurige projecten moet afhandelen, is door te kijken naar hoe echte mensen software bouwen.

De Analogie: De "Pull Request" Keten
In de softwareontwikkeling, wanneer een programmeur een functie wil toevoegen of een bug wil oplossen, dumpen ze niet zoma van de voltooide code. Ze dienen een "Pull Request" (PR) in.

  1. Stap 1: Ze dienen een kleine wijziging in (PR #15).
  2. Stap 2: Reviewers zeggen: "Dit ziet er goed uit, maar je bent een veiligheidsnet vergeten."
  3. Stap 3: De programmeur herstelt dit en dient een nieuwe wijziging in (PR #21) die voortbouwt op de eerste.
  4. Stap 4: Dit gaat door voor meerdere rondes totdat de functie perfect is.

De auteurs noemen dit een "Chain of Pull Requests" (een keten van pull requests). Het is als een verhaal waarbij elk hoofdstuk afhankelijk is van het vorige, en de personages (de code) evolueren en verbeteren in de loop van de tijd.

De Innovatie: daVinci-Agency

Het team creëerde een nieuw systeem genaamd daVinci-Agency. In plaats van nepscenario's te verzinnen of mensen te betalen om lange verhalen voor de AI te schrijven (wat duur en traag is), gingen ze naar GitHub (een gigantische bibliotheek van echte softwareprojecten) en oogstten ze deze natuurlijke "Chains of Pull Requests".

Ze transformeerden deze echte verhalen over softwareontwikkeling naar trainingsdata.

  • De Training: Ze namen een model (GLM-4.6) en lieten de AI deze ketens zien.
  • De Les: De AI leerde dat om succesvol te zijn, hij moet:
    • Decomponeren: Een groot doel opdelen in kleine, beheersbare stappen.
    • Consistent blijven: De oorspronkelijke doelstelling onthouden, zelfs na 50 stappen.
    • Verfijnen: Zijn eigen fouten (bugs) opmerken en deze oplossen zonder helemaal opnieuw te beginnen.

Het "Magische" Resultaat: Kleine Data, Grote Winst

Normaal gesproken heb je miljoenen voorbeelden nodig om een AI slimmer te maken.

  • De Oude Manier: Trainen op 66.000 voorbeelden (zoals andere datasets in het paper).
  • De daVinci-Manier: Trainen op slechts 239 voorbeelden.

Het Resultaat:
Ondanks het gebruik van 200 keer minder data, presteerde het model dat getraind is op daVinci-Agency significant beter dan modellen die getraind zijn op enorme datasets.

  • Op een test genaamd Toolathlon (waarbij de AI tools moet gebruiken om problemen op te lossen), verbeterde de AI met 47%.
  • Op SWE-bench (een test voor het oplossen van echte softwarebugs), scoorde het ook veel hoger.

Waarom? Omdat de 239 voorbeelden van hoge kwaliteit waren. Ze waren niet willekeurig; het waren echte verhalen over hoe complexe problemen in de loop van de tijd worden opgelost. De AI heeft niet alleen feiten geleerd te memoriseren; hij heeft de gewoonte van doorzettingsvermogen en correctie geleerd.

Wat de AI Eigenlijk Heeft Geleerd (De "Meta-vaardigheden")

Het paper laat zien dat de AI niet alleen beter werd in coderen; hij werd beter in denken.

  • Voorheen: Als de AI een fout maakte, raakte hij in de war, dwaalde af naar irrelevante onderwerpen of gaf hij het op (genoemd als "escapism").
  • Nadat: Wanneer de AI een fout maakte, pauzeerde hij, besefte: "Wacht, ik doe dit verkeerd," en herstelde hij het. Hij leerde te plannen en op koers te blijven.

Efficiëntie: Meer Doen met Minder

Het paper vond ook dat de nieuwe AI efficiënter is.

  • Analogie: Stel je twee mensen voor die een doolhof proberen op te lossen.
    • Persoon A (Oude AI): Rent tegen elke doodlopende weg op, schreeuwt en probeert 100 verschillende foute paden.
    • Persoon B (daVinci AI): Bekijkt de kaart, ziet de doodlopende wegen en neemt de directe route.
  • De met daVinci getrainde AI gebruikte minder woorden (tokens) en minder tool-klikken om dezelfde problemen op te lossen. Hij verspilde geen energie aan verwarring.

De "Scaling" Ontdekking

Ten slotte testten de auteurs wat er gebeurt als ze de trainingsverhalen nog langer maken.

  • Ze ontdekten dat als ze de AI trainden op ketens met meer stappen (langere Pull Request-ketens), de AI nog beter werd.
  • Dit suggereert dat hoe meer de AI oefent met "lange afstand"-denken, hoe beter hij wordt in het oplossen van zeer lange, complexe problemen.

Samenvatting

daVinci-Agency is een nieuwe manier om AI-agents te trainen. In plaats van hen te dwingen miljoenen korte, nep-taken te memoriseren, leert het hen door hen echte, lange verhalen te tonen over hoe mensen software bouwen. Door te leren van deze natuurlijke "ketens van gebeurtenissen", leert de AI te plannen, consistent te blijven en zijn eigen fouten te herstellen, waardoor hij veel slimmer en efficiënter wordt met veel minder data dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →