← Nieuwste papers
🤖 AI

daVinci-Dev: Agent-native Mid-training for Software Engineering

Het artikel introduceert daVinci-Dev, een framework voor agentische mid-training dat een nieuwe "agent-native" datastrategie benut door contextueel en omgevingsmatig native trajecten te combineren om distributieverschillen te overwinnen, waardoor 32B- en 72B-modellen in staat worden gesteld om state-of-the-art SWE-Bench Verified-prestaties te behalen met aanzienlijk minder trainingstokens dan eerdere methoden.

Oorspronkelijke auteurs: Ji Zeng, Dayuan Fu, Tiantian Mi, Yumin Zhuang, Yaxing Huang, Xuefeng Li, Lyumanshan Ye, Muhang Xie, Qishuo Hua, Zhen Huang, Mohan Jiang, Hanning Wang, Jifan Lin, Yang Xiao, Jie Sun, Yunze Wu, Pengfei
Gepubliceerd 2026-01-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ji Zeng, Dayuan Fu, Tiantian Mi, Yumin Zhuang, Yaxing Huang, Xuefeng Li, Lyumanshan Ye, Muhang Xie, Qishuo Hua, Zhen Huang, Mohan Jiang, Hanning Wang, Jifan Lin, Yang Xiao, Jie Sun, Yunze Wu, Pengfei Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Robot Leren Hoe een Echte Programmeur Te Worden

Stel je voor dat je een robot wilt leren hoe hij een kapotte auto moet repareren.

De Oude Manier (Post-Training):
De meeste huidige AI-modellen zijn als studenten die alle automanuals in de bibliotheek hebben gelezen (Pre-training), maar nog nooit een moersleutel hebben aangeraakt. Om hen te leren auto's te repareren, laten onderzoekers hen enkele video's zien van experts die auto's repareren (Supervised Fine-Tuning) en laten ze vervolgens oefenen in een garage, waarbij ze alleen worden gecorrigeerd wanneer ze een fout maken (Reinforcement Learning).

  • Het Probleem: De "garage" is klein en duur om te bouwen. Je kunt slechts op een paar auto's oefenen. Bovendien ziet de student alleen de uiteindelijke gerepareerde auto, niet het rommelige proces van proberen, falen, de motor controleren en opnieuw proberen.

De Nieuwe Manier (daVinci-Dev / Agent-Native Mid-Training):
De auteurs van dit paper zeggen: "Laten we de robot leren voordat we hem naar de garage sturen." Ze introduceren een tussenfase genaamd Mid-Training.

In plaats van de robot alleen de afgewerkte auto te laten zien, voeren ze hem een enorme bibliotheek aan echte reparatielogs van miljoenen echte monteurs. Ze laten hem niet alleen het eindresultaat zien; ze laten hem het volledige verhaal zien:

  1. De monteur die naar de kapotte auto kij
  2. .
  3. De monteur die de motorkap opent en de handleiding leest.
  4. De monteur die een reparatie probeert, een vreemd geluid hoort en beseft dat het niet werkte.
  5. De monteur die een andere reparatie probeert totdat het werkt.

Ze noemen dit "Agent-Native" data omdat het de werkelijke ervaring nabootst van het zijn van een agent (een werker) in de echte wereld, in plaats van alleen statische feiten te memoriseren.


De Twee Speciale Ingrediënten

Om deze trainingsbibliotheek te bouwen, heeft het team twee soorten "verhalen" (data) gemaakt van GitHub (een gigantische website waar programmeurs code delen):

1. De "Contextually-Native" Verhalen (De Brede Bibliotheek)

  • Wat het is: Ze hebben miljoenen "Pull Requests" (verzoeken om code aan te passen) genomen en het hele verhaal gereconstrueerd.
  • De Analogie: Stel je een dossier van een detective voor. Het laat niet alleen de opgeloste misdaad zien; het laat ook de detective zien die het dagboek van de verdachte leest, het juiste bestand vindt, een gok doet en vervolgens van gedachten verandert op basis van nieuwe aanwijzingen.
  • Waarom het helpt: Dit leert de AI de flow van het werk. Het leert dat je, voordat je een bestand bewerkt, het eerst moet opzoeken en lezen. Het dekt een enorme variëteit aan talen en situaties (68,6 miljard woorden aan data).

2. De "Environmentally-Native" Verhalen (De Levende Simulatie)

  • Wat het is: Ze hebben niet alleen logs gelezen; ze hebben de code daadwerkelijk gedraaid. Ze plaatsten een AI-agent in een echte, werkende computeromgeving (een Docker-container) en lieten het proberen bugs te repareren.
  • De Analogie: Dit is also[dt] de student in een echte garage te zetten met een echte motor. De student probeert een bout aan te draaien, en de motor maakt een harde klank (een foutmelding). De student hoort de fout, stopt en probeert een ander gereedschap.
  • Waarom het helpt: Dit leert de AI hoe te reageren op echte feedback. Het leert dat "als ik dit commando typ, de computer tegen mij zal schreeuwen met een foutmelding", wat iets is wat statische boeken niet kunnen leren. Dit deel is kleiner (3,1 miljard woorden) maar van zeer hoge kwaliteit omdat het "echt" is.

De Resultaten: Hoe Goed Werkte Het?

Het team heeft hun nieuwe "student" (het daVinci-Dev model) getest op een beroemde examen genaamd SWE-Bench Verified, wat een soort eindexamen is voor software engineers.

  • De Score: Hun 72-miljard parameter model behaalde een succespercentage van 58,5%.
  • De Vergelijking: Dit versloeg de vorige beste open-source methode (Kimi-Dev), die rond de 48,6% scoorde.
  • De Efficiëntie: Ze bereikten dit met minder dan de helft van de hoeveelheid trainingsdata (tokens) die de vorige recordhouder gebruikte. Het is alsof je een A+ haalt op een toets door 50 uur te studeren in plaats van 100 uur, omdat het studiemateriaal veel beter was.
  • De Verrassing: Ondanks dat ze begonnen met een "algemeen" basismodel (Qwen2.5-Base) dat niet specifiek voor coderen was getraind, maakte de nieuwe trainingsmethode het beter in coderen dan modellen die als "code-experts" begonnen.

Waarom Dit Belangrijk Is (Volgens het Paper)

Het paper betoogt dat de grootste fout bij het leren programmeren aan AI is geweest: het behandelen van de AI als een student die alleen tekstboeken leest. Echt software engineering is een lus: Probleem vinden → Code lezen → Reparatie proberen → Kijken of het breekt → Opnieuw repareren.

Door de AI data te voeren die deze lus behoudt (zowel het verhaal van het werk als de realtime feedback van de computer), hebben ze een fundament gebouwd dat veel sterker is.

Kortom: Ze hebben de AI niet alleen geleerd hoe code eruitziet; ze hebben het geleerd hoe te denken als een programmeur door het rommelige proces van trial-and-error van echte softwareontwikkeling te simuleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →