← Nieuwste papers
💬 NLP

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

De Confucius Code Agent (CCA) is een schaalbare software engineering agent gebouwd op de Confucius SDK, die geavanceerd contextbeheer, persistent leren en een meta-agent voor automatische verfijning integreert om state-of-the-art prestaties te behalen op real-world programmeertaken zoals SWE-Bench-Pro.

Oorspronkelijke auteurs: Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

Gepubliceerd 2026-02-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, 20 verdiepingen tellende bibliotheek probeert te repareren waar elk boek een stuk code is en de boeken constant worden herschreven. Je hebt een briljante bibliothecaris (het AI-model) die kan lezen en schrijven, maar als je ze de hele bibliotheek in één keer geeft, raken ze overweldigd, vergeten ze wat ze vijf minuten geleden deden en beginnen ze fouten te maken.

Dit paper introduceert de Confucius Code Agent (CCA), een nieuwe manier om een "super-bibliothecaris" te bouwen die daadwerkelijk in staat is om gigantische, echte softwareprojecten te beheren zonder de weg kwijt te raken.

Hier is hoe het paper dit uitlegt, onderverdeeld in eenvoudige concepten:

1. Het Probleen: De "Overweldigde Genie"

Huidige AI-coderingstools zijn als genieën die geweldig zijn in korte taken, maar slecht in lange taken.

  • Research tools zijn transparant (je kunt zien hoe ze denken), maar vallen uit elkaar wanneer de taak enorm groot wordt.
  • Commerciële tools werken goed in de praktijk, maar zijn als zwarte dozen; je kunt ze niet gemakkelijk aanpassen of begrijpen waarom ze faalden.
  • Het probleem: Echte software engineering is niet alleen het schrijven van één regel code; het is een lange reis die duizenden bestanden, vele stappen en het onthouden van wat je dagen geleden deed, omvat. Bestaande tools vergeten dingen of raken in de war door de enorme hoeveelheid informatie.

2. De Oplossing: Het "Drie-Ervaringen" Bibliotheeksysteem

De auteurs hebben een platform gebouwd genaamd de Confucius SDK. In plaats van de AI alleen maar meer hersencapaciteit te geven, hebben ze de bibliotheek georganiseerd in drie duidelijke rollen om alles soepel te laten verlopen:

  • Agent Experience (AX): Dit is de "interne werkplek" van de AI. Het is een schoon, georganiseerd bureau waar de AI alleen de essentiële aantekeningen ziet die het nodig heeft om na te denken. Het raakt niet afgeleid door rommelige logs of menselijk geklets.
  • User Experience (UX): Dit is wat jij (de mens) ziet. Het is een duidelijk, leesbaar dashboard dat de voortgang van de AI laat zien, zoals een live videostream van het werk dat wordt uitgevoerd, zodat jij niet in de war raakt door ruwe computercode.
  • Developer Experience (DX): Dit is de "controlekamer" voor de engineers die de AI bouwen. Het stelt hen in staat om eenvoudig tools te vervangen, te zien hoe de AI leert, en bugs in het systeem zelf te repareren.

De Analogie: Stel je een bouwplaats voor.

  • AX is het klembord van de voorman met alleen de blauwdrukken en de to-do lijst.
  • UX is het veiligheidsglas waar de klant het werk kan volgen.
  • DX is de gereedschapskist waar de architecten hun hamers en boren georganiseerd houden zodat deze gemakkelijk kunnen worden vervangen.

3. De Vier Superkrachten

Om dit systeem op gigantische codebases te laten werken, gebruikt de Confucius Agent vier specifieke trucs:

A. De "Slimme Samenvatter" (Contextbeheer)

Wanneer je een lang gesprek voert met een AI, wordt het gesprek te lang voor de AI om alles te onthouden.

  • Hoe het werkt: De agent heeft een "Code Architect" die de conversatie in de gaten houdt. Wanneer deze te lang wordt, stopt de Architect, leest de geschiedenis en schrijft een gestructureerde samenvatting (zoals een opsomming van doelen, beslissingen en fouten). Het gooit de oude, rommelige chatlogs weg en vervangt deze door deze schone samenvatting.
  • Resultaat: De AI vergeet nooit het grote plaatje, zelfs niet na uren werk.

B. Het "Persistent Notitieboek" (Notities maken)

Normaal gesproken vergeet een AI bij een volgende start ook de eerdere fouten.

  • Hoe het werkt: De agent heeft een toegewezen "Notitie-nemer" die gebeurtenissen opschrijft in een permanent, georganiseerd notitieboek (Markdown-bestanden). Cruciaal is dat het ook foutnotities opschrijft (bijv. "Probeer dit bestand niet op deze manier te bewerken; dit veroorzaakt een fout").
  • Resultaat: Als de agent later op hetzelfde probleem stuit, opent hij het notitieboek, ziet de eerdere fout en herstelt deze onmiddellijk in plaats van dezelfde fout opnieuw te maken.

C. De "Modulaire Gereedschapskist" (Extensies)

In plaats van hoe de AI tools (zoals file editors) gebruikt hard te coderen, gebruikt het systeem "extensies".

  • Hoe het werkt: Denk hierbij aan Lego-blokjes. Je kunt verschillende tools (zoeken, bewerken, commando's uitvoeren) aan de agent vastklikken. Als een tool kapot gaat of een nieuwe regel nodig heeft, vervang je gewoon het blokje zonder de hele robot opnieuw te hoeven bouwen.
  • Resultaat: Het systeem is flexibel en gemakkelijk bij te werken.

D. De "Zelfverbeterende Coach" (Meta-Agent)

Dit is het meest unieke deel. Het systeem bevat een tweede AI (de Meta-Agent) wiens enige taak het is om de eerste AI te bouwen en te verbeteren.

  • Hoe het werkt: De Meta-Agent test verschillende manieren om de hoofdagent te vertellen hoe hij tools moet gebruiken. Het test deze methoden, ziet welke het beste werken, en herschrijft automatisch de instructies (prompts) om ze duidelijker te maken.
  • Resultaat: De agent wordt automatisch beter in zijn werk, zonder dat mensen handmatig elke instructie hoeven aan te passen.

4. De Resultaten: De Reuzen Verslaan

De auteurs hebben dit systeem getest op SWE-Bench-Pro, een zeer moeilijke test waarbij AI echte bugs in open-source software moet oplossen.

  • De Competitie: Ze hebben hun agent vergeleken met andere top research tools en zelfs de propriëtaire (geheime) tools die gebruikt worden door grote techbedrijven zoals OpenAI en Anthropic.
  • De Uitkomst: De Confucius Code Agent loste 59% van de problemen op.
    • Dit versloeg het vorige record in onderzoek.
    • Het versloeg de resultaten van OpenAI's GPT-5.2 en Anthropic's Claude Opus 4.5, ook al gebruikten zij exact hetzelfde onderliggende "brein" (model) en exact dezelfde tools.
  • De Les: Het paper bewijst dat hoe je de AI organiseert (de way de scaffolding) net zo belangrijk is als hoe slim de AI is. Een iets minder sterk model met een geweldig systeem versloeg een sterker model met een zwak systeem.

Samenvatting

Het paper betoogt dat om AI te bouwen die echte software engineering kan doen, we niet alleen de AI slimmer moeten maken. We moeten een betere "kantooromgeving" bouwen waarin het kan werken—een omgeving met een schoon bureau (AX), een duidelijk zicht voor mensen (UX), gemakkelijk te repareren tools (DX), een manier om fouten te onthouden (Notitie maken) en een coach die helpt bij het leren (Meta-Agent). Wanneer je dit doet, wordt zelfs een standaard AI een krachtpatser die in staat is om enorme softwareprojecten op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →