← Nieuwste papers
💻 computer science

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

Het CaP-X-framework introduceert een open platform met CaP-Gym, CaP-Bench, CaP-Agent0 en CaP-RL om Code-as-Policy-agenten voor robotmanipulatie systematisch te evalueren en te verbeteren, waarbij wordt aangetoond dat schaling van testtijd-berekening en verifieerbare beloningen menselijke betrouwbaarheid kunnen bereiken zonder training.

Oorspronkelijke auteurs: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

Gepubliceerd 2026-03-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren om een kamer op te ruimen. Je hebt twee manieren om dit te doen:

  1. De oude manier (De Strikte Architect): Je schrijft een heel specifiek boekje voor de robot. "Als je een sok ziet, pak hem dan vast met je linkerhand, draai 45 graden en gooi hem in de mand." Dit werkt goed zolang de sok precies op de plek ligt waar je hem verwacht. Maar als de sok onder een stoel ligt of als de robot een nieuwe kamer binnenkomt, raakt hij in paniek. Hij kan niet improviseren.
  2. De nieuwe manier (De Visionaire VLA): Je geeft de robot een enorme video van mensen die opruimen. De robot leert door te kijken en na te bootsen. Hij is erg goed in het kopiëren van wat hij ziet, maar als je hem een taak geeft die hij nooit heeft gezien (bijvoorbeeld: "haal de afwas uit de magnetron"), kan hij vastlopen. Hij weet niet waarom hij iets doet, hij doet het alleen omdat hij het zo heeft gezien.

CaP-X is een nieuw project dat een derde, slimme weg zoekt: De Robot die Code Schrijft.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Code als Politiek" (Code-as-Policy)

In plaats van de robot te leren wat hij moet doen (zoals bij de oude manier) of hem te laten kijken en nabootsen (zoals bij de nieuwe manier), laten we de robot programma's schrijven om de taak uit te voeren.

Stel je voor dat de robot een architect is die een bouwtekening schrijft. In plaats van zelf de bakstenen te leggen, schrijft hij de instructies: "Pak de baksteen, leg hem hier, gebruik mortel."

  • Het probleem: Tot nu toe moesten mensen deze instructies heel simpel houden (bijv. "pak de baksteen"). Als je de instructies te simpel maakt, kan de robot alleen simpele dingen doen. Als je ze te complex maakt, raakt de robot in de war en schrijft hij onzin.

2. De Oplossing: CaP-X (Het Testlab)

De auteurs hebben CaP-X gebouwd. Dit is als een groot, interactief speelgoedlab waar ze kunnen testen hoe goed robots zijn in het schrijven van hun eigen bouwplannen.

Ze hebben drie belangrijke dingen ontdekt in dit lab:

  • De "Kraan" van de Mens: Als je de robot helpt met vooraf gemaakte, simpele instructies (zoals "pak het rode blokje"), doet hij het goed. Maar als je die hulp weghaalt en de robot moet werken met de basis-blokjes (zoals "beweeg je arm 5 centimeter naar links"), faalt hij vaak. Hij is te afhankelijk van de "kinderfietswieltjes" die mensen voor hem hebben geplaatst.
  • Meer Denken = Beter Doen: Als je de robot de tijd geeft om na te denken, te fouten te zoeken en zijn plan te verbeteren (net als een mens die een puzzel probeert op te lossen door te proberen, te falen en het opnieuw te proberen), wordt hij veel beter. Het is alsof je een student meer tijd geeft voor een tentamen; hij kan zijn fouten corrigeren.
  • Visie in Woorden: Als je de robot gewoon een foto geeft, raakt hij in de war. Maar als je een andere AI (een "vertaler") de foto laat bekijken en vraagt: "Beschrijf in woorden wat er verandert," en die tekst aan de robot geeft, werkt het veel beter. Het is alsof je een tolk hebt die de visuele chaos vertaalt naar duidelijke instructies.

3. De Sterke Robot: CaP-Agent0

Op basis van deze ontdekkingen hebben ze CaP-Agent0 gemaakt. Dit is een robot-agent die niet hoeft te worden getraind met duizenden voorbeelden. Hij is "trainingsvrij".

Hoe werkt hij?

  • Hij denkt na: Hij schrijft code, probeert het, en als het mislukt, kijkt hij naar de foutmelding en schrijft hij de code opnieuw.
  • Hij heeft een gereedschapskist: Hij bouwt zijn eigen verzameling van slimme trucs (zoals "hoe pak ik een ronde bal vast zonder dat hij wegrolt") die hij hergebruikt.
  • Hij werkt in team: Soms laten ze drie verschillende AI's (zoals drie verschillende ingenieurs) tegelijk een oplossing bedenken. Daarna laten ze een "hoofdingenieur" de beste delen van die drie oplossingen samenvoegen tot één perfect plan.

Het resultaat? Deze robot kan complexe taken uitvoeren, zoals een stapel blokken maken of een blikje soda van de vloer halen, en doet dit bijna net zo goed als een menselijke expert, zonder dat hij ooit specifiek voor die taak is getraind.

4. De "Leerling" die Loopt: CaP-RL

Tot slot hebben ze een trucje bedacht om de robot nog slimmer te maken. Ze laten de robot oefenen in een virtuele wereld (een simulator) en geven hem een beloning (een "sterretje") als hij het goed doet. Na een tijdje leert de robot niet alleen wat hij moet doen, maar hoe hij het het beste kan doen.

Het mooie is: wat hij in de virtuele wereld leert, werkt direct ook in de echte wereld. Het is alsof een piloot die in een vliegsimulator traint, zonder extra oefening direct een echt vliegtuig kan besturen.

Samenvatting

CaP-X laat zien dat robots niet alleen hoeven te "kijken en nabootsen" (zoals een papegaai) of "strikte regels te volgen" (zoals een computerprogramma). Als we robots de kans geven om code te schrijven, te denken, fouten te maken en te verbeteren, kunnen ze onafhankelijke, slimme helpers worden die complexe taken aan kunnen, zelfs in een chaotische, echte wereld.

Het is de overgang van een robot die een script volgt, naar een robot die een ingenieur is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →