RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions
RealClawBench introduceert een live benchmark-framework afgeleid van echte OpenClaw developer-agent sessies, dat gereconstrueerde executieomgevingen en deterministische scorers gebruikt om 281 uitdagende, real-world taken te transformeren naar reproduceerbare evaluaties, waardoor significante prestatiekloven in huidige modellen worden onthuld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te testen hoe goed een nieuwe robotkok is.
De Oude Manier (Conventionele Benchmarks):
Traditioneel schreven onderzoekers een lijst met perfecte, tekstboekachtige recepten zoals "Maak een grilled cheese sandwich" of "Bak een chocoladecake." Ze gaven deze recepten aan de robot en keken of hij de stappen volgde. Het probleem? Het echte leven is geen tekstboek. In de echte wereld kan een klant zeggen: "Mijn brood is een beetje oud geworden, de kaas staat achterin de koelkast en ik heb alleen een broodrooster, geen grill. Kun je iets eetbaars maken?" De oude tests controleerden niet of de robot die rommelige, echte details kon afhandelen.
De Nieuwe Manier (REALCLAWBENCH):
De auteurs van dit artikel realiseerden zich dat om een "developer agent" (een robot die programmeurs helpt) echt te testen, ze moesten stoppen met het verzinnen van nep-tests en in plaats daarvan moesten kijken naar hoe echte mensen de robots in het wild gebruiken.
Ze bouwden een systeem genaamd REALCLAWBENCH. Hier is hoe het werkt, met eenvoudige analogieën:
1. Echte Momenten Vangen (De Bron)
In plaats van taken te verzinnen, heeft het team 76.155 echte sessies bekeken waarin echte ontwikkelaars een tool genaamd "OpenClaw" gebruikten om hulp te krijgen bij hun code. Ze zagen echte mensen om hulp vragen met rommelige, complexe en soms vage verzoeken.
- Analogie: Stel je een beveiligingscamera voor die duizenden echte klanten registreert die eten bestellen in een druk restaurant, in plaats van een chef die een menu schrijft in een stille keuken.
2. De "Magische Schoonmaak" (De Pipeline)
Je kunt niet zomaar een ruwe opname van een echte klant nemen en daar een test van maken. De opname kan privé wachtwoorden, geheime bedrijfsbestanden of verwijzingen naar computers bevatten die niet meer bestaan.
Het artikel beschrijft een pipeline (een stapsgewijze fabriekslijn) die deze echte momenten opschoont:
- Privacy Scherm: Ze verwijderen alle geheimen en privé-informatie, zoals het vervagen van gezichten in een video.
- Omgevingsreconstructie: Als een ontwikkelaar de robot vroeg om een bestand op hun specifieke computer te repareren, bouwt het team een nep, veilige versie van die computermgeving zodat de test later opnieuw gedraaid kan worden.
- Het Verzoek Herschrijven: Ze veranderen een vaag, gespreksmatig verzoek ("Hé, kun je even naar dat ding kijken waar ik het eerder over had?") in een duidelijke, op zichzelf staande instructie ("Repareer de bug in het login-bestand").
- De Automatische Beoordelaar: In plaats van een mens die het werk beoordeelt, schrijven ze een computerprogramma dat het resultaat controleert. Is het bestand gerepareerd? Ja/Nee. Er mag niet gegokt worden.
3. Het Resultaat: Een "Live" Test
Het eindproduct is een benchmark met 281 echte taken.
- Waarom het bijzonder is: Het is "live" en "verankerd". Dit betekent dat de test geen statische lijst met vragen is die veroudert. Omdat ze het hebben gebouwd vanuit een continue stroom van echte gebruikersdata, kunnen ze de test later updaten met nieuwe echte voorbeelden om het fris te houden.
- De "Realiteitskloof": Het artikel stelt dat eerdere tests een "kloof" hadden tussen wat ze testten en wat er werkelijk gebeurt. REALCLAWBENCH overbrugt deze kloof. Het is alsoals overstappen van het testen van een bestuurder op een perfect, leeg circuit naar het testen van hen in het werkelijke drukke verkeer met kuilen en verwarde voetgangers.
Wat Hebben Ze Gevonden?
Ze hebben 14 van de slimste AI-modellen die momenteel beschikbaar zijn getest op deze nieuwe, rommelige, echte test.
- De Score: Zelfs het beste AI-model (Claude Opus 4.7) loste slechts ongeveer 66% van de taken op.
- De Conclusie: Dit betekent dat er nog veel ruimte is voor verbetering. De huidige "superintelligente" robots worstelen nog steeds met de rommelige, echte problemen waar echte ontwikkelaars elke dag mee te maken krijgen.
Samenvatting
Kortom, het artikel zegt: "Stop met het testen van robots met nep, perfecte scenario's. Laten we ze testen met de rommelige, echte problemen waar ze daadwerkelijk voor staan, maar schoon ze net genoeg op zodat we ze eerlijk kunnen beoordelen."
Ze hebben een systeem gebouwd om precies dat te doen, en ze kwamen tot de conclusie dat zelfs de beste robots van vandaag nog maar ongeveer twee derde van de weg zijn naar echt betrouwbaar te zijn in de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.