RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions
RealClawBench introduit un cadre de référence en direct dérivé de sessions réelles d'agents-développeurs OpenClaw qui utilise des environnements d'exécution reconstruits et des évaluateurs déterministes pour transformer 281 tâches réelles et complexes en évaluations reproductibles, révélant des écarts de performance significatifs dans les modèles actuels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de tester les capacités d'un nouveau robot chef.
L'ancienne méthode (Benchmarks conventionnels) :
Traditionnellement, les chercheurs écrivaient une liste de recettes parfaites et théoriques comme « Faire un sandwich au fromage grillé » ou « Cuire un gâteau au chocolat ». Ils donnaient ces recettes au robot et observaient s'il suivait les étapes. Le problème ? La vie réelle n'est pas un manuel scolaire. Dans le monde réel, un client pourrait dire : « Mon pain est légèrement rassis, le fromage est au fond du frigo, et je n'ai qu'un four grille-pain, pas un gril. Pouvez-vous me préparer quelque chose d'édible ? » Les anciens tests ne vérifiaient pas si le robot pouvait gérer ces détails complexes et désordonnés de la vie réelle.
La nouvelle méthode (REALCLAWBENCH) :
Les auteurs de cet article ont réalisé que pour véritablement tester un « agent développeur » (un robot qui aide les programmeurs), ils devaient arrêter d'inventer des tests fictifs et commencer à observer de vraies personnes utiliser les robots sur le terrain.
Ils ont construit un système appelé REALCLAWBENCH. Voici comment il fonctionne, en utilisant des analogies simples :
1. Capturer des moments réels (La source)
Au lieu d'inventer des tâches, l'équipe a observé 76 155 sessions réelles où de véritables développeurs utilisaient un outil appelé « OpenClaw » pour obtenir de l'aide avec leur code. Ils ont vu de vraies personnes demander de l'aide avec des requêtes désordonnées, compliquées et parfois vagues.
- Analogie : Imaginez une caméra de surveillance enregistrant des milliers de vrais clients commandant de la nourriture dans un restaurant très fréquenté, plutôt qu'un chef écrivant un menu dans une cuisine calme.
2. Le « Nettoyage Magique » (Le Pipeline)
On ne peut pas simplement prendre l'enregistrement brut d'un client réel et en faire un test. L'enregistrement peut contenir des mots de passe privés, des fichiers d'entreprise secrets ou des références à des ordinateurs qui n'existent plus.
L'article décrit un pipeline (une ligne de production étape par étape) qui nettoie ces moments réels :
- Écran de confidentialité : Ils suppriment tous les secrets et informations privées, comme on flouterait des visages dans une vidéo.
- Reconstruction de l'environnement : Si un développeur a demandé au robot de corriger un fichier sur son ordinateur spécifique, l'équipe construit une version fictive et sûre de cet environnement informatique afin que le test puisse être exécuté à nouveau plus tard.
- Réécriture de la requête : Ils transforment une requête vague et conversationnelle (« Hé, peux-tu regarder ce truc dont j'ai parlé tout à l'heure ? ») en une instruction claire et autonome (« Veuillez corriger le bug dans le fichier de connexion »).
- Le Juge Automatique : Au lieu qu'un humain évalue le travail, ils écrivent un programme informatique qui vérifie le résultat. Le fichier a-t-il été corrigé ? Oui/Non. Pas de place pour l'interprétation.
3. Le Résultat : Un test « Vivant »
Le produit final est un benchmark comprenant 281 tâches réelles.
- Pourquoi c'est spécial : Il est « vivant » et « ancré ». Cela signifie que le test n'est pas une liste statique de questions qui devient obsolète. Parce qu'ils l'ont construit à partir d'un flux continu de données d'utilisateurs réels, ils peuvent mettre à jour le test plus tard avec de nouveaux exemples réels pour le garder actuel.
- Le « Fossé de Réalisme » : L'article soutient que les tests précédents présentaient un « fossé » entre ce qu'ils testaient et ce qui se passe réellement. REALCLAWBENCH comble ce fossé. C'est comme passer du test d'un conducteur sur une piste parfaite et vide au test d'un conducteur en plein trafic aux heures de pointe, avec des nids-de-poule et des piétons confus.
Qu'ont-ils découvert ?
Ils ont testé 14 des modèles d'IA les plus intelligents actuellement disponibles sur ce nouveau test complexe et réel.
- Le Score : Même le meilleur modèle d'IA (Claude Opus 4.7) n'a résolu qu'environ 66 % des tâches.
- La Conclusion : Cela signifie qu'il reste encore beaucoup de place pour l'amélioration. Les robots actuels, même « super-intelligents », luttent encore avec les problèmes désordonnés de la vie réelle auxquels les développeurs sont confrontés chaque jour.
Résumé
En bref, l'article dit : « Arrêtez de tester les robots avec des scénarios parfaits et fictifs. Testons-les avec les problèmes désordonnés de la vie réelle auxquels ils sont réellement confrontés, mais nettoyons-les juste assez pour pouvoir les évaluer équitablement. »
Ils ont construit un système pour faire exactement cela, et ils ont découvert que même les meilleurs robots d'aujourd'hui ne sont encore qu'aux deux tiers du chemin pour être véritablement fiables dans le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.