← Derniers articles
🤖 AI

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

Cet article présente BUILD-AND-FIND, un protocole d'évaluation soucieux de l'effort qui évalue la qualité des bases de code générées par des agents en mesurant non seulement leur correction comportementale, mais aussi la précision et l'effort d'inspection requis pour que des agents en aval récupèrent l'intention de conception et les spécifications originales.

Auteurs originaux : Jhen-Ke Lin

Publié 2026-05-08
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jhen-Ke Lin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Il ne s'agit pas seulement de la réponse, mais de la note

Imaginez que vous engagez un chef (un agent IA) pour préparer un repas complexe à partir d'une recette secrète que vous lui avez donnée.

  • Ancienne méthode : Vous goûtez le plat. Si le goût est bon, le chef est validé.
  • Nouveau problème : Et si le chef prépare un plat délicieux, mais qu'il cache les ingrédients secrets dans une boîte verrouillée, écrit la recette en encre invisible, ou laisse la cuisine en désordre ? Plus tard, un autre chef (une autre IA) doit entrer, goûter le plat et comprendre comment il a été fait afin de corriger un bord brûlé ou d'ajouter plus de sel. Si le premier chef n'a pas laissé de indices clairs, le second chef pourrait échouer, même si le plat avait bon goût.

Ce document introduit une nouvelle façon de tester les codeurs IA appelée BUILD-AND-FIND. Au lieu de vérifier simplement si le code « fonctionne » (a bon goût), il vérifie si le code est facile à lire et à comprendre pour la prochaine personne (ou IA) qui devra travailler avec.


Les Deux Rôles : Le Bâtisseur et Le Détective

Les chercheurs ont mis en place un jeu avec deux rôles distincts :

  1. Le Bâtisseur (Le Chef) :

    • Il reçoit une « spécification » cachée (la recette secrète).
    • Sa tâche est de construire un projet logiciel complet (la cuisine et le repas) basé sur ces instructions.
    • Il ne sait pas que quelqu'un d'autre examinera son travail immédiatement ; il doit simplement le faire fonctionner.
  2. Le Détective (L'Inspecteur) :

    • Il reçoit uniquement le code terminé (la cuisine et le repas). Il n'a pas le droit de voir la recette secrète originale.
    • Il reçoit une liste de questions à choix multiples sur les choix de conception (par exemple, « Pourquoi le chef a-t-il choisi ce type de four spécifique ? » ou « Où le sel est-il stocké ? »).
    • Sa tâche est d'examiner le code, de trouver les preuves et de répondre correctement aux questions.

Le Tableau de Bord : Précision vs Effort

Le document mesure deux choses principales :

  1. Ont-ils eu raison ? (Précision)

    • Le Détective peut-il trouver la bonne réponse simplement en regardant le code ?
    • Analogie : L'Inspecteur a-t-il réussi à trouver le bocal d'épices caché ?
  2. À quel point ont-ils dû chercher ? (Effort d'inspection)

    • C'est la grande innovation du document. Si deux Bâtisseurs produisent tous deux un code permettant au Détective d'obtenir la bonne réponse, lequel était le plus facile à comprendre ?
    • Les chercheurs mesurent l'« effort » en comptant le nombre d'octets de code que le Détective a dû lire ou parcourir.
    • Analogie : Si le Chef A laisse le bocal de sel sur le comptoir, et que le Chef B le cache dans un coffre-fort verrouillé nécessitant un code complexe pour s'ouvrir, les deux chefs ont préparé un aliment comestible. Mais le Chef A a rendu la tâche plus facile pour la prochaine personne. Le document récompense le chef qui laisse le « sel » sur le comptoir.

Pourquoi cela compte

Le document soutient que, à l'avenir, les agents IA travailleront en équipes. Une IA écrit un programme, et une autre IA doit le corriger ou le mettre à jour plus tard.

  • Si la première IA écrit un code qui est « correct » mais désordonné ou confus, la deuxième IA aura du mal.
  • BUILD-AND-FIND prouve que nous pouvons mesurer à quel point le code d'une IA est « lisible » ou « communicatif », indépendamment du fait que le code fonctionne réellement.

Les Résultats (Ce qu'ils ont découvert)

Les chercheurs ont testé cela avec plusieurs modèles IA puissants (comme GPT-5, Claude Opus et d'autres) sur deux types de tâches : la construction d'une mini-base de données et la construction d'un petit serveur web.

  • Le problème de la « Forte Antériorité » : Les questions posées portaient sur des choses que les ingénieurs expérimentés connaissent généralement par cœur (comme « les bases de données enregistrent généralement les journaux avant d'écrire »). Parce que les IA sont intelligentes, elles pouvaient deviner les bonnes réponses simplement en utilisant leurs connaissances générales, même sans lire le code.
  • La Solution : Comme tout le monde obtenait les bonnes réponses, les chercheurs ne pouvaient pas simplement compter les « bonnes réponses ». Au lieu de cela, ils ont examiné combien de lecture les IA avaient dû faire.
    • Certains modèles IA ont écrit un code où les réponses étaient évidentes et faciles à trouver (faible effort).
    • D'autres ont écrit un code où les réponses étaient enfouies profondément dans les fichiers, obligeant le Détective à lire beaucoup plus pour les trouver (fort effort).
  • Le Gagnant : Les modèles qui ont produit un code nécessitant le moins de lecture pour trouver les réponses ont été considérés comme les meilleurs pour « communiquer » leurs choix de conception.

Le Filet de Sécurité (Contrôles)

Pour s'assurer que les IA ne trichaient pas ou ne devinaient pas, les chercheurs ont ajouté des vérifications de sécurité :

  • Test Questions-Seulement : Ils ont posé les questions au Détective sans lui montrer de code. Si l'IA avait raison ici, c'était simplement une devinette basée sur des connaissances générales.
  • Test Spécifications-Seulement : Ils ont montré la recette secrète au Détective mais aucun code. Cela prouvait que la recette était claire.
  • Le « Portail » : Les chercheurs ne comptaient le score d'« effort » que si le Détective obtenait réellement la bonne réponse. Si le Détective ne pouvait pas trouver la réponse du tout, le code était considéré comme un échec, indépendamment de la quantité de lecture nécessaire.

Résumé

BUILD-AND-FIND est un nouveau test pour les codeurs IA. Il demande : « Si vous écrivez ce code, une autre IA pourra-t-elle facilement comprendre pourquoi vous avez fait les choix que vous avez faits ? »

Il va au-delà de la question « Le code fonctionne-t-il ? » pour demander « Le code est-il un bon outil de communication pour l'avenir ? ». La meilleure IA n'est pas seulement celle qui construit la bonne chose ; c'est celle qui construit la chose d'une manière qui rend facile pour la prochaine personne de la reprendre et de continuer le travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →