Agentic Coding Needs Proactivity, Not Just Autonomy
Cet article soutient que la prochaine génération d'agents de codage doit évoluer d'une simple autonomie vers une véritable proactivité en définissant une taxonomie claire, en établissant des critères d'acceptation et en introduisant des métriques spécifiques comme la qualité des décisions d'insight pour évaluer leur capacité à anticiper les besoins et à améliorer le développement logiciel grâce à une interaction à initiative mixte.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un assistant hautement qualifié et ultra-rapide qui vous aide à écrire des logiciels. Pour l'instant, la plupart de ces assistants ressemblent à des bibliothécaires très obéissants. Si vous vous approchez du comptoir et demandez : « Pouvez-vous me trouver un livre sur les chats ? », ils le trouvent instantanément. Si vous dites : « Écrivez une histoire sur un chat », ils l'écrivent. Ils sont autonomes car ils peuvent accomplir le travail sans que vous teniez leur main, mais ils sont réactifs car ils ne bougent que lorsque vous le leur ordonnez.
Ce document soutient que la prochaine génération d'assistants de codage doit être plus que de simples bibliothécaires obéissants. Ils doivent devenir des partenaires proactifs.
Voici la décomposition des idées principales du document à l'aide d'analogies simples :
1. La différence entre « Autonomie » et « Proactivité »
- Autonomie (Le bibliothécaire obéissant) : L'assistant attend que vous posiez une question, puis va accomplir le travail. C'est excellent, mais il ne prend jamais la parole à moins que vous ne parliez en premier.
- Proactivité (Le copilote perspicace) : L'assistant observe toute la bibliothèque (votre code, votre emploi du temps, les discussions de votre équipe) pendant que vous travaillez. Il remarque des choses avant que vous ne demandiez.
- Exemple : Vous écrivez du code pour un système de paiement. L'assistant remarque une alerte d'actualité indiquant que la société de paiement changera ses règles la semaine prochaine.
- La partie difficile : Un agent proactif ne fait pas juste crier : « Hé, regarde ça ! » immédiatement. Il doit décider : Est-ce le bon moment pour interrompre ? Est-ce assez important ? Dois-je rester silencieux et attendre que vous ayez terminé votre pensée actuelle ?
2. Les trois niveaux d'assistants « intelligents »
Les auteurs ont créé un système de « feux de circulation » pour décrire à quel point ces agents sont intelligents :
- Niveau 1 : Réactif (Le feu rouge)
- Fonctionnement : L'agent reste immobile jusqu'à ce que vous appuyiez sur un bouton (donniez une invite).
- Analogie : Une calculatrice. Elle ne fait rien tant que vous n'avez pas tapé des chiffres dessus.
- Niveau 2 : Planifié (Le feu jaune)
- Fonctionnement : L'agent se réveille à des moments précis ou lorsqu'un événement spécifique se produit (comme une réunion prévue ou une mise à jour de code). Il peut vous envoyer un rapport, mais il ne « réfléchit » pas vraiment pour savoir si vous êtes occupé ou si le rapport est réellement utile en ce moment même.
- Analogie : La livraison d'un journal. Il arrive à 7 h 00 tous les matins, que vous soyez éveillé, endormi ou au milieu d'une douche. Il ne sait pas si vous en avez besoin.
- Niveau 3 : Conscient de la situation (Le feu vert)
- Fonctionnement : L'agent observe tout en continu. Il calcule : « Si j'interromps ce développeur maintenant, sera-t-il irrité ? Cette information est-elle critique ? Si je reste silencieux, risque-t-il de manquer quelque chose d'important ? »
- Analogie : Un assistant personnel qui sait que vous détestez être interrompu pendant un travail en profondeur. Si un incendie se déclare, il crie. Si un colis arrive, il attend que vous preniez une pause café pour vous le dire. Il apprend aussi de vous : « Ah, vous avez ignoré ma suggestion concernant le budget la dernière fois ? Je ne vous embêterai pas avec les budgets jusqu'au mois prochain. »
3. L'« Insight » (Perspicacité) est le véritable produit
Le document affirme que nous ne devrions pas mesurer ces agents par le nombre de tâches qu'ils terminent. Au contraire, nous devrions mesurer leur « Politique d'Insight ».
Considérez un Insight comme une hypothèse : « Je pense que vous avez besoin de savoir X maintenant. »
L'agent a quatre choix pour chaque insight :
- Notifier : « Hé, regarde ça ! » (Urgence élevée).
- Questionner : « Vouliez-vous vraiment faire cela ? » (Incertitude).
- Ébaucher : « J'ai écrit une correction pour vous, voulez-vous la voir ? » (Faible effort, haute valeur).
- Rester silencieux : « J'ai vu cela, mais ce n'est pas le bon moment pour dire quoi que ce soit. »
La grande affirmation du document : La compétence la plus importante pour un agent de niveau 3 est de savoir quand rester silencieux. Si un agent parle trop, il devient une nuisance. S'il reste silencieux alors qu'il devrait parler, il est inutile.
4. Comment tester cela ? (La nouvelle grille d'évaluation)
Actuellement, nous testons les agents de codage en leur donnant une tâche et en voyant s'ils la terminent. Les auteurs affirment que c'est faux pour les agents proactifs. Au lieu de cela, ils proposent trois nouvelles façons de les noter :
- IDQ (Qualité de la décision d'Insight) : L'agent a-t-il choisi la bonne action au bon moment ?
- Vous a-t-il interrompu alors que vous étiez dans la zone ? Est-il resté silencieux alors que vous aviez besoin d'aide ?
- CGS (Score d'ancrage contextuel) : L'agent avait-il la bonne preuve ?
- S'il a dit « Votre code est cassé », vous a-t-il montré le journal d'erreur spécifique, ou faisait-il simplement des suppositions ?
- LL (Amélioration par apprentissage) : L'agent est-il devenu plus intelligent après que vous lui avez donné un retour ?
- Si vous lui avez dit « Arrêtez de m'embêter avec ça », a-t-il réellement arrêté de vous embêter plus tard ?
5. Le contrôle de réalité actuel
Les auteurs ont examiné les principaux outils de codage disponibles aujourd'hui (comme GitHub Copilot, Cursor, Claude Code, etc.). Ils ont constaté que :
- La plupart sont bloqués au Niveau 2 (Planifié). Ils fonctionnent sur des minuteries ou des déclencheurs.
- Aucun d'entre eux ne dispose actuellement d'un moyen clair de calculer le « coût de l'interruption » pour vous.
- Aucun d'entre eux ne traite explicitement le fait de « rester silencieux » comme un choix intelligent et appris. Ils attendent principalement que vous demandiez.
Résumé
Le document est un appel à l'action. Il dit : « Arrêtez de simplement construire des agents capables de faire du travail. Commencez à construire des agents qui savent quand faire le travail, quand parler et quand se taire. »
Pour y parvenir, nous devons cesser de les mesurer par « tâches accomplies » et commencer à les mesurer par « bon jugement », « preuves » et « apprentissage à partir des retours ». L'objectif est un partenaire de codage qui ressemble moins à un robot et plus à un camarade de travail réfléchi.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.