← Derniers articles
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

Ce papier présente « Formal Skill », une abstraction native d'exécution qui remplace les instructions informelles en langage naturel par des machines à états exécutables et des schémas JSON afin d'améliorer l'efficacité, la précision et l'exécutabilité des agents LLM, comme le démontre les performances supérieures du framework open-source FairyClaw sur le Harness-Bench.

Auteurs originaux : Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous embauchiez un stagiaire très intelligent et très rapide (l'agent IA) pour résoudre un problème complexe dans votre bureau, comme réparer un logiciel défectueux.

L'Ancienne Méthode : Le Manuel « Mur de Texte »

Actuellement, la plupart des agents IA fonctionnent ainsi : vous leur donnez un manuel d'instructions massif et détaillé, rédigé en anglais courant (une « Compétence de Prompt »). Il indique des choses comme : « D'abord, examinez le journal d'erreurs. Ensuite, essayez de corriger le code. Assurez-vous de ne pas supprimer les fichiers de test. Si vous échouez, réessayez. Une fois terminé, rédigez un rapport. »

L'article qualifie cela de « Compétence Informelle ». Elle présente trois gros problèmes :

  1. C'est coûteux : L'IA doit lire ce manuel énorme à chaque fois qu'elle effectue une étape. Cela coûte beaucoup de « jetons » (la monnaie de la puissance de calcul de l'IA).
  2. C'est vague : L'IA doit deviner ce que signifient réellement « réessayez » ou « ne supprimez pas ». C'est comme dire à un humain « Faites attention », sans définir à quoi ressemble la « prudence ».
  3. C'est fragile : Si l'IA fait une erreur, elle doit revenir en arrière dans tout l'historique de la conversation pour se souvenir où elle en était. Elle n'a pas de « liste de contrôle » intégrée pour savoir si elle a terminé ou si elle doit revenir à une étape précédente.

La Nouvelle Méthode : La « Compétence Formelle »

Les auteurs proposent une nouvelle approche appelée « Compétence Formelle ». Au lieu de donner à l'IA un long manuel textuel, ils lui fournissent une boîte à outils programmable.

Pensez-y comme à une mise à niveau consistant à donner à un chef un livre de recettes de 50 pages, puis à lui offrir une cuisine intelligente dotée de fonctions de sécurité intégrées :

  • La Recette est du Code, pas du Texte : Au lieu de lire des paragraphes, l'IA interagit avec des boutons spécifiques (outils) et suit un organigramme strict (machine à états).
  • Le Système de « Crochet » (Hook) : Imaginez un videur à l'entrée d'un club (le « Crochet »). Selon l'étape du travail dans laquelle se trouve l'IA, le videur décide quelles portes sont ouvertes.
    • Étape 1 (Investigation) : Le videur n'ouvre que la porte vers les « Outils de Recherche ». La porte « Supprimer » est verrouillée.
    • Étape 2 (Correction) : Le videur ouvre l'« Outil de Patch » mais verrouille à nouveau la porte « Supprimer ».
    • Étape 3 (Vérification) : Le videur ne laissera pas l'IA quitter la pièce tant qu'elle n'a pas présenté un certificat « Validé » émis par la machine de test.
  • La Machine à États : L'IA n'a pas à se souvenir de toute l'histoire. Elle possède simplement un petit badge numérique indiquant : « Je suis actuellement dans la phase de 'Correction' ». Si elle tente de sauter directement à « Rapport » avant que la « Correction » ne soit terminée, le système l'arrête automatiquement.

Le Moteur « FairyClaw »

Pour rendre cela fonctionnel, les auteurs ont construit un nouveau moteur appelé FairyClaw. Vous pouvez considérer FairyClaw comme le manager intelligent qui dirige le spectacle.

  • Il ne se contente pas de discuter avec l'IA ; il gère activement les outils et les règles de l'IA.
  • Il décompose les gros travaux en sous-tâches plus petites et attribue la bonne « Compétence Formelle » à chacune d'elles.
  • Il maintient un journal en temps réel indiquant exactement où en est l'IA, ce qu'elle a fait et ce qu'elle doit encore faire, afin que l'IA ne se perde jamais.

Les Résultats : Plus Rapide, Moins Cher et Plus Sûr

Les auteurs ont testé ce système (FairyClaw) contre d'autres systèmes d'agents IA populaires en utilisant un test rigoureux appelé Harness-Bench.

  • Le Score : FairyClaw a performé aussi bien, voire mieux, que les autres systèmes pour accomplir réellement le travail.
  • Le Coût : C'est la grande victoire. FairyClaw a utilisé 48 % de jetons en moins (argent/puissance de calcul) que la moyenne des autres systèmes.
    • Analogie : Si les autres systèmes étaient comme un camion de livraison faisant le tour de la ville en lisant à haute voix une carte massive au conducteur à chaque tournant, FairyClaw est comme un GPS qui ne montre au conducteur que le prochain virage et garde le reste de la carte caché jusqu'à ce qu'il soit nécessaire.
  • Le Test « Réparation de Code » : Sur une tâche spécifique consistant à corriger du code bogué, FairyClaw a été le grand gagnant. Parce que la « Compétence Formelle » a forcé l'IA à vérifier son travail avant de terminer, elle n'a pas commis les erreurs bêtes que les autres agents ont faites.

Résumé

L'article soutient que nous devrions cesser de traiter les compétences de l'IA comme de longs manuels d'instructions flous et commencer à les traiter comme des protocoles logiciels stricts et exécutables. En déplaçant les règles du « texte que l'IA lit » vers le « code que l'IA exécute », nous obtenons des agents moins chers à faire fonctionner, plus difficiles à tromper et meilleurs pour suivre des procédures complexes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →