Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents
Trace2Policy introduit un cadre de raffinement itératif des compétences piloté par l'erreur (EISR) qui récupère et améliore systématiquement les règles de décision d'experts en un code Python déterministe de haute précision, surpassant à la fois la distillation statique par LLM et les bases de référence de pur LLM dans les tâches sensibles à la conformité, tout en réduisant considérablement les coûts de raffinement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une entreprise de logistique très occupée où des auditeurs experts passent leurs journées à examiner des milliers de réclamations d'expédition. Ils regardent des photos, lisent des rapports et décident : « Est-ce que ce dommage est la faute du transporteur ou de l'expéditeur ? » Ces experts prennent ces décisions en se basant sur un ensemble complexe de règles mentales non écrites qu'ils ont acquises au fil des années. Ils savent des choses comme : « Si la photo montre une boîte déchirée mais que le système indique "intacte", faites confiance à la photo », ou « Si le réviseur a écrit une note commençant par "C:", cela signifie qu'il est secrètement en train de réattribuer la responsabilité ».
Le problème est que ces règles sont coincées dans la tête des experts. Si vous essayez d'enseigner ce travail à un ordinateur (une IA) simplement en lui montrant quelques exemples, elle s'embrouille. Elle manque les astuces subtiles et cachées que les experts utilisent.
Trace2Policy est un nouveau système conçu pour résoudre cela. Voyez-le comme une « Machine d'extraction et de raffinement de règles ». Voici comment il fonctionne, en utilisant des analogies simples :
1. La phase de détective (Capturer le comportement)
D'abord, le système agit comme un détective silencieux. Il observe les auditeurs experts travailler sur leurs ordinateurs, enregistrant chaque clic, chaque écran qu'ils consultent et chaque note qu'ils tapent. Il ne se contente pas d'enregistrer ce qu'ils ont cliqué ; il essaie de comprendre pourquoi ils l'ont fait.
- Analogie : Imaginez un entraîneur enregistrant un chef cuisinier préparant un plat complexe. L'entraîneur ne se contente pas d'écrire « ajoute du sel » ; il note : « Le chef a goûté la soupe, a froncé les sourcils et a ajouté une pincée de sel parce que le bouillon était trop acide ».
2. La phase de rédaction (La première tentative)
Le système prend ces enregistrements et demande à une IA intelligente de rédiger les règles qu'elle pense que le chef suit.
- Le Problème : Le premier jet est généralement superficiel. Il capture les étapes évidentes (« Vérifier la boîte ») mais manque la logique profonde et cachée (« Vérifier le code actuel, pas le code original, car le système se met à jour en temps réel »).
- Le Résultat : Ce premier jet (appelé « v1 Skills ») est correct, mais il ne parvient à environ 70 % des décisions. C'est comme un étudiant qui a mémorisé le manuel mais qui n'a pas appris les questions pièges de l'examen final.
3. Le moteur « EISR » (La boucle magique)
C'est l'innovation centrale. Le système utilise un processus appelé EISR (Error-driven Iterative Skill Refinement — Raffinement itératif des compétences piloté par l'erreur).
- Comment ça marche : Le système teste les règles ébauchées sur un ensemble de cas de test. Lorsqu'il commet une erreur, il ne se contente pas de dire « Faux ». Il agit comme un éditeur strict :
- Diagnostiquer : Il regroupe les erreurs. S'agit-il d'un manque (« Missing » — aucune règle ne couvre ce cas) ? D'une erreur (« Wrong » — la règle existait mais a donné la mauvaise réponse) ? Ou d'un conflit (« Conflicting » — deux règles se sont opposées) ?
- Corriger (Patch) : Il rédige un correctif spécifique pour ce groupe d'erreurs.
- Vérification de sécurité (La porte de régression) : Avant d'enregistrer le correctif, il teste à nouveau les cas qui étaient corrects auparavant. Si le nouveau correctif casse quelque chose qui fonctionnait déjà, il jette le correctif.
- Analogie : Imaginez un mécanicien réparant le moteur d'une voiture. Chaque fois qu'il resserre un boulon pour corriger un cliquetis, il teste immédiatement le moteur pour s'assurer qu'il n'a pas accidentellement desserré les bougies d'allumage. Il continue ainsi jusqu'à ce que la voiture fonctionne parfaitement sans rien casser d'autre.
4. La découverte des « Règles Pièges » (Trap Rules)
À travers cette boucle, le système a découvert des « Règles Pièges » — des connaissances profondes que personne n'aurait pu écrire lors d'un simple entretien.
- Exemple : Un piège consistait à ce qu'un code spécifique à l'écran puisse ressembler à « Responsabilité Partagée », mais qu'il s'agissait en fait d'une étiquette temporaire qui avait changé de « Dommage d'emballage » cinq minutes auparavant. Les experts savaient qu'il fallait ignorer l'étiquette et regarder l'action entreprise par le réviseur. L'IA n'a appris cela qu'après avoir commis l'erreur de manière répétée et avoir été corrigée.
5. Le produit final : Compilé vs Prompt
L'article fait une affirmation très spécifique et surprenante sur la façon dont les règles sont utilisées :
- La méthode par Prompt : Vous pouvez fournir les règles à une IA sous la forme d'une longue liste d'instructions (un « prompt »). Cela fonctionne, mais c'est comme demander à un génie de résoudre un problème de mathématiques tout en lisant un manuel de 50 pages. Cela réussit environ 70 % du temps.
- La méthode par Compilation : Le système traduit ces règles en un programme informatique strict (code Python). C'est comme transformer le manuel en une calculatrice qui fait simplement le calcul.
- Le Résultat : La version « Compilée » est passée à 79,6 % de précision. L'article soutient que pour ces tâches spécifiques, très riches en règles, la qualité des règles importe plus que l'intelligence de l'IA. Une IA intelligente suivant de mauvaises règles échouera ; un simple ordinateur suivant des règles parfaites réussira.
6. Le « Volant d'inertie » (Auto-amélioration)
Une fois déployé, le système ne s'arrête pas.
- La Boucle : Les auditeurs humains continuent de réviser chaque cas (dans le cadre de leur travail normal). Le système compare sa réponse à celle de l'humain. S'ils ne sont pas d'accord, le système le signale, analyse l'erreur et déclenche automatiquement un nouveau cycle « EISR » pour corriger la règle.
- Coût : Faire cela manuellement prendrait 70 heures par cycle à un expert humain. La version automatisée (Auto-EISR) coûte entre 5 et 10 dollars et ne prend que quelques heures.
Résumé des affirmations
- Ce qu'il fait : Transforme le comportement des experts en règles de décision auto-améliorables.
- Ce qu'il a découvert :
- L'apprentissage en une seule étape (demander à l'IA une seule fois) échoue à capturer les règles profondes et cachées.
- La correction itérative des erreurs (EISR) trouve des « règles pièges » qui augmentent considérablement la précision.
- Pour ces tâches spécifiques, exécuter les règles sous la forme d'un programme informatique strict est bien meilleur que de demander à une IA de lire les règles via un prompt.
- L'ajout d'un « filet de sécurité » par l'IA (laisser l'IA corriger les règles lorsqu'elle n'est pas sûre) a en fait diminué la précision dans ce cas précis, car l'IA était trop encline à rejeter les réclamations, alors que les règles étaient parfaitement ajustées aux besoins spécifiques de l'entreprise.
- Portée : Cela a été testé sur les réclamations de dommages d'une entreprise de logistique (3 349 cas) et sur quelques benchmarks de raisonnement juridique. Les auteurs ne prétendent pas que cela fonctionne pour tous les types de décisions, mais spécifiquement pour les tâches où les experts suivent des règles systématiques et implicites.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.