Autoformalization of Agent Instructions into Policy-as-Code
Cet article introduit un pipeline d'autoformalisation basé sur les LLM qui traduit les instructions et les politiques d'agents en langage naturel en code du langage de politique Cedar formellement vérifié, offrant des garanties de sécurité scalables et rigoureuses qui surpassent à la fois les garde-fous probabilistes et l'application symbolique codée à la main.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez engagé un assistant robotique très intelligent et très rapide pour gérer vos dossiers médicaux. Ce robot est puissant : il peut lire des fichiers, rédiger de nouvelles notes et appeler d'autres outils pour obtenir des informations. Mais parce qu'il est si puissant, s'il est confus ou trompé, il pourrait accidentellement supprimer l'historique d'un patient ou rédiger une ordonnance pour la mauvaise personne.
Le problème des méthodes de sécurité actuelles est comparable à celui de vouloir apprendre la prudence à un enfant en lui disant simplement : « Sois prudent ! » ou en espérant qu'un enseignant remarque s'il fait une bêtise. Parfois, le robot ignore l'avertissement, ou l'enseignant ne remarque rien.
Ce document présente une nouvelle façon de garder le robot en sécurité : la Politique sous forme de Code (Policy-as-Code). Au lieu de simplement dire au robot quoi faire en langage naturel, les auteurs traduisent ces règles en un « livre de lois » strict et mathématique avec lequel le robot ne peut pas discuter.
Voici comment ils ont procédé, en utilisant une analogie créative :
Le « Sandwich de Vérification »
Les auteurs ont construit un système à trois couches pour transformer les instructions humaines désordonnées en lois strictes pour le robot. Ils appellent cela le Sandwich de Vérification.
Le Pain du Bas (La couche de Fondement/Grounding) :
Avant que le robot puisse suivre des règles, il doit connaître les « ingrédients ». Cette couche examine les outils du robot et les objets du monde réel (comme « Patient », « Docteur » ou « Ordonnance ») et crée un dictionnaire strict. Elle garantit que lorsque le robot dit « Patient », il fait référence à une personne réelle dans la base de données, et non à un nom inventé.La Viande (La couche du Modèle) :
C'est ici que se passe la partie « intelligente ». Un grand modèle d'IA (le cerveau du robot) lit les instructions humaines (par exemple : « Ne jamais rédiger une ordonnance sans vérifier les allergies ») et tente de les traduire dans le langage strict du livre de lois (appelé Cedar). Imaginez cela comme un traducteur essayant de transformer un poème en un contrat juridique.Le Pain du Haut (La couche de Sécurité) :
C'est la partie la plus importante. Le livre de lois traduit n'est pas simplement accepté ; il est soumis à un test de torture par deux critiques :- Le Critique Dur (L'avocat du robot) : C'est un programme informatique qui vérifie les erreurs de syntaxe. Il demande : « Cette phrase est-elle grammaticalement correcte ? Se contredit-elle elle-même ? Est-il impossible de la suivre ? » Si le livre de lois contient une faute de frappe, ce critique le rejette immédiatement.
- Le Critique Doux (Le juge humain) : C'est une autre IA qui lit les instructions humaines originales et le nouveau livre de lois pour voir si l'« esprit » est le même. Elle demande : « Est-ce que cette règle stricte signifie réellement ce que l'humain voulait, ou le traducteur a-t-il mal interprété l'intention de la règle ? »
Si le livre de lois passe l'examen des deux critiques, il est approuvé. Sinon, le système boucle, corrige les erreurs et réessaie.
Le Résultat : Un Videur Numérique
Une fois les règles approuvées, elles sont chargées dans un « moteur de politique ». Considérez ce moteur comme un videur à l'entrée d'une boîte de nuit.
- Chaque fois que l'assistant robotique tente de faire quelque chose (comme « Rédiger une ordonnance »), il doit demander la permission au videur.
- Le videur ne se soucie pas de ce que le robot dit ou de ce qu'il pense être une bonne idée. Le videur ne regarde que le livre de lois strict.
- Si l'action enfreint une règle, le videur répond « Non » instantanément. Le robot ne peut pas argumenter pour se justifier, même s'il est victime d'une tentative de piratage.
Ce qu'ils ont testé
Les auteurs ont testé ce système sur un benchmark médical appelé MedAgentBench. Ils ont comparé leur « videur » automatique contre une méthode précédente où des humains devaient écrire manuellement les règles de sécurité.
- L'ancienne méthode : Les humains écrivaient des règles pour 23 scénarios spécifiques. Le robot était sûr pour ces 23 scénarios, mais pouvait enfreindre les 65 autres règles.
- La nouvelle méthode : Leur système a généré automatiquement des règles pour la totalité des 88 scénarios.
- Le résultat : Lorsqu'ils ont tenté de piéger le robot pour le pousser à commettre des erreurs (comme rédiger une ordonnance sans vérifier les allergies), leur système a bloqué les mauvaises actions beaucoup plus souvent que l'ancien système manuel. En fait, lorsque le robot a tenté d'écrire des données sans autorisation, leur système a bloqué ces tentatives 100 % du temps.
Pourquoi cela importe
Le papier soutient que cette approche est plus sûre car :
- Ce n'est pas une supposition : Contrairement aux autres outils de sécurité qui reposent sur la probabilité (ex : « Je pense que c'est sûr à 90 % »), ce système repose sur les mathématiques. Soit l'action est autorisée, soit elle ne l'est pas.
- Il est difficile de le tromper : Comme les règles sont situées en dehors du « cerveau » du robot, un pirate ne peut pas tromper le robot pour qu'il ignore les règles. Le videur est séparé du robot.
- Cela passe à l'échelle : Les humains ne peuvent pas écrire des milliers de règles pour chaque situation possible. Ce système peut traduire automatiquement des milliers de règles en langage naturel en code.
En résumé, le papier démontre qu'en transformant le « S'il vous plaît, soyez prudent » en « Voici la formule mathématique exacte pour être en sécurité », nous pouvons construire des agents d'IA beaucoup plus difficiles à tromper et bien plus fiables dans des environnements à enjeux élevés comme la santé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.