Provably Auditable and Safe LLM Agents from Human-Authored Ontologies
Cet article introduit Agentic Redux, une architecture d'agent LLM prouvablement correcte et auditable basée sur le lambda-calcul typé et des ontologies rédigées par l'humain, démontrant son application dans la conformité de la facturation de santé et la divulgation de vulnérabilités de sécurité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous dirigiez une opération très importante, de haut niveau, comme un service de facturation hospitalière ou une équipe de sécurité traquant des bugs logiciels. Vous engagez une équipe d'assistants IA super intelligents (LLM) pour vous aider. Mais il y a un problème : ces IA sont brillantes mais imprévisibles. Elles peuvent parfois « halluciner » (inventer des choses), elles ne sont pas toujours d'accord entre elles, et si on les laisse à elles seules, elles pourraient accidentellement briser les règles de l'univers que vous avez construit pour elles.
Ce document présente une nouvelle façon d'organiser ces assistants IA appelée Agentic Redux. Voyez cela non pas comme une nouvelle IA, mais comme une nouvelle structure de gestion qui garantit la sécurité et crée un enregistrement parfait et immuable de chaque décision prise.
Voici comment cela fonctionne, décomposé en concepts simples :
1. Le Problème : Le désastre du « Write Skew » (Décalage d'écriture)
Imaginez deux employés, Alice et Bob, qui gèrent un budget partagé de 100 000 $.
- Alice voit qu'il lui reste 45 000 $ et décide de les dépenser.
- Bob voit qu'il lui reste 60 000 $ et décide de les dépenser.
- Ils agissent tous les deux en même temps, sans savoir ce que fait l'autre.
- Résultat : Le système dépense 105 000 $. Le budget est rompu.
En informatique, on appelle cela un « Write Skew ». Dans le monde réel, cela se produit lorsque des agents IA agissent de manière indépendante sans avoir une vision d'ensemble. Les solutions actuelles consistent souvent à demander simplement à une IA : « Est-ce que c'est correct ? » et à espérer qu'elle réponde oui. Si l'IA passe une mauvaise journée, elle pourrait dire oui alors qu'elle devrait dire non, et le dommage est fait.
2. La Solution : Le « Conteneur Intelligent » (Agentic Redux)
L'auteur propose une structure inspirée d'une conception logicielle populaire appelée Redux. Imaginez une entreprise où :
- Les Travailleurs (sous-agents) : Ce sont les assistants IA. Ils ne voient qu'une infime partie du monde (leur « état local »). Ils peuvent réfléchir, calculer et proposer des actions, mais ils ne peuvent pas modifier le monde directement. Ils sont comme des « composants stupides ».
- Le Manager (méta-agent) : C'est un décideur central qui voit l'état global entier (tout le budget, toutes les règles, tout l'historique).
- Le Processus :
- Un travailleur propose une action (ex : « Dépenser 45 000 $ »).
- La proposition est envoyée au Manager.
- Le Manager vérifie la proposition par rapport à une liste d'Invariants (des règles inviolables, comme « Les dépenses totales ne peuvent pas dépasser 100 000 $ »).
- Si la règle est respectée, le Manager approuve le changement. Sinon, le Manager le rejette.
- Le Manager met à jour le monde et informe les travailleurs de la nouvelle réalité.
La Magie : Le papier prouve mathématiquement (en utilisant une branche de la logique appelée « lambda-calcul typé ») que tant que le Manager respecte les règles, il est impossible que le système enfreigne les règles, peu importe l'absurdité ou les hallucinations des propositions des travailleurs. L'architecture elle-même agit comme un filet de sécurité.
3. Le Grand Livre « Boîte Noire » (Auditabilité Linéaire)
Chaque fois que le Manager prend une décision, il l'inscrit dans un cahier spécial.
- S'il dit « Oui » : Il écrit le nouvel état et une preuve que les règles ont été respectées.
- S'il dit « Non » : Il écrit la proposition, la raison du rejet et la règle qui aurait été enfreinte.
- La Règle : Ce cahier est en ajout uniquement (append-only). Vous pouvez ajouter de nouvelles pages, mais vous ne pouvez jamais arracher ou effacer les anciennes.
Cela crée une « piste d'audit linéaire ». Si un auditeur vient plus tard, il peut consulter le cahier et voir, dans un ordre chronologique parfait, exactement pourquoi chaque décision a été prise. Il peut vérifier que le système n'a jamais enfreint les règles.
4. Comment construire ces systèmes : « Conception par l'Ontologie d'abord »
On ne peut pas appliquer cette architecture à n'importe quel problème. Il faut d'abord comprendre profondément le problème. L'auteur suggère une méthode appelée Conception d'Agent par l'Ontologie d'abord (Ontology-First Agent Design) :
- Cartographier le Territoire : Un expert humain utilise un outil de cartographie standard (appelé Basic Formal Ontology) pour dessiner une carte précise du monde du problème (ex : « Qu'est-ce qu'un patient ? Qu'est-ce qu'un test de dépistage ? Quelles sont les règles ? »).
- Assigner des Rôles : On demande à une IA de regarder cette carte et de suggérer quels « métiers » (rôles) doivent être accomplis.
- Construire l'Équipe : L'IA transforme ces métiers en code pour les travailleurs (sous-agents) et le Manager (méta-agent).
Le papier a testé cela sur deux problèmes du monde réel :
- Facturation de soins de santé : S'assurer que les demandes de remboursement d'assurance respectent les règles gouvernementales complexes concernant les tests de dépistage.
- Vulnérabilités de sécurité : Gérer le processus de découverte et de divulgation de bugs logiciels sans provoquer de panique ou enfreindre les lois.
Dans les deux cas, le système a réussi à prévenir les erreurs de « Write Skew » qui se seraient produites si les agents avaient agi seuls.
5. La Soupape de Sécurité Humaine (La File d'Attente des Conseillers)
Et si les règles sont trop complexes pour que le Manager puisse décider, ou si une situation nécessite un jugement humain ?
Le système dispose d'une File d'Attente des Conseillers (Counselor Queue). Si le Manager est bloqué ou rencontre une situation où les règles disent « Demander à un humain », la proposition est mise en pause et placée dans une file pour un expert humain.
- L'humain examine la situation et prend une décision.
- Crucialement, même l'humain doit inscrire sa décision dans le même cahier immuable, en expliquant son choix.
- Le papier prouve que même avec l'humain dans la boucle, le système reste auditable et sûr, à condition que les humains respectent le format.
Résumé
Ce papier ne prétend pas rendre l'IA plus intelligente. Il prétend la rendre plus sûre et plus digne de confiance en la plaçant dans une cage avec un manager très strict.
- L'IA fait la réflexion et propose.
- L'Architecture (le Manager) fait la vérification et l'application.
- Le Grand Livre enregistre tout pour toujours.
Le résultat est un système où vous pouvez prouver mathématiquement que les « mauvaises choses » (comme briser le budget ou violer des réglementations) ne peuvent pas arriver par accident, et si un humain doit intervenir, sa décision est enregistrée avec une transparence totale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.