← Derniers articles
🤖 AI

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

Ce papier présente les Agents Multimodaux Porteurs de Preuve (ECA), une architecture sécurisée qui prévient les échecs d'autorisation dus aux hallucinations en exigeant que les appels d'outils soient validés par rapport à des certificats de preuve externes typés plutôt que de se fier aux affirmations perceptuelles non vérifiées du modèle.

Auteurs originaux : Guijia Zhang, Hao Zheng, Harry Yang

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Guijia Zhang, Hao Zheng, Harry Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant personnel très intelligent, mais légèrement crédule. Cet assistant peut examiner des captures d'écran, lire des e-mails et naviguer sur le web pour vous aider à effectuer des tâches telles que l'envoi d'argent, le clic sur des boutons ou l'extraction de données.

Le problème est que cet assistant hallucine parfois. Il pourrait vous dire avec assurance : « Je vois un bouton indiquant 'Envoyer 500 $ à mon ami' », alors qu'en réalité, ce bouton n'existe pas, ou qu'il s'agit en fait d'un piège tendu par un pirate informatique.

Par le passé, si l'assistant commettait une erreur, il s'agissait simplement d'une « mauvaise réponse ». Mais lorsque cet assistant est connecté à de véritables outils (comme un virement bancaire ou un client de messagerie), une hallucination n'est plus seulement une erreur : elle devient une faille de sécurité. L'assistant croit à un fait faux, et parce qu'il y croit, il exécute une action dangereuse.

Ce document présente un nouveau système appelé ECA (Agents Multimodaux Porteurs de Preuves) pour résoudre ce problème. Voici comment il fonctionne, en utilisant des analogies simples :

1. Le Problème : Le « Manager Crédule »

Considérez un agent IA standard comme un Manager assis dans une pièce.

  • Le Manager examine un document (l'écran) et déclare : « Je vois un bouton 'Payer' ici. Je vais cliquer dessus. »
  • Si le document est une fausse image créée par un pirate informatique, le Manager voit toujours un bouton « Payer » car l'IA imagine qu'il est présent.
  • Le Manager clique alors sur le bouton, et l'argent est volé. Le Manager n'a pas suivi un ordre malveillant ; il a simplement halluciné l'autorisation d'agir.

2. La Solution : L'« Agent Porteur de Preuves »

Les auteurs proposent une nouvelle architecture où le Manager n'est plus le seul à avoir le pouvoir. Ils ajoutent un Garde de Sécurité et un Notaire.

  • Le Manager (L'IA) : Continue de réfléchir. Il examine l'écran et dit : « Je pense que nous devrions cliquer sur ce bouton. »
  • Le Notaire (Les Vérificateurs) : Avant que le Manager ne puisse réellement cliquer sur le bouton, un système séparé et strict (le Notaire) vérifie l'écran en utilisant différents outils (comme une loupe pour le texte, un scanner pour le code et une carte pour la mise en page).
  • Le Certificat : Le Notaire ne se contente pas de dire « D'accord ». Il délivre un certificat numérique. Ce certificat est un reçu dactylographié et immuable qui indique : « Je, le Notaire, confirme qu'un bouton portant l'étiquette 'Payer' existe réellement à ces coordonnées exactes. »

3. La « Porte » (Le Videur)

Il existe une Porte entre le Manager et l'action.

  • Le Manager ne peut pas ouvrir la porte simplement en disant : « Je crois que le bouton est là. »
  • La Porte ne s'ouvre que si le Manager présente le Certificat du Notaire.
  • Si le Manager tente de dire : « J'ai vu un bouton », mais que le Notaire n'a pas émis de certificat à ce sujet, la Porte reste verrouillée. L'action est bloquée.

4. Pourquoi C'est Différent

  • Ancienne Méthode : La parole de l'IA faisait loi. Si l'IA disait « Je vois un virement bancaire », le système l'exécutait.
  • Nouvelle Méthode (ECA) : La parole de l'IA n'est qu'une suggestion. Le système n'agit que si des preuves indépendantes (comme une analyse du code réel de la page web) prouvent que la suggestion est vraie.

Les Résultats : Dans quelle mesure cela a-t-il fonctionné ?

Les chercheurs ont testé ce système contre des milliers d'attaques, y compris des pirates tentant de tromper l'IA avec de fausses images, du texte caché et des symboles confus.

  • Le « Manager Crédule » (Ancienne IA) : A échoué dans près de 100 % des cas. Si l'IA hallucinait une action dangereuse, elle l'exécutait.
  • La Défense « Par Prompt Seulement » (Demander simplement à l'IA d'être prudente) : A échoué environ 50 % du temps. L'IA était toujours trompée par ses propres hallucinations.
  • Le Nouveau Système (ECA) :
    • Il a bloqué 100 % des actions non sécurisées lors de leurs tests de bout en bout.
    • Même lorsque les pirates tentaient de tromper directement le « Notaire » (le vérificateur), le système disposait d'un processus de « durcissement » qui a réduit le taux d'échec à presque zéro (passant de 1,3 % lors des tests initiaux à 0 % lors des tests finaux).
    • Il n'a pas empêché l'IA d'accomplir des tâches utiles ; il a permis à 100 % des tâches normales et sûres de se dérouler.

La Grande Conclusion

L'article soutient que nous ne pouvons pas nous fier au « cerveau » de l'IA pour décider s'il est sûr d'agir. L'IA est trop encline à inventer des choses. Au lieu de cela, nous avons besoin d'un contrôle structurel : un système séparé qui vérifie physiquement les faits avant d'autoriser toute action.

C'est comme dire : « Vous ne pouvez pas simplement dire que vous avez un billet pour monter dans l'avion. Vous devez montrer un billet physique imprimé par le système de l'aéroport. » Si vous n'avez pas le billet physique, la porte ne s'ouvre pas, peu importe à quel point vous affirmez avec assurance en avoir un.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →