Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations
Cet article passe en revue les approches d'explicabilité locale et d'interprétabilité mécaniste pour les grands modèles de langage basés sur les Transformers, présente des études expérimentales sur leur application dans la santé et la conduite autonome afin d'évaluer les implications en matière de confiance, et expose les défis et opportunités futurs pour générer des explications alignées sur l'humain et dignes de confiance.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez les modèles de langage de grande taille (LLM) comme des chefs de cuisine incroyablement talentueux, mais quelque peu mystérieux, dans une cuisine immense. Ils peuvent concocter une recette parfaite, écrire un poème complexe ou diagnostiquer un problème médical simplement en lisant une consigne. Mais voici le hic : personne ne sait exactement comment ils font. Vous demandez un plat, et il sort un repas délicieux, mais vous n'avez aucune idée s'ils ont réellement suivi la recette, s'ils ont simplement deviné en se basant sur l'odeur de la cuisine, ou s'ils ont accidentellement ajouté un ingrédient empoisonné (une « hallucination ») qui ressemble à du persil.
Ce document est comme une équipe de critiques culinaires et d'inspecteurs de cuisine essayant de comprendre comment rendre ces chefs fiables. Ils veulent savoir : Pouvons-nous obtenir que le chef explique son processus de cuisine d'une manière qui nous semble cohérente, afin que nous sachions si c'est sûr à consommer ?
Voici la décomposition de leur enquête, en utilisant des analogies simples :
1. Les deux façons d'expliquer l'esprit du chef
Le document indique qu'il existe deux manières principales d'essayer de comprendre ces chefs IA :
L'explicabilité locale (L'approche « Pourquoi avez-vous fait ce plat ? ») :
Il s'agit de demander au chef d'expliquer un repas spécifique qu'il vient de préparer.- Langage naturel : Le chef dit : « J'ai ajouté du sel parce que la soupe manquait de saveur. » (Le document avertit : Parfois, le chef invente simplement une histoire pour paraître intelligent, même si la vraie raison était différente.)
- Chaîne de pensée (Chain-of-Thought) : Le chef détaille ses étapes : « D'abord, j'ai coupé l'oignon, puis je l'ai fait revenir... » (Le document avertit : Parfois, le chef fait simplement semblant de réfléchir étape par étape, alors qu'en réalité, il a deviné la réponse instantanément.)
- Récupération (RAG) : Le chef sort un livre de cuisine ou une fiche de référence pour prouver d'où il a tiré la recette. C'est la méthode la plus fiable car elle pointe vers une source réelle.
- Attribution de caractéristiques (Feature Attribution) : Le chef désigne les ingrédients spécifiques sur le plan de travail et dit : « Ces trois oignons étaient la partie la plus importante de cette soupe. »
L'interprétabilité mécaniste (L'approche « Comment la cuisine fonctionne-t-elle ? ») :
Il s'agit de regarder à l'intérieur du cerveau du chef pour voir les engrenages et les fils.- Imaginez que le cerveau du chef est un immense circuit imprimé. Les chercheurs essaient de trouver des « circuits » spécifiques (groupes de neurones) qui accomplissent des tâches précises. Par exemple, ils ont trouvé un circuit spécifique qui aide le chef à reconnaître des motifs, comme savoir que « Mr Dursley » précède généralement « Dursley » dans une histoire.
- Le Problème : La cuisine est si vaste et complexe que les circuits sont emmêlés. Un fil peut accomplir trois tâches différentes à la fois (comme un couteau suisse), ce qui rend très difficile de comprendre exactement ce qui se passe.
2. Le danger des explications « fausses »
Le document met en évidence un problème majeur : la confabulation.
Parfois, le chef est si doué pour parler qu'il peut vous convaincre qu'il a suivi un chemin logique, alors qu'en réalité, il a simplement deviné la réponse.
- L'analogie : Imaginez un étudiant passant un examen de mathématiques. Il obtient la bonne réponse (12), mais lorsqu'on lui demande de montrer son raisonnement, il écrit un calcul fictif qui semble logique mais qui est en fait faux. La réponse est juste, mais le raisonnement est un mensonge.
- Le document montre que dans des domaines critiques comme la santé (diagnostic de la maladie de Crohn) et la conduite autonome (s'arrêter à un feu rouge), cela est dangereux. Si un médecin fait confiance à une explication fausse provenant d'une IA, il pourrait prendre une mauvaise décision. Si une voiture autonome « pense » voir un panneau stop alors qu'elle hallucine, elle pourrait provoquer un accident.
3. Tester le chef avec des « tests de résistance »
Comment savoir si le chef dit la vérité ? Le document suggère que nous devons le soumettre à des tests de résistance (stress tests).
- L'analogie : Au lieu de simplement demander : « Pourquoi vous êtes-vous arrêté ? » (ce à quoi le chef pourrait répondre facilement), demandez : « Qu'auriez-vous fait si le feu était vert mais qu'un piéton traversait ? » ou « Et si la voiture devant vous était bleue au lieu de rouge ? »
- Si le chef donne une réponse cohérente et logique à ces questions « et si » délicates, nous pouvons davantage lui faire confiance. S'il s'embrouille ou invente une histoire, il n'est pas prêt pour le monde réel.
4. Adapter l'explication à l'audience
Tout le monde n'a pas besoin de connaître les mêmes détails sur le processus de cuisine. Le document suggère trois niveaux d'explication :
- Pour le grand public (Grossier/Coarse) : « Je me suis arrêté parce que le feu était rouge. » (Simple, facile à comprendre).
- Pour le médecin/l'expert (Du grossier au fin / Coarse-to-Fine) : « Je me suis arrêté parce que le feu était rouge, et plus précisément, le capteur a détecté un piéton dans le passage clouté à 3 mètres. » (Commence par le simple, puis donne les preuves spécifiques).
- Pour l'ingénieur (Fin/Fine) : « Le circuit neuronal responsable de la « détection de feu rouge » s'est activé, déclenchant la voie de « freinage ». » (Détails techniques profonds pour ceux qui ont construit la cuisine).
5. Les 8 règles pour un chef digne de confiance
Enfin, le document propose que pour qu'une IA soit véritablement digne de confiance, ses explications doivent suivre 8 règles (basées sur un cadre appelé TrustLLM) :
- Vérité (Truthfulness) : Ne pas mentir ou inventer des choses.
- Sécurité (Safety) : Ne pas donner de conseils dangereux (comme « mangez ce poison »).
- Robustesse (Robustness) : Ne pas être perturbé par des questions complexes.
- Équité (Fairness) : Ne pas être biaisé contre certains groupes de personnes.
- Confidentialité (Privacy) : Ne pas révéler accidentellement des informations secrètes.
- Éthique de la machine (Machine Ethics) : Faire ce qui est juste, même quand personne ne regarde.
- Transparence (Transparency) : Être ouvert sur votre mode de fonctionnement.
- Responsabilité (Accountability) : Être capable d'assumer la responsabilité en cas d'erreur.
L'essentiel
Le document conclut que bien que ces chefs IA soient extraordinaires, ils sont actuellement trop mystérieux pour faire totalement confiance à leurs décisions dans des situations de vie ou de mort. Nous avons besoin de meilleures façons de vérifier leur travail, de s'assurer qu'ils ne font pas que « parler pour ne rien dire », et de garantir que leurs explications sont honnêtes, précises et adaptées à la personne qui pose la question. Tant que nous ne pourrons pas le faire, nous devrons nous méfier avant de les laisser conduire nos voitures ou diagnostiquer nos patients.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.