Can Interpretation Predict Behavior on Unseen Data?
Cet article démontre que les motifs d'attention observés lors de l'entraînement en distribution peut prédire avec succès le comportement hors distribution d'un modèle Transformer, établissant un nouvel objectif d'interprétabilité où l'analyse observationnelle prévoit la fiabilité sous changement de distribution même lorsque les liens mécanistes causaux sont absents.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de comprendre comment un robot mystérieux et super intelligent réfléchit. Pendant longtemps, les scientifiques ont cru que pour vraiment « connaître » le robot, il fallait le piquer, tordre ses fils ou éteindre certaines parties spécifiques pour voir ce qui tombait en panne. C'est comme un mécanicien qui démonte le moteur d'une voiture pour comprendre comment il fonctionne : si vous retirez la bougie d'allumage et que la voiture s'arrête, vous savez que la bougie était essentielle. Dans le monde de l'intelligence artificielle, on appelle cela l'« interprétation causale ». Mais il y a un piège : ces robots sont si complexes que le fait de les piquer donne souvent des réponses confuses, ou bien le robot peut simplement utiliser un plan de secours que vous ne connaissiez pas. C'est là qu'une nouvelle question est apparue : pouvons-nous comprendre un robot simplement en le regardant travailler normalement, sans le démonter ? Plus précisément, pouvons-nous observer comment il gère une tâche qu'il a déjà vue auparavant et deviner comment il se comportera face à une toute nouvelle tâche, bizarre, qu'il n'a jamais vue ? C'est le grand casse-tête que cet article aborde, passant de « casser des choses pour apprendre » à « observer des motifs pour prédire ».
Les chercheurs derrière cette étude ont décidé de jouer à un jeu avec des centaines de petits robots d'IA (appelés Transformers) pour voir s'ils pouvaient prédire le comportement futur des robots en regardant simplement leurs « pensées » pendant qu'ils effectuaient une tâche simple et familière. Ils ont appris aux robots un jeu impliquant des parenthèses, comme (( )) ou ()(). La partie délicate est que le jeu d'entraînement était ambigu : les robots pouvaient gagner soit en comptant simplement le nombre total de parenthèses ouvrantes et fermantes (une règle simple et plate), soit en vérifiant si les parenthèses étaient parfaitement imbriquées les unes dans les autres comme un arbre (une règle hiérarchique complexe). Ces deux règles fonctionnaient parfaitement sur les données d'entraînement.
Ensuite, les chercheurs ont lancé un imprévu. Ils ont donné aux robots un nouvel ensemble de parenthèses qui possédaient le bon compte total mais qui étaient désordonnées d'une manière qui brisait la règle de l'« arbre ». C'était la « donnée non vue ». Certains robots s'en sont tenus à la règle simple du comptage et ont échoué au nouveau test. D'autres ont compris la règle de l'arbre et ont réussi. La grande question était : les chercheurs pouvaient-ils observer l'« attention » interne des robots (les parties de la phrase sur lesquelles le robot se concentrait) pendant qu'ils jouaient encore au vieux jeu facile pour prédire quel type de règle ils utiliseraient sur le nouveau jeu difficile ?
La réponse est un « oui » surprenant. L'équipe a découvert qu'en observant simplement comment les robots se concentraient sur les parenthèses pendant le jeu facile, ils pouvaient prédire avec une grande précision si le robot réussirait ou échouerait sur les nouvelles données complexes. C'est comme regarder un élève résoudre un problème de mathématiques sur une fiche d'exercices ; si vous voyez qu'il utilise un raccourci spécifique et astucieux sur les problèmes faciles, vous pouvez deviner qu'il utilisera cette même logique astucieuse sur le test difficile, même si vous n'avez pas encore vu le test.
Cependant, l'article a également découvert quelque chose qui remet en question notre façon habituelle de concevoir la « compréhension » d'une machine. Habituellement, si nous voyons un robot utiliser une partie spécifique de son cerveau pour résoudre un problème, nous supposons que cette partie est la cause de la solution. Mais ici, les chercheurs ont découvert que parfois, l'indice que nous avons vu (un motif d'attention spécifique) n'était pas en réalité le moteur de la réussite. Dans certains cas, le robot utilisait un motif qui nuisait en fait à sa performance, mais parce qu'il était corrélé aux robots intelligents, les chercheurs l'ont tout de même utilisé pour faire une prédiction correcte. C'est comme voir un porte-bonheur sur un cheval gagnant ; le porte-bonheur n'a pas fait courir le cheval vite, mais si vous avez vu le porte-bonheur, vous pouviez quand même deviner correctement que le cheval gagnerait.
Les auteurs soutiennent explicitement l'idée que vous ne devez pas nécessairement casser la machine (intervention causale) pour la comprendre. Ils montrent que si casser la machine est une façon d'apprendre, ce n'est pas la seule, et que cela peut parfois être trompeur. Dans leurs simulations, ils ont découvert que supprimer les motifs du « porte-bonheur » rendait parfois le robot plus performant, prouvant ainsi que le motif n'était pas la cause du succès, bien qu'il soit un prédicteur parfait de celui-ci.
Alors, quelle est la conclusion ? L'article suggère une nouvelle façon de juger l'IA : au lieu de simplement demander « Avons-nous trouvé la cause exacte ? », nous devrions demander « Pouvons-nous prédire ce qui va se passer ensuite ? ». Si nous pouvons observer les motifs internes d'une IA sur des données familières et deviner avec précision comment elle gérera l'inconnu, c'est une forme puissante de compréhension, même si nous ne comprenons pas entièrement le « pourquoi » mécanique derrière cela. Les chercheurs ont mené ces expériences sur 270 modèles différents et ont constaté que cette approche prédictive fonctionne de manière cohérente, offrant un nouvel outil pour détecter quand l'IA pourrait échouer dans le monde réel avant même de la déployer. Ils ne prétendent pas avoir résolu le mystère de la conscience de l'IA ou posséder une carte parfaite de chaque connexion neuronale, mais ils ont prouvé que regarder la « danse » des données peut en dire long sur le prochain mouvement du danseur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.