Extremely coarse learning objectives induce human-aligned representations in AI vision models
Cette étude démontre que l'entraînement de modèles de vision par IA avec des objectifs d'apprentissage extrêmement grossiers, tels que la distinction de seulement huit catégories larges, produit des représentations internes qui s'alignent plus étroitement avec les réponses neurales et les jugements perceptuels humains que les modèles entraînés sur des tâches fines ou auto-supervisées.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Depuis des décennies, les scientifiques tentent de comprendre comment le cerveau humain transforme un déluge de lumière en une image claire du monde. Ils soupçonnent depuis longtemps que la réponse réside dans la manière dont notre système visuel organise l'information, triant le chaos de la nature en catégories nettes telles que « animal », « outil » ou « véhicule ». Pour tester ces idées, des chercheurs ont construit des systèmes d'intelligence artificielle qui imitent la structure du cerveau, en les entraînant à reconnaître des milliers d'objets spécifiques. Ces cerveaux numériques sont devenus des outils puissants, mais une question persistante demeurait : le cerveau a-t-il réellement besoin d'apprendre un si grand nombre d'étiquettes spécifiques pour construire une compréhension humaine de la vision ? Peut-être que le secret pour voir comme un humain ne réside pas dans la mémorisation d'une encyclopédie massive d'objets, mais dans l'apprentissage d'une manière beaucoup plus simple et plus large de trier le monde.
Une équipe de chercheurs de l'université Johns Hopkins s'est donné pour mission de tester cette possibilité en supprimant la complexité de l'entraînement standard de l'IA. Au lieu d'enseigner à leurs réseaux artificiels à distinguer mille catégories différentes d'images, comme c'est la pratique courante, ils leur ont appris à trier les mêmes images en seulement quelques groupes très larges. Ils n'ont pas utilisé d'étiquettes créées par l'homme pour ces groupes ; au lieu de cela, ils ont laissé l'ordinateur trouver ses propres divisions naturelles au sein des données, créant des catégories qui pourraient séparer les « êtres vivants » des « machines » ou les « scènes intérieures » des « scènes extérieures ». Ils ont ensuite entraîné des centaines de ces réseaux, faisant varier le nombre de groupes de seulement deux jusqu'à soixante-quatre, et ont comparé la manière dont les cerveaux numériques résultants correspondaient à l'activité réelle du cerveau humain et au comportement des observateurs humains.
Les résultats ont été surprenants. Les chercheurs ont découvert que les réseaux entraînés sur ces catégories extrêmement simples et grossières développaient des cartes internes du monde visuel qui étaient tout aussi bonnes, et souvent meilleures, pour correspondre à l'activité du cerveau humain que les réseaux entraînés sur les mille catégories complètes. Lorsqu'ils ont mesuré la capacité de ces cerveaux artificiels à s'aligner sur les scanners du cortex visuel humain et sur les enregistrements des cerveaux de macaques, les modèles entraînés sur seulement huit groupes larges étaient au même niveau que les modèles les plus complexes. Plus frappant encore, ces réseaux simples correspondaient mieux aux jugements humains sur la similitité entre les objets que n'importe quel autre modèle testé, y compris les systèmes d'intelligence artificielle les plus avancés disponibles aujourd'hui.
Cette découverte remet en question l'idée prédominante selon laquelle, pour construire une machine qui voit comme un humain, il faut l'entraîner sur une liste massive et détaillée de noms d'objets spécifiques. L'étude suggère que le système visuel humain ne nécessite peut-être pas une tâche de classification fine à mille voies pour développer sa compréhension sophistiquée du monde. Au lieu de cela, la capacité de regrouper des images en grappes larges et significatives semble être suffisante pour générer une représentation de la vision qui reflète la nôtre. Les chercheurs ont démontré que cet effet est vrai pour différents types d'architectures de réseaux neuronaux, des conceptions plus anciennes et simples aux systèmes modernes et complexes, et qu'il fonctionne même lorsque les données d'entraînement sont limitées.
L'équipe a également exploré si la manière spécifique dont ces catégories larges ont été créées importait. Ils ont constaté que les résultats restaient valables, que les catégories soient dérivées des motifs statistiques des images elles-mêmes ou définies par des concepts clairs et compréhensibles par l'homme comme « naturel versus artificiel » ou « petit versus grand ». Cela indique que le facteur clé est la grossièreté de l'objectif d'apprentissage lui-même, plutôt que les étiquettes spécifiques utilisées. L'étude a également montré que ces réseaux entraînés de manière grossière n'apprenaient pas simplement une version simplifiée de ce qu'un réseau complexe apprend ; ils développaient une façon fondamentalement différente d'organiser l'information visuelle qui se trouvait être plus proche de la perception humaine.
En montrant qu'un objectif d'apprentissage étonnamment simple peut produire une vision alignée sur l'humain, ce travail recadre notre compréhension de ce qui est nécessaire pour qu'une machine voie. Cela suggère que la voie vers une intelligence artificielle qui reflète véritablement la perception humaine ne réside peut-être pas dans le fait de lui fournir plus de données ou des tâches plus complexes, mais dans le fait de lui apprendre à voir le monde en termes plus larges et plus fondamentaux. Les conclusions ouvrent une nouvelle voie pour la construction de systèmes d'IA qui ne sont pas seulement puissants, mais véritablement alignés avec la façon dont les êtres humains perçoivent et organisent leur expérience visuelle.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.