← Derniers articles
🧬 biology

Toward a mechanistic understanding of inference in visual cortex and diffusion models

Cet article présente un modèle de diffusion minimal et interprétable basé sur le codage parcimonieux avec des interactions par paires qui imite les connexions horizontales de V1 afin d'atteindre une haute performance de débruitage d'image tout en fournissant des aperçus mécanistes tant sur l'inférence perceptuelle biologique que sur le fonctionnement interne des architectures de diffusion de type boîte noire.

Auteurs originaux : Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

Publié 2026-07-20
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Le travail de détective du cerveau et la machine à rêves de l'IA

Imaginez que vous essayiez de résoudre un mystère, mais que les indices soient éparpillés, flous et qu'une partie d'entre eux soit manquante. C'est exactement ce qui se passe chaque fois que vous regardez le monde. Vos yeux ne prennent pas simplement une photographie parfaite ; ils reçoivent un mélange désordonné de lumière et d'ombres. Pour donner un sens à tout cela, votre cerveau doit agir comme un détective, comblant les lacunes et devinant à quoi ressemble l'image complète. Ce processus est appelé « inférence perceptuelle ». Depuis des décennies, les scientifiques se demandent comment le cerveau y parvient avec autant d'aisance. Ils savent que les neurones du cortex visuel (la partie du cerveau qui voit) sont connectés de manières spécifiques, comme un réseau d'amis qui se parlent pour se mettre d'accord sur ce qu'ils voient.

Parallèlement, un nouveau type d'intelligence artificielle appelée « modèle de diffusion » est devenue célèbre pour créer des images époustouflantes. Ces systèmes d'IA fonctionnent en partant d'un bruit statique pur — comme la neige sur un vieux téléviseur — et en le nettoyant lentement jusqu'à ce qu'une image claire émerge. Ils sont incroyablement doués pour cela, mais ce sont aussi des « boîtes noires ». Nous savons qu'ils fonctionnent, mais nous ne savons pas vraiment comment les millions de minuscules neurones numériques à l'intérieur d'eux décident de ce à quoi un chien ou un visage devrait ressembler. La grande question est la suivante : le cerveau et ces modèles d'IA utilisent-ils les mêmes astuces secrètes pour résoudre l'énigme de la vision ? Si nous pouvons comprendre les règles que suit l'IA, peut-être pourrons-nous enfin comprendre comment nos propres cerveaux fonctionnent.

La grande idée de l'article : Un modèle simple avec un grand cerveau

Cet article présente un nouveau modèle simplifié qui tente de jeter un pont entre la façon dont notre cerveau voit et la façon dont l'IA génère des images. Les auteurs, une équipe de chercheurs de l'UC Berkeley et d'autres institutions, ont construit un programme informatique qui imite le cortex visuel primaire (V1), la première étape de l'information visuelle dans le cerveau. Au lieu d'utiliser un réseau de deep learning massif et complexe impossible à lire, ils ont créé un modèle « minimal » basé sur un concept appelé codage parcimonieux (sparse coding).

Considérez le codage parcimonieux comme un puzzle où vous n'utilisez que quelques pièces spécifiques pour construire une image. Dans le cerveau, cela signifie qu'un petit nombre de neurones s'activent à un moment donné pour représenter une image. Les auteurs ont repris cette idée et y ont ajouté une nuance : ils ont laissé les neurones communiquer entre eux d'une manière spécifique. Dans les modèles standards, les neurones sont souvent traités comme des travailleurs indépendants. Mais dans ce nouveau modèle, les auteurs ont doté les neurones d'un « réseau social » (une matrice d'interaction) qui leur permet d'influencer les uns les autres. Cela permet au modèle d'apprendre que si une partie d'une image présente une ligne montante, la partie suivante est susceptible de poursuivre cette ligne, même si l'image est bruitée ou brisée.

Ce qu'ils ont trouvé : Le « réseau social » du cerveau

Lorsque les chercheurs ont entraîné ce modèle sur des images naturelles (comme des photos de paysages et d'objets), quelque chose de fascinant s'est produit. Le « réseau social » que le modèle a appris ressemble exactement aux connexions physiques trouvées dans le véritable cerveau humain. Plus précisément, le modèle a développé des connexions fortes entre les neurones qui sont réglés sur des angles similaires et qui sont alignés sur une rangée. C'est ce qu'on appelle la facilitation colinéaire.

Dans le monde réel, c'est pourquoi vous pouvez facilement voir un serpent rampant à travers les hautes herbes, même si certaines parties sont cachées. Votre cerveau relie les points. L'article montre que ce modèle peut faire la même chose. Lorsqu'ils lui ont montré une image avec un contour brisé ou caché (comme une ligne qui disparaît derrière un nuage), le modèle n'a pas deviné au hasard. Il a utilisé ses connexions apprises pour « compléter » la ligne manquante, créant une courbe lisse et continue. Cette performance était presque aussi bonne que celle des modèles d'IA massifs et complexes, mais avec un avantage majeur : parce que leur modèle est simple, les chercheurs ont pu réellement regarder à l'intérieur et voir comment il fonctionnait.

La recette secrète : Comment l'IA « pense »

L'une des découvertes les plus passionnantes de l'article est la façon dont le modèle gère le processus de « remplissage ». Les auteurs ont décomposé les mathématiques pour montrer que le modèle ne se contente pas de deviner ; il propage l'activité comme un ricochet sur l'eau. Lorsqu'un neurone détecte une partie d'une ligne, il envoie un signal à ses voisins. Si ces voisins sont également actifs et alignés, le signal se renforce, confirmant l'idée qu'une ligne existe à cet endroit. Si les voisins sont mal alignés ou inactifs, le signal est coupé.

L'article suggère que ce processus crée une « hiérarchie » même si le modèle n'a qu'une seule couche. Environ 30 % des neurones du modèle ont appris à se déconnecter entièrement de l'entrée visuelle directe. Ces « neurones détachés » agissent comme une seconde couche, cachée, qui aide le modèle à comprendre l'image globale. Ils ne voient pas les pixels ; au lieu de cela, ils aident à appliquer des règles globales, comme s'assurer que les deux yeux d'un visage sont au bon endroit l'un par rapport à l'autre. Cela explique comment le modèle peut générer un tout nouveau visage qui semble réaliste, même s'il n'a jamais vu ce visage exact auparavant. Il ne mémorise pas ; il comprend la géométrie d'un visage.

Pourquoi cela importe : De l'IA à la biologie

L'article suggère que le comportement complexe et mystérieux des modèles de diffusion d'IA modernes pourrait en fait être piloté par les mêmes principes biologiques simples trouvés dans notre cortex visuel. La « boîte noire » du deep learning pourrait n'être qu'une version très compliquée des circuits récurrents simples que les auteurs ont construits.

En prouvant qu'un modèle simple et interprétable peut égaler la performance de gigantesques systèmes d'IA, les auteurs offrent une nouvelle façon d'étudier le cerveau. Ils proposent que le système visuel utilise ces connexions spécifiques pour résoudre l'ambiguïté, transformant un monde bruyant et confus en une image claire et cohérente. Ce n'est pas seulement une théorie ; les prédictions du modèle sur la façon dont les neurones devraient réagir à différents types de bruit concordent avec des expériences récentes réalisées sur de véritables cerveaux biologiques.

En bref, cet article suggère que le secret de la vision comme de la création artistique est peut-être le même : un ensemble de règles simples qui permettent aux indices locaux de se connecter et de former un récit global. Qu'il s'agisse d'un neurone dans votre cerveau ou d'un poids numérique dans une IA, l'objectif est de trouver le motif dans le chaos. Et désormais, grâce à ce modèle, nous disposons d'une carte bien plus claire de la façon dont ce motif émerge.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →