A transformer-based model reveals sparse, stimulus-dependent orientation readout from macaque V1 population activity
Diese Studie zeigt, dass ein Transformer-basiertes Modell die Stimulusorientierung aus der Populationaktivität des Makaken-V1 präzise rekonstruieren kann, was offenbart, dass eine redundante neuronale Kodierung einen flexiblen, spärlichen und stimulusabhängigen Readout-Mechanismus unterstützt, der durch Self-Attention vermittelt wird.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Der primäre visuelle Kortex, eine dünne Gewebeschicht am Hinterhaupt des Gehirns, fungiert als die erste große Verarbeitungsstation für alles, was wir sehen. Wenn Licht auf das Auge trifft, wandern Signale zu dieser Region, wo Millionen einzelner Neuronen als Reaktion auf spezifische Merkmale der visuellen Welt feuern. Eine der grundlegendsten Eigenschaften, die diese Neuronen detektieren, ist die Orientierung: der Winkel, in dem eine Linie oder Kante geneigt ist. Jahrzehnte der Forschung haben gezeigt, dass diese Neuronen nicht einheitlich sind; jedes von ihnen hat einen bevorzugten Winkel, wie eine winzige Kompassnadel, die in eine bestimmte Richtung zeigt. Das Gehirn verlässt sich jedoch nicht auf ein einzelnes Neuron, um uns zu sagen, in welchem Winkel wir etwas betrachten. Stattdessen aktiviert ein visueller Reiz eine riesige, überlappende Menge von tausenden Neuronen, die jeweils leicht unterschiedliche Präferenzen und variierende Aktivitätsgrade aufweisen. Dies erzeugt einen komplexen, redundanten Code, bei dem dieselbe Information über eine große Population verteilt ist. Das zentrale Rätsel für Neurowissenschaftler war lange Zeit, wie das Gehen durch diese massive, verrauschte Menge navigiert, um eine einzige, präzise Antwort über die Welt zu extrahieren. Wenn jedes Neuron ein wenig beiträgt, wie entscheidet das Gehirn, auf welche es hört, und hört es alle gleichermaßen zu?
Um dieses Rätsel zu lösen, wandten Forscher ein leistungsfähiges neues Werkzeug aus dem Bereich der künstlichen Intelligenz an: ein Transformer-basiertes Modell. Ursprünglich für die Sprachverarbeitung entwickelt, ist dieser Typ von Computermodell einzigartig gut darin, herauszufinden, welche Teile eines komplexen Inputs am wichtigsten für eine bestimmte Aufgabe sind. Das Team, geleitet von Wissenschaftlern der Peking University und der Zhejiang University, wandte dieses Modell auf reale biologische Daten an. Sie zeichneten die Aktivität von mehr als 1.000 Neuronen gleichzeitig aus dem visuellen Kortex von sieben wachen Makaken auf. Den Affen wurden einfache gestreifte Muster, sogenannte Gabor-Stimuli, in verschiedenen Winkeln gezeigt. Die Forscher speisten dann die kollektiven Calcium-Antworten dieser Neuronen in ihr Computermodell ein, mit der Aufgabe, das exakte Bild zu rekonstruieren, das der Affe gesehen hatte. Das Ziel bestand nicht nur darin zu sehen, ob der Computer den Winkel erraten konnte, sondern auch zu beobachten, wie er entschied, welchen Neuronen er während des Prozesses Aufmerksamkeit schenkte.
Die Ergebnisse waren beeindruckend. Das Computermodell rekonstruierte die gestreiften Bilder mit unglaublicher Präzision und erfasste die Orientierung der Linien mit einem durchschnittlichen Fehler von weniger als einem Grad. Diese Genauigkeit übertraf das, was einfachere Computermodelle erreichen konnten, bei weitem, was bewies, dass die Transformer-Architektur besonders gut geeignet war, um dieses komplexe biologische Signal zu dekodieren. Doch der wahre Durchbruch kam durch den Blick in den „Verstand“ des Modells. Während der Computer die Daten verarbeitete, erstellte er eine Aufmerksamkeitskarte, die genau zeigte, wie viel Gewicht er jedem Neuron bei seiner Entscheidung zuwies. Die Forscher fanden heraus, dass das Modell die 1.000 Neuronen nicht als gleichberechtigte Partner behandelte. Stattdessen wurde die Rekonstruktion für einen gegebenen Winkel von einer winzigen, spärlichen Gruppe von nur zwei oder drei Neuronen dominiert. Diese spezifischen Neuronen waren nicht zufällig ausgewählt; es waren jene, deren bevorzugte Winkel mit dem gezeigten Bild übereinstimmten, und sie waren diejenigen, die die stärksten „Aufmerksamkeitssignale“ aus dem restlichen Netzwerk erhielten.
Dieser Befund stellt eine verbreitete Annahme infrage, wonach das Gehirn die Signale von tausenden Neuronen mitteln muss, um ein klares Bild zu erhalten. Die Studie legt nahe, dass das Gehirn Informationen zwar redundant über eine große Population speichert, diese Informationen aber auf eine hochgradig selektive und flexible Weise ausliest. Das Modell enthüllte, dass diese Schlüsselneuronen nicht nur deshalb besonders waren, weil sie den richtigen Winkel „mochten“, sondern weil sie auch am unabhängigsten von ihren Nachbarn waren und weniger geteiltes Rauschen oder Variabilität zeigten. Darüber hinaus zeigte das Modell, dass es die Signale dieser wenigen Schlüsselneuronen schärfen konnte, indem es effektiv die Lautstärke der nützlichsten Informationen erhöhte, während es das Rauschen aus dem Rest der Menge dämpfte. Dieser Prozess ermöglichte es dem System, eine präzise Orientierung aus einem chaotischen Meer der Aktivität zu extrahieren.
Vielleicht war der überzeugendste Beweis für dieses flexible System ein „Was-wäre-wenn“-Experiment. Die Forscher entfernten die kleine Gruppe der hoch gewichteten Neuronen aus dem Modell und baten es, den Versuch zu wiederholen. Anstatt zu scheitern, passte sich das Modell schnell an. Es rekrutierte eine neue, andere Gruppe von Ersatzneuronen, die ähnliche Eigenschaften wie die entfernten Neuronen besaßen. Diese neuen Neuronen waren ebenfalls auf den korrekten Winkel abgestimmt und waren in der Lage, die Aufgabe der Dekodierung der Orientierung mit der gleichen hohen Präzision zu übernehmen. Dies demonstriert, dass das Gehirn sich nicht auf einen festen, unveränderlichen Satz von „Star-Neuronen“ verlässt. Stattdessen ist die Fähigkeit, visuelle Informationen auszulesen, ein dynamischer Prozess, bei dem eine redundante Population von Zellen ein Sicherheitsnetz bildet, das es dem System ermöglicht, je nach Bedarf zu anderen Teilmengen von Neuronen zu wechseln, ohne an Genauigkeit zu verlieren.
Die Studie bestätigt, dass der visuelle Kortex nach dem Prinzip der redundanten Speicherung bei gleichzeitig spärlicher, stimulusabhängiger Auslesung arbeitet. Das Gehirn hält dieselbe Information an vielen Stellen bereit, um Robustheit zu gewährleisten, aber wenn es eine Entscheidung treffen muss, konzentriert es seine Ressourcen auf eine sehr kleine, hocheffektive Teilmenge der Population. Dieser Mechanismus ermöglicht sowohl die Stabilität eines großen Netzwerks als auch die Geschwindigkeit und Präzision einer fokussierten Auslesung. Durch die Verwendung eines Transformer-Modells zur Dekodierung der Aktivität echter Neuronen haben die Forscher ein klares Fenster dazu geöffnet, wie das Gehirn das Problem lösen könnte, spezifische Details aus einem massiven, überlappenden Code zu extrahieren. Die Ergebnisse legen nahe, dass die Effizienz des Gehirns nicht daraus resultiert, weniger Neuronen zu haben, sondern aus einer intelligenten, flexiblen Methode, zu entscheiden, welche in jedem gegebenen Moment am wichtigsten sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.