Task-optimized neural networks reveal distinct contributions of specialized and broader visual learning to neural representations of face familiarity
Durch die Kombination von quellengestütztem MEG mit aufgabenoptimierten neuronalen Netzwerken demonstriert diese Studie, dass die Verarbeitung der Vertrautheit von Gesichtern eine stadienabhängige Dissoziation beinhaltet, bei der intermediäre visuelle Areale auf gesichtsspezifisches Training für eine präzise zeitliche Abstimmung angewiesen sind, während Repräsentationen im fusiformen Kortex mit breiteren visuellen Lernzielen übereinstimmen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Das menschliche Gehirn ist ein Meister der Erkennung. Innerhalb eines Bruchteils einer Sekunde kann es eine Freundin in einer Menge identifizieren, ein bekanntes Gesicht von einem Fremden unterscheiden und eine komplexe Welt voller Objekte navigieren. Jahrzehntelang haben Wissenschaftler darüber debattiert, wie dies geschieht, insbesondere in Bezug auf Gesichter. Eine Denkschule legt nahe, dass das Gehirn über eine dedizierte, spezialisierte Hardware für Gesichter verfügt, eine einzigartige Schaltung, die sich ausschließlich dazu entwickelt hat, menschliche Antlitter zu verarbeiten. Eine andere Sichtweise argumentiert, dass die Gesichtserkennung lediglich eine hochgradig verfeinerte Version des allgemeinen Systems ist, das wir zur Erkennung aller Objekte verwenden, von Stühlen bis hin zu Autos. Die Wahrheit liegt wahrscheinlich irgendwo dazwischen, aber genau festzulegen, wo und wann das Gehirn von der allgemeinen Objektverarbeitung zur spezifischen Gesichtsexpertise wechselt, war schwierig. Dies liegt daran, dass menschliche Expertise über ein ganzes Leben hinweg aufgebaut wird; wir können das Gedächtnis eines Menschen nicht einfach löschen, um zu sehen, wie sein Gehirn reagiert, noch können wir sein Gehirn leicht darauf trainieren, Gesichter als bloße andere Objektkategorie zu behandeln.
Um dieses Rätsel zu lösen, wandten sich Forscher an eine andere Art von Beobachter: künstliche neuronale Netze. Dies sind Computerprogramme, die darauf ausgelegt sind, die Struktur des Gehirns nachzuahmen, und die in der Lage sind, Muster zu erkennen. Indem sie diese Netzwerke in verschiedenen Aufgaben trainierten – einige zur Identifizierung spezifischer Personen, andere zur Sortierung allgemeiner Objekte –, konnten die Wissenschaftler kontrollierte Modelle visueller Erfahrung schaffen. Sie verglichen dann die internen „Gedanken“ dieser Netzwerke mit der tatsächlichen elektrischen Aktivität menschlicher Gehirne. Das Ziel war zu sehen, welche Teile des Gehirns mit welcher Art des Lernens übereinstimmten, um den präzisen Moment und den Ort zu enthüllen, an dem die Gesichtserkennung spezialisiert wird.
Die Studie konzentrierte sich auf den ventralen visuellen Strom, den Pfad im Gehirn, der für die Verarbeitung dessen verantwortlich ist, was wir sehen. Die Forscher konzentrierten sich auf zwei Schlüsselbereiche: den lateralen okzipitalen Kortex, eine Region, die an der Erkennung von Formen und Objekten beteiligt ist, und den fusiformen Kortex, ein Gebiet, das berühmt mit der Gesichtsverarbeitung verknüpft ist. Sie verwendeten eine Technik namens Magnetoenzephalographie, oder MEG, die die magnetischen Felder der Gehirnaktivität mit Millisekundenpräzision misst. Dies ermöglichte es ihnen, die Reaktion des Gehirns in Echtzeit zu beobachten, während die Teilnehmer drei Arten von Bildern betrachteten: Gesichter berühmter Menschen, die sie kannten, Gesichter von Fremden, die sie nicht kannten, und zersplitterte Bilder von Gesichtern, die wie Rauschen aussah.
Um diesen Flut an Daten zu verstehen, baute das Team sieben verschiedene Computernetzwerke. Sie trainierten einige zur Erkennung spezifischer Identitäten, wie etwa des Gesichts eines Prominenten. Andere trainierten sie zur Sortierung von Obvjekten in breite Kategorien, wie „Hund“ oder „Auto“, wobei Gesichter als eine weitere Kategorie behandelt wurden. Eine dritte Gruppe wurde darauf trainiert, sowohl Objekte als auch Gesichter als eine Gruppe zu erkennen, aber einzelne Gesichter nicht zu unterscheiden. Schließlich gab es untrainierte Netzwerke, die als Baseline dienten. Indem sie dieselben Gesichtsbilder in diese Netzwerke einspeisten und die resultierenden Muster mit den menschlichen Gehirnscans verglichen, konnten sie genau kartieren, wo und wann die Aktivität des Gehirns mit dem „Lernen“ des Computers übereinstimmte.
Die Ergebnisse offenbarten eine faszinierende Spaltung in der Art und Weise, wie das Gehirn Vertrautheit handhabt. Im lateralen okzipitalen Kortex, der Region, die für die intermediäre Objektverarbeitung verantwortlich ist, änderte sich der Zeitpunkt der Gehirnantwort dramatisch basierend auf der Vertrautheit. Wenn die Teilnehmer ein bekanntes Gesicht sahen, stimmte die Gehirnaktivität etwa 18 Millisekunden schneller mit den Computermodellen überein als bei einem unbekannten Gesicht. Dieser Geschwindigkeitsvorteil war am konsistentesten in den Computermodellen, die speziell darauf trainiert worden waren, individuelle Identitäten zu erkennen. Dies deutet darauf hin, dass das Gehirn bei vertrauten Gesichtern einen Punkt der Erkennung etwas früher im Verarbeitungsstrom erreicht, aber dieser Effekt ist am engsten organisiert, wenn das System darauf abgestimmt ist, spezifische Individuen zu identifizieren.
Die Geschichte änderte sich jedoch im fusiformen Kortex, dem tiefer im Gehirn gelegenen Bereich, der mit detaillierter Gesichtsanalyse assoziiert ist. Hier machte Vertrautheit das Gehirn nicht schneller in seiner Reaktion. Stattdessen machte sie die Antwort des Gehirns stärker und stimmte sie besser mit den Computermodellen überein. Entscheidend war, dass diese stärkere Reaktion unabhängig davon auftrat, wie die Computermodelle trainiert worden waren. Unabhängig davon, ob das Netzwerk ein Gesichtsexperte, ein Objektsortierer oder ein allgemeiner Lerner war, zeigte der fusiforme Bereich des Gehirns eine robuste, verstärkte Verbindung beim Betrachten vertrauter Gesichter. Dieser Befund stellt die Vorstellung infrage, dass der gesichtsspezialisierte Bereich des Gehirns ausschließlich auf einem einzigartigen, gesichtsspezifischen Lernpfad beruht. Stattdessen deutet es darauf hin, dass die Fähigkeit, ein vertrautes Gesicht zu erkennen, aus einem breiteren visuellen Lernen hervorgehen kann, nicht nur durch das Training speziell auf Gesichter.
Die Studie schließt die Vorstellung effektiv aus, dass die Gesichtserkennung ein einzelner, Alles-oder-Nichts-Prozess ist. Sie zeigt, dass das Gehirn in verschiedenen Stadien unterschiedliche Strategien anwendet. In den mittleren Stadien der Verarbeitung wird das Timing des Gehirns durch das spezifische Ziel der Identifizierung von Individuen geschärft. Aber in den späteren Stadien ist die Fähigkeit des Gehirns, ein vertrautes Gesicht darzustellen, flexibel und kann durch allgemeine visuelle Erfahrung unterstützt werden. Dies bedeutet, dass, während das Lernen zur Identifizierung spezifischer Personen die Geschwindigkeit der Erkennung verfeinert, die tiefe, stabile Repräsentation eines vertrauten Gesichts eine allgemeinere Fähigkeit ist, die kein spezialisiertes, gesichtsspezifisches Trainingsregime erfordert. Das Gehirn ist, wie sich herausstellt, keine starre Maschine mit einem einzigen Gesichtsschalter, sondern ein dynamisches System, das seine Verarbeitungsgeschwindigkeit und -stärke je nach dem, was es gelernt hat und wo in der visuellen Hierarchie die Information verarbeitet wird, anpasst.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.