Task-optimized neural networks reveal distinct contributions of specialized and broader visual learning to neural representations of face familiarity
Combinando la MEG con risoluzione di sorgente e reti neurali ottimizzate per il compito, questo studio dimostra che l'elaborazione della familiarità dei volti coinvolge una dissociazione dipendente dallo stadio in cui le aree visive intermedie si affidano all'addestramento specifico per i volti per una temporizzazione precisa, mentre le rappresentazioni della corteccia fusiforme si allineano con obiettivi di apprendimento visivo più ampi.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
Il cervello umano è un maestro del riconoscimento. In una frazione di secondo, può identificare un amico in mezzo alla folla, distinguere un volto familiare da uno sconosciuto e navigare in un complesso mondo di oggetti. Per decenni, gli scienziati hanno dibattuto su come ciò avvenga, specificamente riguardo ai volti. Una scuola di pensiero suggerisce che il cervello possieda un hardware dedicato e specializzato per i volti, una circuitazione unica che si è evoluta esclusivamente per gestire i volti umani. Un'altra visione sostiene che il riconoscimento dei volti sia solo una versione altamente raffinata del sistema generale che usiamo per riconoscere tutti gli oggetti, dalle sedie alle automobili. La verità probabilmente risiede nel mezzo, ma individuare esattamente dove e quando il cervello passa dall'elaborazione generale degli oggetti alla specializzazione nel riconoscimento dei voli è stato difficile. Questo perché l'esperienza umana si costruisce nel corso di una vita; non possiamo semplicemente cancellare la memoria di una persona riguardo alla sua famiglia per vedere come reagisce il suo cervello, né possiamo riaddestrare facilmente il suo cervello a trattare i volti come una semplice categoria di oggetti.
Per risolvere questo enigma, i ricercatori si sono rivolti a un tipo diverso di osservatore: le reti neurali artificiali. Questi sono programmi informatici progettati per imitare la struttura del cervello, capaci di imparare a riconoscere schemi. Addestrando queste reti su compiti diversi — alcune per identificare persone specifiche, altre per classificare oggetti generici — gli screnti potevano creare modelli controllati di esperienza visiva. Hanno poi confrontato i "pensieri" interni di queste reti con l'effettiva attività elettrica dei cervelli umani. L'obiettivo era vedere quali parti del cervello si allineassero con quale tipo di apprendimento, rivelando il momento e il luogo precisi in cui il riconoscimento dei volti diventa specializzato.
Lo studio si è concentrato sulla via visiva ventrale, il percorso del cervello responsabile dell'elaborazione di ciò che vediamo. I ricercatori si sono focalizzati su due aree chiave: la corteccia occipitale laterale, una regione coinvolta nel riconoscimento di forme e oggetti, e la corteccia fusiforme, un'area celebre per l'elaborazione dei volti. Hanno utilizzato una tecnica chiamata magnetoencefalografia, o MEG, che misura i campi magnetici prodotti dall'attività cerebrale con una precisione al millisecondo. Ciò ha permesso loro di osservare lo sviluppo della risposta cerebrale in tempo reale mentre i partecipanti guardavano tre tipi di immagini: volti di persone famose che conoscevano, volti di sconosciuti che non conoscevano e immagini rimescolate di volti che sembravano rumore.
Per dare un senso a questo flusso di dati, il team ha costruito sette diverse reti informatiche. Alcune sono state addestrate a riconoscere identità specifiche, come il volto di una celebrità. Altre sono state addestrate a classificare oggetti in categorie ampie, come "cane" o "auto", trattando i volti come una semplice categoria tra le altre. Un terzo gruppo è stato addestrato a fare entrambe le cose, riconoscendo oggetti e volti come un gruppo, ma senza distinguere i singoli voli. Infine, sono state utilizzate reti non addestrate per fungere da base di confronto. Alimentando queste reti con le stesse immagini di volti e confrontando i modelli risultanti con le scansioni del cervello umano, sono stati in grado di mappare esattamente dove e quando l'attività cerebrale corrispondeva all' "apprendimento" del computer.
I risultati hanno rivelato una divisione affascinante nel modo in cui il cervello gestisce la familiarità. Nella corteccia occipitale laterale, la regione responsabile dell'elaborazione intermedia degli oggetti, la tempistica della risposta cerebrale cambia drasticamente in base alla familiarità. Quando i partecipanti vedevano un volto familiare, l'attività del loro cervello si allineava ai modelli informatici circa 18 millisecondi prima rispetto a quando vedevano un volto non familiare. Questa accelerazione era più coerente nei modelli informatici che erano stati specificamente addestrati a riconoscere le singole identità. Ciò suggerisce che, per i volti familiari, il cervello raggiunge un punto di riconoscimento leggermente prima nel flusso di elaborazione, ma questo effetto è più strettamente organizzato quando il sistema è tarato per identificare individui specifici.
Tuttavia, la storia cambia nella corteccia fusiforme, l'area più profonda del cervello associata all'analisi dettagliata dei volti. Qui, la familiarità non rendeva il cervello più veloce nella reazione. Invece, rendeva la risposta del cervello più forte e più allineata con i modelli informatici. Fondamentalmente, questa risposta più forte appariva indipendentemente da come i modelli informatici fossero stati addestrati. Che la rete fosse un esperto di volti, un classificatore di oggetti o un apprendista generale, la regione fusiforme del cervello mostrava una connessione robusta ed enfatizzata durante la visione di volti familiari. Questa scoperta mette in discussione l'idea che l'area specializzata per i volti del cervello dipenda esclusivamente da un percorso di apprendimento unico e specifico per i volti. Invece, suggerisce che la capacità di riconoscere un volto familiare può emergere da un apprendimento visivo più ampio, non solo dall'essere addestrati specificamente sui volti.
Lo studio esclude efficacemente la nozione che il riconoscimento dei volti sia un processo singolo e indivisibile. Dimostra che il cervello utilizza strategie diverse in diverse fasi. Nelle fasi intermedie dell'elaborazione, la tempistica del cervello è affinata dall'obiettivo specifico di identificare gli individui. Ma nelle fasi successive, la capacità del cervello di rappresentare un volto familiare è flessibile e può essere supportata da un'esperienza visiva generale. Ciò significa che, sebbene l'apprendimento nell'identificare persone specifiche possa perfezionare la velocità di riconoscimento, la rappresentazione profonda e stabile di un volto familiare è una capacità più generale che non richiede un regime di addestramento specializzato solo sui volti. Il cervello, si scopre, non è una macchina rigida con un singolo interruttore per i volti, ma un sistema dinamico che adatta la propria velocità e forza di elaborazione a seconda di ciò che ha imparato e di dove l'informazione viene elaborata nella gerarchia visiva.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.