Neural tracking of surprisal and semantic distance in naturalistic movie viewing
En utilisant des données d'IRMf de participants regardant un film complet, cette étude démontre que le cerveau humain suit à la fois la surprisalité et la distance sémantique en tant que prédicteurs uniques de l'activité neurale dans les régions temporales et frontales bilatérales lors de la compréhension du langage audiovisuel naturaliste.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Lorsque nous écoutons une histoire, nos cerveaux ne sont pas de simples enregistreurs passifs de sons ; ils sont des prédicteurs actifs, devinant constamment ce qui va suivre en fonction de ce que nous avons déjà entendu. Ce processus repose sur deux outils mentaux distincts mais liés. Le premier est un sens de la probabilité : quelle est la probabilité que le mot suivant apparaisse compte tenu des mots qui l'ont précédé ? Si une phrase se termine par « Le ciel est », notre cerveau s'attend fortement au mot « bleu », et l'arrivée de ce mot ne provoque aucune surprise. Si la phrase se termine par « Le ciel est » et que le mot suivant est « banane », le cerveau est pris de court. Ce sentiment d'être pris de court est appelé la « surprisal » (ou étonnement). Le second outil est une mesure du sens, soit la proximité entre le mot actuel et les idées que nous venons de traiter. Même si un mot n'est pas le plus statistiquement probable, il peut tout de même s'insérer parfaitement dans le thème de la conversation. Comprendre comment le cerveau utilise ces deux types d'informations différents — la vraisemblance statistique et la relation sémantique — pour donner du sens au langage est une question centrale en neurosciences, particulièrement lorsque nous sommes immergés dans un environnement riche et réel comme le visionnage d'un film.
Une équipe de chercheurs s'est donné pour mission d'explorer comment le cerveau humain suit ces deux signaux spécifiques pendant que des personnes regardent un long métrage. Ils ont recruté vingt adultes qui n'avaient jamais vu le film 500 jours ensemble (2009) et leur ont demandé de regarder l'intégralité du film, qui dure un peu plus de quatre-vingt-dix minutes, tout en étant allongés à l'intérieur d'un scanner d'imagerie par résonance magnétique fonctionnelle. Cette machine a permis aux scientifiques d'observer l'activité cérébrale en temps réel au fur et à mesure que l'histoire se déroulait. Pour comprendre ce que faisait le cerveau, les chercheurs ont d'abord décomposé les pistes audio et visuelles du film en milliers de petits points de données. Ils ont mesuré tout, de la luminosité de l'écran au mouvement de la caméra, en passant par l'intensité du dialogue et la fréquence de mots spécifiques. Ils ont ensuite calculé deux nombres complexes pour chaque mot prononcé dans le film : l'un représentant à quel point ce mot était surprenant par rapport au contexte précédent, et l'autre représentant la distance sémantique de ce mot par rapport aux mots qui l'ont précédé.
En utilisant une technique de modélisation informatique sophistiquée, les chercheurs ont construit une série de prédictions étape par étape pour voir quels points de données pouvaient le mieux expliquer les schémas d'activité observés dans le cerveau. Ils ont commencé par les facteurs les plus simples, tels que les changements visuels à l'écran et le volume brut du son. Ces caractéristiques de base ont prédit avec succès l'activité dans l'arrière du cerveau, où se produit le traitement visuel, et sur les côtés du cerveau, où le son est d'abord reçu. À mesure qu'ils ajoutaient des caractéristiques linguistiques plus complexes, comme la fréquence d'utilisation d'un mot en général ou le nombre de mots aux sonorités similaires, les prédictions s'amélioraient, s'étendant aux zones impliquées dans le langage et la mémoire. Enfin, ils ont ajouté les deux variables d'intérêt principales : la surprise statistique des mots et la distance sémantique. Les résultats ont montré que l'inclusion de ces deux facteurs améliorait considérablement la capacité de prédiction de l'activité cérébrale, particulièrement dans le gyrus temporal supérieur, une région située sur les côtés du cerveau connue pour le traitement de la parole, et dans le lobe frontal gauche.
La découverte la plus cruciale est que ces deux facteurs ne remplissaient pas le même rôle. Même après que les chercheurs eurent pris en compte l'influence de l'un, l'autre expliquait encore des changements uniques dans l'activité cérébrale. Cela suggère que le cerveau suit simultanément la probabilité statistique de ce qui va suivre et la relation conceptuelle entre les idées, en utilisant deux systèmes complémentaires. Bien que les deux signaux activent des régions similaires des lobes temporaux, la surprise statistique des mots montrait également une connexion unique avec une zone spécifique du cervelet, une partie du cerveau située à la base du crâne, souvent associée à la coordination et au rythme. Cette découverte indique que les mécanismes de prédiction du cerveau sont nuancés, traitant le « ce qui est probable d'arriver » et le « ce qui correspond au sens » comme des flux d'informations distincts mais parallèles.
Ces résultats sont significatifs car ils dépassent les environnements contrôlés et silencieux des études traditionnelles en laboratoire. Les recherches antérieures sur la prédiction du langage reposaient souvent sur des personnes écoutant des phrases isolées ou lisant un texte en silence. En utilisant un film complet, les chercheurs ont démontré que le cerveau continue de suivre ces signaux linguistiques subtils même lorsqu'il est bombardé de scènes visuelles complexes, de musique et de récits émotionnels. L'étude confirme que la capacité du cerveau à anticiper le langage est robuste et profondément intégrée à notre façon d'expérimenter le monde, fonctionnant efficacement même lorsque l'apport est riche, multimodal et imprévisible. Ce travail ne prétend pas avoir résolu tout le mystère du traitement du langage, mais il fournit une preuve solide que nos cerveaux effectuent constamment deux types de vérifications différents sur les mots que nous entendons, garantissant que nous comprenons non seulement ce qui est dit, mais aussi pourquoi cela importe dans le flux de l'histoire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.