Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature
Cet article introduit un pipeline multi-LLM contraint par une ontologie qui synthétise la littérature fragmentée sur le codage prédictif en évaluant les études par rapport à un glossaire de hypothèses défini, générant ainsi des mesures de désaccord auditables et des espaces de preuves quantitatives que la méta-analyse conventionnelle ne peut résoudre.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de comprendre une bibliothèque massive et chaotique où des milliers de scientifiques ont écrit des livres sur la façon dont le cerveau humain prédit l'avenir. Le problème est que ces livres sont écrits dans des langues différentes, utilisent des cartes différentes et, parfois, se contredisent. Certains auteurs parlent des « erreurs de prédiction » comme s'il s'agissait d'étincelles électriques, tandis que d'autres les décrivent comme des probabilités statistiques. Lire tous ces ouvrages et comprendre ce sur quoi la communauté scientifique s'accorde réellement revient à essayer d'assembler un puzzle géant dont les pièces proviennent de boîtes différentes.
Ce document décrit une nouvelle façon de résoudre ce puzzle en utilisant une équipe de « bibliothécaires » IA.
Le Problème : Une bibliothèque fragmentée
Les auteurs se concentrent sur un domaine spécifique appelé le Codage Prédictif (Predictive Coding). C'est l'idée que notre cerveau devine constamment ce qui va se passer ensuite et n'accorde son attention que lorsque la réalité nous surprend (comme entendre un bruit fort dans une pièce calme).
Au fil des années, les scientifiques ont étudié cela en utilisant de nombreux outils : scanners cérébraux, enregistrements électriques, modèles informatiques et tests comportementaux. Comme les méthodes sont si différentes, il est difficile de combiner leurs découvertes en une image claire. Les méthodes traditionnelles de synthèse scientifique (appelées méta-analyses) exigent généralement que toutes les études soient réalisées exactement de la même manière, ce qui n'est pas possible ici.
La Solution : Un conseil de bibliothécaires IA
Au lieu d'un expert humain tentant de tout lire, les auteurs ont construit un pipeline multi-LLM local. Considérez cela comme un « conseil » de dix modèles d'IA différents (comme une équipe de dix experts distincts) travaillant ensemble dans une pièce sécurisée et privée (exécution locale) afin qu'aucune donnée sensible ne quitte leurs ordinateurs.
Voici comment ils ont fait travailler l'équipe d'IA :
Le Livre de Règles (L'Ontologie) : Avant que l'IA ne commence sa lecture, les auteurs humains ont créé un « glossaire » ou un livre de règles strict. Il définissait 36 concepts spécifiques que l'IA devait rechercher, regroupés en trois idées principales (hypothèses) :
- Suppression Prédictive : Le cerveau se calme-t-il lorsqu'il s'attend à quelque chose ?
- Propagation de l'Erreur Feedforward : Lorsque le cerveau est surpris, envoie-t-il un « cri » de signaux d'erreur vers le haut de la hiérarchie ?
- Ubiquité : Cette « machine à prédire » est-elle utilisée partout dans le cerveau, ou seulement dans des endroits spécifiques ?
Le Processus de Lecture : L'équipe d'IA a lu 31 articles scientifiques. Ils n'ont pas seulement lu le texte ; ils ont également examiné les figures et les graphiques (en utilisant un outil de vision spécialisé) pour comprendre les données.
La Notation : Pour chaque article, chacun des 10 modèles d'IA a attribué un score de -1 (fort désaccord) à +1 (fort accord) pour chacune des trois idées principales. Ils devaient citer précisément l'endroit dans l'article où ils trouvaient leur preuve, agissant comme des examinateurs par les pairs très stricts.
Les Résultats : Cartographier le paysage
Une fois que l'équipe d'IA a terminé de noter, les auteurs ont traité les résultats comme une carte en 3D.
- L'Oddball « Local » vs « Global » : Ils ont testé les articles dans deux scénarios différents :
- Oddball Local : Une surprise simple (comme un bip dans une série de bips).
- Oddball Global : Une surprise complexe, liée à un changement de motif à long terme (comme un changement de règle dans un jeu).
- Les Constatations :
- Accord : Le conseil d'IA a trouvé que la plupart des articles s'accordent sur le fait que le cerveau effectue une « suppression prédictive » (il se calme pour les choses attendues) et envoie des signaux d'erreur vers l'avant.
- Désaccord : Il y avait beaucoup moins d'accord sur la question de savoir si ces mécanismes se produisent partout dans le cerveau (Ubiquité).
- Le Rebondissement : L'accord était beaucoup plus fort pour les surprises « Locales » simples que pour les surprises « Globales » complexes. Le contexte « Global » était beaucoup plus désordonné et dispersé.
De nouveaux outils pour mesurer la science
Les auteurs ont inventé des moyens ingénieux de mesurer à quel point la littérature scientifique est « cohérente » :
- Température de l'Espace d'Hypothèse : Imaginez que les articles scientifiques sont des particules de gaz dans un bocal. Si elles sont toutes regroupées dans un coin, la « température » est basse (fort accord). Si elles rebondissent de manière sauvage partout dans le bocal, la « température » est élevée (fort désaccord).
- Ils ont trouvé que la « température » était basse pour les surprises locales simples (les scientifiques sont d'accord).
- La « température » était élevée pour les surprises globales complexes (les scientifiques sont en désaccord).
- L'Outlier (L'Anomalie) : Ils ont identifié un article spécifique (Westerberg et al., 2025) qui était très différent des autres. Il n'était pas d'accord avec la vision standard, particulièrement concernant les motifs globaux complexes. Le conseil d'IA a réussi à identifier cet article comme une « anomalie » sans biais humain.
Pourquoi cela importe
Ce document démontre qu'une équipe de modèles d'IA, guidée par un livre de règles strict créé par l'homme, peut lire un domaine scientifique fragmenté et désordonné et le transformer en une carte quantitative propre.
- Auditabilité : Parce que les modèles d'IA fonctionnent localement et conservent des journaux de leur raisonnement, les humains peuvent vérifier leur travail.
- Mesurer le Désaccord : Au lieu de simplement dire « les scientifiques ne sont pas d'accord », cette méthode mesure à quel point ils ne sont pas d'accord et où le désaccord se produit.
- Scalabilité (Évolutivité) : Cette approche peut traiter plus d'articles qu'une équipe humaine ne pourrait jamais le faire, permettant à la science de suivre la croissance rapide de la recherche.
En résumé, les auteurs ont construit une machine capable de lire une bibliothèque chaotique, de trier les livres dans une carte 3D ordonnée et de nous dire exactement où les scientifiques sont synchronisés et où ils sont encore en train de se disputer.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.