← Derniers articles
💻 computer science

SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions

Cet article présente SciSchema.org, la première collection multidisciplinaire de 16 schémas annotés par des experts conçus pour standardiser la description des processus scientifiques à travers divers domaines, permettant ainsi une annotation structurée, la reproductibilité et la comparaison entre les études grâce à un flux de travail de développement avec intervention humaine.

Auteurs originaux : Jennifer D'Souza, Sameer Sadruddin, Anisa Rula, Ana Bossler, Andres Fullana, Enric Bas, Syed Ather, Defne Circi, Anlan Chen, L. Catherine Brinson, Alyssa Columbus, George Demetriou, Dongjun Jeong, Tar
Publié 2026-08-25
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jennifer D'Souza, Sameer Sadruddin, Anisa Rula, Ana Bossler, Andres Fullana, Enric Bas, Syed Ather, Defne Circi, Anlan Chen, L. Catherine Brinson, Alyssa Columbus, George Demetriou, Dongjun Jeong, Tarun Kumar, Frank Krueger, Sascha Genehr, Kai Budde-Sagert, Anamaria Leonescu, Francesco Lodola, Chiara Florindi, Gagana Balasubramanya Murthy, Samson Oluwapelumi Olagbile, Nazia Riasat, Yan Sha, Kevin Shen, Shaokai Yang

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La science a toujours compté sur la parole écrite pour partager la manière dont les découvertes ont été faites. Un chercheur décrit une expérience dans un article de revue, tissant ensemble des listes de matériel, des réglages de machines et des instructions étape par étape en paragraphes de texte. Cette approche fonctionne bien pour les lecteurs humains qui peuvent inférer le contexte et combler les lacunes, mais elle crée une barrière significative pour les machines. Les ordinateurs peinent à comprendre que « chauffé à 80 degrés » dans un article signifie la même chose que « maintenu à 353 Kelvin » dans un autre, ou qu'un processus chimique spécifique décrit dans un laboratoire de biologie suit une logique similaire à un processus d'un laboratoire de chimie. Alors que la science devient plus automatisée et interdisciplinaire, avec des systèmes d'intelligence artificielle et des laboratoires robotisés tentant de lire et d'exécuter ces instructions, l'absence d'un langage commun et structuré pour les méthodes scientifiques est devenue un goulot d'étranglement. Sans un moyen de traduire la prose de la découverte en un format rigide et lisible par machine, le potentiel pour comparer les études, reproduire les résultats et automatiser la recherche reste largement inexploité.

Pour combler cette lacune, une grande équipe internationale de chercheurs a introduit SciSchema.org, une nouvelle collection de modèles structurés conçus pour décrire les processus scientifiques d'une manière que les humains et les ordinateurs peuvent comprendre. L'équipe, composée d'experts issus de domaines aussi divers que la biologie, la physique, la psychologie et la science des matériaux, n'a pas simplement écrit ces modèles à la main. Au lieu de cela, ils ont développé un flux de travail collaboratif où des experts humains ont guidé des modèles d'intelligence artificielle pour extraire les composants essentiels de certaines expériences à partir de milliers d'articles scientifiques. Le résultat est un ensemble de 16 « schémas » distincts, ou contours structurés, couvrant des processus allant de l'édition de gènes via CRISPR-Cas9 à la reconstruction d'événements de neutrinos en physique des particules. Ces schémas définissent exactement quelles informations doivent être enregistrées pour un type donné d'expérience — comme les instruments spécifiques utilisés, les conditions dans lesquelles ils ont fonctionné et les étapes précises suivies — transformant la prose désordonnée et non structurée des articles traditionnels en données propres et comparables.

Le projet a commencé par identifier 16 processus scientifiques spécifiques qui sont bien établis et fréquemment décrits dans la littérature, garantissant qu'il y avait suffisamment de matériel pour travailler. L'équipe a ensuite recruté des experts du domaine pour chaque processus, des biologistes moléculaires aux psychologues, pour agir comme guides. Ces experts ont fourni une description de base des procédures standards de leur domaine ainsi qu'une collection d'articles scientifiques pertinents. Le cœur du travail consistait en un système « humain dans la boucle », où des modèles de langage de grande taille — des outils d'IA avancés capables de lire et de comprendre le texte — avaient pour tâche de lire ces articles et de proposer un contour structuré pour le processus. L'IA scannait le texte, identivait les détails récurrents comme les réglages de température ou les concentrations chimiques, et rédigeait un schéma organisant ces détails dans des catégories logiques.

Cependant, l'IA ne travaillait pas seule. Après que les modèles ont généré leurs premières ébauches, les experts humains les ont examinées, signalant les détails manquants, corrigeant la terminologie et suggérant comment différents éléments d'information devraient être regroupés. Ce retour d'information était réinjecté dans l'IA, qui affinait ensuite ses ébauches. Ce cycle de génération et de correction par l'expert se répétait sur plusieurs étapes, l'IA lisant de plus en plus d'articles à chaque étape. Le processus était conçu pour être itératif, permettant à l'IA d'apprendre des corrections des experts et de construire progressivement une structure plus précise et complète. L'équipe a testé ce flux de travail en utilisant 12 modèles d'IA différents, allant de modèles plus petits et rapides à des modèles massifs et complexes, pour voir quelles approches produisaient les meilleurs résultats.

L'aboutissement de ce processus rigoureux fut la création de 16 schémas finaux annotés par des experts. Chaque schéma sert de modèle maître pour un type spécifique de processus scientifique. Par exemple, le schéma pour la « Réaction en chaîne par polymérase », une technique courante utilisée pour copier l'ADN, définit des champs spécifiques pour les matériaux biologiques utilisés, la conception des amorces génétiques, les conditions de cycles thermiques et les données résultantes. De même, le schéma pour l'« Essai de fatigue des matériaux métalliques » décrit des champs pour le type de métal, la forme de l'échantillon de test, les forces appliquées et les conditions environnementales. Ces schémas ne sont pas remplis de données provenant d'expériences spécifiques ; ce sont plutôt les formulaires vides que les scientifiques peuvent utiliser pour enregistrer leurs propres données de manière standardisée. En utilisant ces modèles, un chercheur peut s'assurer que chaque détail critique de son expérience est capturé dans un format qui peut être facilement recherché, comparé avec d'autres études et traité par des logiciels.

Les chercheurs ont constaté que la qualité des schémas finaux dépendait fortement de la collaboration entre l'IA et les experts humains. Bien que les modèles d'IA soient capables de générer des structures complexes et d'identifier des motifs à travers des centaines d'articles, ils nécessitaient souvent un guidage humain pour garantir l'exactitude scientifique et la terminologie appropriée. L'équipe a observé que les modèles d'IA devenaient plus détaillés et structurellement complexes à mesure qu'ils étaient exposés à davantage d'articles et à davantage de cycles de feedback des experts. Les schémas les plus vastes et les plus détaillés ont été générés par les modèles de suivi d'instructions les plus avancés, qui produisaient des contours avec des centaines de champs spécifiques et plusieurs couches d'organisation. Cependant, la décision finale sur ce qui constituait la structure de référence (« gold standard ») revenait toujours aux experts humains, qui sélectionnaient les meilleurs éléments des diverses ébauches de l'IA pour créer la version finale.

L'une des conclusions clés de l'étude est que ce partenariat humain-IA pouvait produire des schémas spécialisés de haute qualité bien plus rapidement que les méthodes manuelles traditionnelles ne le permettraient. L'équipe a réussi à développer et valider les 16 schémas en seulement deux mois, un délai qui aurait été impossible si les experts avaient dû extraire et organiser manuellement chaque détail de milliers d'articles. Le processus a également révélé que différents types de processus scientifiques nécessitent différents niveaux de détail. Certains processus, comme la « Tâche de Stroop » utilisée en psychologie pour mesurer les temps de réaction, ont abouti à des schémas avec moins de champs et moins de hiérarchisation, reflétant la nature plus simple et plus standardisée des expériences. D'autres, comme la « Préparation de bibliothèque de séquençage d'ARN (RNA-seq) en vrac » en biologie, ont abouti à des schémas hautement complexes avec de profondes couches d'informations imbriquées, reflétant la nature complexe et multi-étapes des procédures de laboratoire humide impliquées.

La collection publiée comprend non seulement les schémas finaux, mais aussi tout l'historique de leur création. L'archive de données contient les ébauches intermédiaires générées par l'IA, les retours fournis par les experts et les métadonnées des articles utilisés dans le processus. Cette transparence permet à d'autres chercheurs de voir exactement comment les schémas ont été construits, de comprendre le raisonnement derrière des choix de conception spécifiques et de réutiliser les matériaux pour leurs propres projets. Les schémas sont disponibles sous deux formats : l'un conçu pour les documents informatiques standards et un autre pour les graphes de connaissances, qui sont des réseaux de données liées utilisés pour connecter l'information à travers différentes sources. Ce double format garantit que les schémas peuvent être utilisés dans une grande variété de systèmes logiciels, des simples formulaires de saisie de données aux bases de données scientifiques complexes.

La portée de ce travail réside dans son potentiel à changer la manière dont la connaissance scientifique est stockée et partagée. En fournissant une manière structurée de décrire le « comment » de la science, SciSchema.org permet de dépasser les limites de la recherche textuelle. Au lieu de chercher des articles mentionnant un mot-clé spécifique, les chercheurs pourraient éventuellement rechercher toutes les expériences ayant utilisé une combinaison spécifique d'instruments, de conditions et de matériaux, quel que soit la façon dont les auteurs originaux les ont décrits dans leur prose. Cette capacité est essentielle pour l'avenir de la science, où la capacité de comparer, reproduire et automatiser les expériences sera critique pour résoudre des défis mondiaux complexes. Le projet démontre que si l'intelligence artificielle est un outil puissant pour organiser l'information, elle est plus efficace lorsqu'elle est guidée par l'expertise humaine, créant une synergie capable de capturer la nuance et la profondeur de la pratique scientifique sous une forme lisible par machine.

L'équipe a mis ces ressources librement à la disposition du public, publiant les schémas, le code utilisé pour les générer et les outils d'analyse sous des licences ouvertes. Cela garantit que la communauté scientifique peut bâtir sur ce fondement, en ajoutant de nouveaux schémas pour d'autres processus et en affinant les existants si nécessaire. Le projet inclut également des connexions avec l'Open Research Knowledge Graph, un système qui permet à ces descriptions structurées d'être liées directement aux articles scientifiques originaux, créant ainsi un pont entre le texte brut de la découverte et les données structurées de la reproductibilité. Ce faisant, SciSchema.org offre une étape concrète vers un avenir où les méthodes de la science seront aussi accessibles, comparables et réutilisables que les résultats eux-mêmes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →