← Derniers articles
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

Ce document présente Botanic1, une famille de modèles de langage génomiques à contexte long et intégrés à des agents, entraînés sur des données végétales non annotées, qui surpassent les modèles existants dans la prédiction de régions associées aux traits et fournissent des informations biologiques grâce à l'interprétabilité mécaniste, tout en étant mis à la disposition de la communauté de recherche pour accélérer le développement de cultures résilientes au climat.

Auteurs originaux : Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Publié 2026-09-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Imaginez un monde où le code de la vie est écrit dans un langage de quatre lettres : A, C, G et T. Ces lettres forment les séquences d'ADN qui dictent la croissance d'une plante, sa résistance à la sécheresse et sa capacité à lutter contre les maladies. Depuis des décennies, les scientifiques tentent de lire ce langage, mais il s'agit d'un texte massif et complexe comprenant des milliards de mots, dont une grande partie est écrite dans un dialecte qui change d'une espèce à l'autre. Lorsqu'une plante est confrontée à un climat rude ou à un nouveau parasite, la solution réside souvent dans un changement infime de ce code — un simple échange de lettre qui pourrait rendre une culture plus forte. Trouver ce changement spécifique revient à chercher une aiguille dans une botte de foin, mais la botte de foin est de la taille d'une bibliothèque, et l'aiguille est invisible à l'œil nu. Les méthodes traditionnelles reposent sur la comparaison de nombreuses plantes pour trouver des modèles, mais cela est lent, coûteux et laisse souvent les chercheurs avec des milliers de possibilités au lieu d'une seule réponse claire.

Une équipe de chercheurs à Paris a introduit une nouvelle façon de lire ce texte biologique. Ils ont construit une famille de modèles d'intelligence artificielle, qu'ils appellent Botanic1, conçus spécifiquement pour comprendre la grammaire de l'ADN des plantes. Contrairement aux outils précédents qui nécessitaient que les humains leur enseignent les règles de la biologie, ces modèles ont appris le langage par eux-mêmes. On leur a fourni les séquences génétiques de 320 espèces végétales différentes, allant de la mousse minuscule aux arbres imposants, et on leur a demandé de prédire les lettres manquantes dans la séquence. En faisant cela des millions de fois, les modèles ont appris les règles cachées de la structure de l'ADN, la manière dont les gènes s'activent et se désactivent, et comment de minuscules changements dans le code affectent la plante. Le résultat est un système capable d'examiner une longue portion d'ADN et de détecter instantanément quelles parties sont critiques pour la survie de la plante et quels changements pourraient être nocifs ou bénéfiques.

Les chercheurs n'ont pas seulement construit un modèle ; ils ont créé une « usine » qui utilise des agents logiciels intelligents pour gérer l'ensemble du processus d'entraînement et de test de ces modèles. Ces agents effectuent le travail de fond, organisant les données, menant des expériences et corrigeant les erreurs, permettant ainsi aux scientifiques humains de se concentrer sur les grandes idées. Cette approche leur a permis d'entraîner des modèles capables de lire des séquences d'ADN allant jusqu'à 128 000 lettres, une longueur qui capture les interactions à longue distance entre les différentes parties du génome, ce qui était auparavant impossible à analyser ensemble. Lors des tests, ces modèles ont surpassé tous les autres outils existants pour comprendre la génétique végétale, y compris ceux qui étaient beaucoup plus vastes et entraînés sur beaucoup plus de données. Ils ont été capables d'identifier les parties les plus importantes de l'ADN, telles que les limites où les gènes commencent et s'arrêtent, et même de repérer les signaux spécifiques qui indiquent à une cellule comment couper et coller ses instructions génétiques.

Ce qui rend cette découverte particulièrement puissante, c'est que les modèles ont appris ces règles sans qu'on ne les leur indique. Lorsque les chercheurs ont examiné l'intérieur des modèles pour voir ce qu'ils avaient appris, ils ont découvert que l'IA avait découvert de manière indépendante des concepts biologiques comme les « sites d'épissage », qui sont les instructions pour la manière dont un gène est édité avant de devenir une protéine. Dans un exemple frappant, le modèle a identifié un emplacement spécifique dans un gène que les bases de données scientifiques standards avaient marqué incorrectement pendant plus de vingt ans. La logique interne du modèle pointait vers un autre endroit, et lorsque les chercheurs ont vérifié l'historique de ce gène, ils ont découvert que la description originale de 1999 était en fait correcte, et que le modèle avait redécouvert la vérité qui avait été perdue lors des mises à jour ultérieures. Cela suggère que ces modèles peuvent agir comme un nouveau type de microscope, révélant des vérités biologiques cachées dans les données mais manquées par l'annotation humaine.

L'équipe a également démontré comment ces modèles peuvent travailler aux côtés des chercheurs humains d'une manière nouvelle. Ils ont mis en place un scénario où un agent d'intelligence artificielle à usage général a été chargé de trouver la cause d'un trait spécifique chez le melon : pourquoi certaines plantes produisent des fleurs femelles et d'autres produisent à la fois des fleurs mâles et femelles. L'agent a reçu une liste de milliers de différences génétiques et lui a été demandé de trouver celle qui est responsable. Lorsque l'agent a tenté de résoudre cela en utilisant uniquement les outils standards, il a pu réduire la liste mais n'a pas pu choisir la bonne réponse. Cependant, lorsque les chercheurs ont donné à l'agent l'accès au modèle Botanic1 en tant qu'outil, l'agent a immédiatement classé le changement génétique correct comme le candidat numéro un. Le modèle fournissait une mesure continue de la surprise causée par un changement génétique, ce qui a aidé l'agent à distinguer la véritable cause du bruit de fond.

Ce travail représente une étape significative dans notre façon d'étudier les plantes. En apprenant aux machines à lire le langage de l'ADN, les chercheurs ont créé des outils qui peuvent accélérer la recherche de cultures capables de résister à un climat changeant. Ces modèles ne sont pas seulement plus rapides ; ils sont plus précis et peuvent voir des motifs qui étaient auparavant invisibles. Ils offrent un moyen de passer de la supposition sur l'importance de certains gènes à la certitude de savoir lesquels sont importants. En mettant ces outils à la disposition de la communauté scientifique, les chercheurs ouvrent la porte à une nouvelle ère de la biologie végétale, où le code complexe de la vie peut être compris et amélioré avec une vitesse et une précision qui étaient auparavant hors de portée. Les modèles sont désormais disponibles pour que d'autres scientifiques puissent les utiliser, promettant d'aider à cultiver de meilleures récoltes et à comprendre les mécanismes fondamentaux de la vie dans le règne végétal.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →