← Derniers articles
📄 evolutionary biology

EXCON: a scalable, reproducible Nextflow pipeline for CAFE-based gene EXpansion and CONtraction analysis

EXCON est un pipeline Nextflow évolutif et automatisé qui rationalise l'intégralité du flux de travail pour l'analyse de l'expansion et de la contraction des familles de gènes basée sur CAFE — du prétraitement du génome et de l'identification des orthologues jusqu'à la modélisation de naissance-décès et l'enrichissement fonctionnel — permettant une génomique comparative évolutive reproductible avec une configuration utilisateur minimale.

Auteurs originaux : Wyatt, C. D. R., Duarte, F., Cerqueira De Araujo, A., Murray, S., Oi, C., Sumner, S.

Publié 2026-10-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wyatt, C. D. R., Duarte, F., Cerqueira De Araujo, A., Murray, S., Oi, C., Sumner, S.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

La vie est écrite dans un code de gènes, mais la longueur de ce code n'est pas fixe. Tout comme une bibliothèque peut acquérir de nouveaux livres ou en perdre d'anciens au fil du temps, les génomes des espèces vivantes gagnent et perdent des copies de leurs gènes. Parfois, un gène se duplique, créant des copies supplémentaires qui peuvent développer de nouvelles fonctions ; d'autres fois, un gène est entièrement perdu. Ces changements dans le nombre de copies de gènes sont un moyen principal par lequel les lignées s'adaptent à de nouveaux environnements, développent des traits complexes ou s'engagent dans les courses aux armements biologiques incessantes entre hôtes et agents pathogènes. Pour comprendre comment une espèce a évolué, les scientifiques cherchent souvent ces expansions et contractions spécifiques dans le registre génétique. Cependant, les identifier a historiquement été une tâche difficile, exigeant un haut niveau de compétence technique pour télécharger les données, les nettoyer et exécuter des modèles statistiques complexes qui suivent ces changements à travers l'arbre de la vie.

Une équipe de chercheurs de l'University College London a maintenant construit un outil qui lève cette barrière, transformant un processus multi-étapes réservé aux experts en un flux de travail automatisé unique. Ils ont créé un pipeline appelé EXCON, qui agit comme un guide complet pour analyser la croissance et la réduction des familles de gènes. Au lieu d'exiger qu'un chercheur télécharge manuellement des fichiers de génome, les formate et exécute des programmes distincts pour trouver des gènes apparentés et modéliser leur évolution, EXCON gère chaque étape du début à la fin. Il commence par rassembler les données génomiques, vérifie la qualité de ces données, identifie des groupes de gènes apparentés à travers différentes espèces, puis utilise un modèle statistique pour calculer précisément où et quand les familles de gènes se sont expansées ou contractées. Le système est conçu pour être portable, ce qui signifie qu'il peut fonctionner sur un ordinateur portable standard, un supercalculateur universitaire ou dans le cloud, et il ajuste automatiquement ses calculs pour garantir que les résultats soient fiables.

Pour tester l'efficacité de leur nouvel outil, les chercheurs l'ont appliqué à un groupe diversifié de vingt-quatre espèces de primates, allant des lémuriens et des loris aux singes, aux grands singes et aux humains. Cet ensemble de données couvre environ soixante-onze millions d'années d'évolution. Le pipeline a traité avec succès les données et a identifié trois cent cinquante-huit familles de gènes qui évoluaient rapidement, montrant des changements significatifs dans leur nombre de copies à travers l'arbre phylogénétique des primates. L'une des découvertes les plus frappantes concernait une famille de gènes spécifique connue sous le nom de DUX, qui est située dans une région hautement instable du génome. L'analyse a révélé que cette famille de gènes ne s'est pas contentée de changer une seule fois dans une lignée unique ; au contraire, elle a connu des poussées répétées et indépendantes d'expansion et de contraction à travers de nombreuses branches différentes de l'arbre des primates. Par exemple, la famille de gènes s'est considérablement étendue chez les macaques et les gorilles, mais s'est contractée chez les babouins et d'autres espèces. Ce schéma correspondait à ce que les scientifiques savaient déjà sur l'instabilité physique de la région d'ADN où vit ce gène, confirmant que le pipeline automatisé pouvait détecter des signaux évolutifs réels et complexes sans aucune curation humaine préalable.

Au-delà de l'identification de gènes spécifiques, les chercheurs ont utilisé le pipeline pour comprendre les fonctions plus larges des gènes qui changeaient. Ils ont trouvé que les gènes impliqués dans la machinerie de base de la fabrication des protéines, tels que ceux trouvés dans les ribosomes, avaient tendance à s'étendre dans l'ensemble du groupe des primates. En revanche, les gènes liés à la production d'énergie dans les mitochondries ont montré des signes de contraction, mais seulement dans des lignées spécifiques comme les humains et certains singes. Un signal particulièrement clair est apparu chez les lémuriens, où les gènes responsables de l'odorat se sont considérablement étendus. Cela concorde avec la biologie connue de ces animaux, qui dépendent davantage de l'odorat que de la vision, un trait qui les distingue des autres primates de l'étude. Les chercheurs ont également noté que, bien que l'outil soit robuste, il peut parfois éprouver des difficultés avec des assemblages de génomes très fragmentés ou de faible qualité, ce qui pourrait créer de faux signaux de perte ou de gain de gènes, les utilisateurs sont donc invités à utiliser les meilleures données disponibles.

Le développement d'EXCON représente un changement vers la rendre l'analyse génomique complexe accessible à une communauté plus large de biologistes qui pourraient ne pas avoir de formation spécialisée en informatique. En intégrant l'ensemble du flux de travail dans un paquet unique et reproductible, l'outil garantit que les résultats peuvent être vérifiés et répétés par n'importe qui, n'importe où. Les chercheurs ont démontré que le pipeline pouvait traiter des ensembles de données allant des bactéries aux insectes et aux mammifères, s'adaptant à différents niveaux de diversité génétique et de qualité de génome. Bien que l'outil se concentre actuellement sur l'évolution des familles de gènes, l'équipe prévoit d'étendre ses capacités à l'avenir pour inclure d'autres types d'analyses génétiques. Pour l'instant, EXCON se présente comme une solution entièrement automatisée qui permet aux scientifiques de poser des questions fondamentales sur la façon dont la vie change au fil du temps, transformant un défi technique autrefois intimidant en un processus simple et fiable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →