← Derniers articles
🧬 biology

Machine-Readable Database for Genotype-Phenotype Analyses in Rare Diseases Using FKTN-related Congenital Muscular Dystrophies as a Prototype

Cet article présente une base de données lisible par machine agrégeant la littérature publiée sur les dystrophies musculaires congénitales liées à FKTN, présentant des données génotype-phénotype harmonisées et une nouvelle échelle de sévérité clinique afin de faciliter la corrélation génotype-phénotype et de servir de projet pilote pour des analyses similaires de maladies rares.

Auteurs originaux : Matthew E. Lefkowitz, Sofia G. Eisenberg, Ruili Huang, Uma S. Mudunuri, Robert Leaman, Zhiyong Lu, Svetlana Gorokhova, Sharie J. Haugabook, Elizabeth A. Ottinger, Ann R. Knebel, Donald C. Lo, Carsten
Publié 2026-09-17
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Matthew E. Lefkowitz, Sofia G. Eisenberg, Ruili Huang, Uma S. Mudunuri, Robert Leaman, Zhiyong Lu, Svetlana Gorokhova, Sharie J. Haugabook, Elizabeth A. Ottinger, Ann R. Knebel, Donald C. Lo, Carsten G. Bönnemann, A. Reghan Foley

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Résumé technique : Base de données lisible par machine pour les analyses génotype-phénotype dans les dystrophies musculaires congénitales liées à FKTN

Énoncé du problème
Les dystrophies musculaires congénitales (DMC) liées à FKTN représentent un sous-ensemble hautement hétérogène et ultra-rare des α\alpha-dystroglycanopathies. Bien que le gène FKTN soit une cause biallélique bien définie de ces troubles, la littérature clinique est fragmentée dans près de 100 manuscrits décrivant des populations disparates et des phénotypes variés. Actuellement, ces données existent principalement sous forme de texte non structuré dans des rapports de cas et des séries, manquant d'harmonisation. Cette absence d'une base de données complète et lisible par machine entrave la capacité de prédire la pathogénicité génétique, de comprendre les mécanismes pathogéniques et d'explorer les opportunités thérapeutiques pour ces maladies rares. Les bases de données génomiques existantes (par exemple, ClinVar, LOVD) manquent souvent d'informations phénotypiques détaillées et standardisées liées à des génotypes spécifiques.

Méthodologie
Les auteurs ont employé un pipeline rigoureux à plusieurs étapes pour extraire, harmoniser et structurer les données de la littérature :

  1. Identification et extraction de la littérature :

    • Une recherche itérative dans PubMed (janvier 2022 – avril 2024) utilisant des termes liés à FKTN, fukutin, dystroglycanopathy et muscular dystrophy a identifié 288 manuscrits.
    • Après filtrage selon la pertinence et les critères d'inclusion (patients présentant des variants FKTN et des données cliniques), 92 manuscrits ont été retenus, couvrant 749 patients (386 rapports de cas/séries individuels et 363 patients groupés).
    • Les données ont été extraites manuellement dans un tableur (« catalogue ») organisé par patient plutôt que par manuscrit afin d'éviter les doublons. Les champs extraits comprenaient les variants, le sexe, l'ethnicité, l'âge d'apparition, les manifestations cliniques à travers quatre systèmes organiques (muscle, neurologique, cardiaque, ophtalmologique) et les résultats de traitement.
  2. Harmonisation du génotype :

    • Les variants ont été normalisés au format Genome Reference Consortium Human Build 38 (GRCh38/HG38).
    • En raison de l'existence de 10 isoformes distinctes du transcrit FKTN dans NCBI et de l'absence fréquente de spécification de l'isoforme dans la littérature plus ancienne, les variants ont été recoupés avec les dix isoformes en utilisant des outils incluant VariantValidator, Varsome, Mutalyzer 3 et NCBI Nuccore.
    • Les conflits ont été résolus en privilégiant les bases de données cliniquement validées (LOVD, ClinVar) ou en reconstruisant les localisations originales à partir des spécificités des articles.
    • Les données ont été converties en un format standard de type VCF (Variant Call Format), avec des modifications spécifiques pour les insertions et les délétions. Les notations d'haplotypes qui ne pouvaient pas être cartographiées vers des variants spécifiques ont été exclues.
  3. Harmonisation du phénotype (Pipeline NLP) :

    • Les descriptions cliniques en langage naturel ont été converties en termes de l'Ontologie des Phénotypes Humains (HPO) à l'aide de PhenoTagger.
    • Pour remédier à l'incapacité de l'outil à détecter les négations (par exemple, « absence de faiblesse musculaire » étant identifiée à tort comme un phénotype positif), les auteurs ont intégré NegBio et développé des scripts personnalisés. Ces scripts utilisaient un dictionnaire de termes de négation pour filtrer les faux positifs.
    • Cette approche combinée a permis de filtrer plus de 90 % des informations positives non pertinentes, réduisant les 505 termes HPO uniques initiaux à 341 phénotypes pertinents après curation manuelle pour éliminer les variables de confusion (par exemple, les symptômes induits par les stéroïdes).
  4. Développement d'une échelle de sévérité clinique :

    • Une nouvelle échelle de sévérité clinique a été développée sur la base du jalon moteur maximal atteint au cours de la vie d'un patient, en adaptant la classification modifiée d'Ueda.
    • Définitions de l'échelle :
      • 1 (Léger) : Ambulation indépendante atteinte.
      • 2 (Modéré) : Assise ou station debout indépendante atteinte.
      • 3 (Sévère) : N'a jamais atteint l'assise, la station debout ou le contrôle de la tête de manière indépendante.
      • C : Trop jeune pour déterminer le jalon.
      • X : Informations insuffisantes.
    • Des indicateurs binaires ont également été assignés pour la présence ou l'absence de pathologie neurologique, cardiaque et ophtalmologique.

Résultats clés

  • Composition du jeu de données : Le jeu de données final lisible par machine comprend 749 patients issus de 92 manuscrits. Après exclusion des « patients en plages » (PIR) pour garantir l'intégrité des données individuelles, l'analyse s'est concentrée sur les dossiers de patients spécifiques.
  • Résultats génétiques : 52 combinaisons de génotypes uniques ont été identifiées. La plus prévalente était l'homozygotie pour le variant fondateur ancestral japonais (insertion de rétrotransposon de 3 kb dans l'UTR 3'). D'autres variants notables incluaient le variant fondateur ashkénaze (c.1167dup) et des variants dans les populations turques.
  • Distribution phénotypique :
    • Sévérité : 60 patients ont été classés comme légers (1), 157 comme modérés (2) et 60 comme sévères (3). 11 étaient trop jeunes (C), et d'autres manquaient de données suffisantes (X).
    • Systèmes organiques : Les symptômes liés aux muscles affectaient 337 patients, les symptômes neurologiques (SNC) 173 patients, les symptômes ophtalmologiques 57 et les symptômes cardiaques 51.
  • Performance du NLP : L'intégration de NegBio et de scripts personnalisés a réussi à filtrer plus de 90 % des informations positives non pertinentes lors de l'extraction des phénotypes, améliorant considérablement la précision des données par rapport à l'utilisation de NegBio seul (taux de filtrage d'environ 60 %).

Signification et affirmations
L'article présente une approche complète d'extraction et d'harmonisation de la littérature pour les DMC liées à FKTN, servant de pilote pour l'extraction de données similaires dans d'autres maladies monogéniques rares.

  • Modèle méthodologique : Les auteurs positionnent ce travail comme un « modèle » (blueprint) pour la curation de données dans d'autres maladies monogéniques rares. Le pipeline semi-automatisé (extraction manuelle + harmonisation NLP + filtrage personnalisé) est conçu pour être reproductible pour d'autres troubles ayant des volumes de littérature similaires (~200 articles).
  • Principes de données FAIR : Le jeu de données transforme la littérature historique non structurée en données FAIR (Trouvables, Accessibles, Interopérables, Réutilisables), permettant l'intégration dans des registres de maladies rares plus larges.
  • Utilité clinique : La nouvelle échelle de sévérité clinique fournit une métrique standardisée pour catégoriser les données phénotypiques, facilitant les études de corrélation génotype/phénotype.
  • Automatisation future : Les auteurs notent modestement que, bien que l'automatisation actuelle soit limitée par la nécessité d'un étiquetage manuel et d'une harmonisation complexe des variants, ce jeu de données sert de contrôle et de terrain d'entraînement pour de futurs modèles de langage étendus (LLM) afin d'atteindre une extraction et une curation de la littérature entièrement autonomes.

Ce travail est soutenu par l'Intramural Research Program du NIH et est mis à disposition via la base de données RARe-SOURCE® et les dépôts GitHub associés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →