← Derniers articles
🧬 biology

Information-theoretic profiling of structural organization in human genes

Cette étude emploie un cadre de partitionnement fondé sur la théorie de l'information, basé sur l'entropie de cluster de Kullback–Leibler, pour analyser l'organisation structurelle de gènes humains spécifiques impliqués dans la régulation épigénétique et les troubles du neurodéveloppement, démontrant que les profils d'entropie résultants sont robustes et utiles pour la génomique comparative et la caractérisation fonctionnelle des gènes.

Auteurs originaux : Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

Publié 2026-09-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Le génome humain est une vaste bibliothèque contenant les instructions pour construire et faire fonctionner un être humain. Il est écrit dans un code chimique composé de quatre lettres, représentant les briques élémentaires de l'ADN. Pendant des décennies, les scientifiques se sont concentrés sur la lecture des mots spécifiques de ce livre — les gènes qui codent pour les protéines — afin de comprendre comment la vie fonctionne. Cependant, les espaces entre ces mots, et la manière dont les lettres sont disposées à l'intérieur de ceux-ci, recèlent un autre type de secret. Ces régions ne sont pas de simples remplissages vides ; elles contiennent des motifs d'organisation complexes qui aident à contrôler quand et où les gènes s'activent ou se désactivent. Pour comprendre ces structures cachées, les chercheurs se tournent vers une branche des mathématiques initialement développée pour mesurer l'information et l'incertitude. En traitant les séquences d'ADN comme des flux de données, ils peuvent rechercher des motifs statistiques qui révèlent comment le code génétique est organisé, sans avoir besoin d'aligner ou de comparer les séquences à d'autres espèces. Cette approche leur permet de percevoir la « texture » du génome, identifiant les zones qui se comportent de manière hautement ordonnée par rapport à celles qui paraissent plus aléatoires.

Dans une étude récente, des chercheurs du Politecnico di Torino en Italie ont appliqué cette approche basée sur l'information à cinq gènes humains spécifiques connus pour être impliqués dans la régulation de la façon dont l'ADN est empaqueté et lu. Ces gènes, nommés ASH1L, NSD1, NSD2, NSD3 et SETD2, sont cruciaux pour le développement et sont liés à diverses maladies lorsqu'ils dysfonctionnent. L'équipe voulait voir si l'« empreinte digitale » mathématique de ces gènes pouvait révéler leur structure interne. Ils ont commencé par convertir les longues chaînes de lettres d'ADN en une série de nombres. Pour ce faire de manière équitable, ils ont regroupé les lettres d'ADN en deux catégories basées sur leur forme chimique : celles possédant deux cycles et celles en possédant un seul. Cela a créé une carte numérique équilibrée de chaque gène, s'étendant du début du gène jusqu'à mille lettres avant et après, garantissant ainsi qu'ils capturaient l'environnement régulateur environnant.

Les chercheurs ont ensuite analysé ces cartes numériques en faisant glisser une fenêtre le long de la séquence, en examinant de petits segments à la fois. Pour chaque segment, ils ont mesuré comment les lettres se regroupaient et ont comparé ce motif à un ensemble de modèles générés par ordinateur. Ces modèles représentaient différents types de hasard, allant du bruit purement chaotique à des motifs présentant des connexions à longue portée, semblables à la façon dont un système météorologique peut présenter des corrélations dans le temps. L'objectif était de trouver quel modèle informatique correspondait le mieux à la séquence d'ADN réelle. Si un segment d'ADN se comportait exactement comme un hasard pur, la correspondance serait parfaite. S'il présentait une structure spécifique et non aléatoire, la distance mathématique entre l'ADN réel et le modèle aléatoire augmenterait. Cette distance, ou divergence, servait de signal de la manière dont cette partie du gène était structurée.

Les résultats ont révélé un motif frappant et cohérent à travers les cinq gènes. Les sections d'ADN qui codent pour les protéines, appelées exons, ont montré un signal fort et distinct. Ces régions codantes divergeaient systématiquement des modèles aléatoires, indiquant qu'elles possèdent une structure interne spécifique et organisée. En revanche, les sections non codantes, appelées introns, qui constituent la vaste majorité de la longueur du gène, se comportaient beaucoup plus comme les modèles aléatoires et non corrélés. La mesure mathématique a efficacement mis en évidence la différence entre les parties « actives » du gène et les parties « espacées ». Lorsque les chercheurs ont comparé ces profils mathématiques aux cartes biologiques connues des gènes, les pics dans le signal coïncidaient parfaitement avec les emplacements des exons codant pour les protéines. Les creux dans le signal correspondaient aux introns.

Cette découverte suggère que la méthode de l'information théorique peut distinguer l'ADN codant de l'ADN non codant sans connaître au préalable la fonction biologique. L'étude a également examiné d'autres caractéristiques régulatrices, telles que les promoteurs et les amplificateurs (enhancers), qui agissent comme des interrupteurs pour les gènes. La connexion entre le signal mathématique et ces éléments régulateurs était moins claire et variait d'un gène à l'autre, suggérant que si la structure codante est solidement captée par cette méthode, l'organisation des interrupteurs régulateurs est plus complexe et dépendante du contexte. Les chercheurs ont constaté que la force du signal dans les régions codantes était étroitement liée à la taille du gène et à la quantité d'ADN codant qu'il contenait.

L'étude démontre que l'organisation structurelle des gènes humains laisse une signature statistique détectable. En utilisant une méthode qui mesure à quel point une séquence diffère du hasard pur, les chercheurs ont pu cartographier l'architecture interne de gènes complexes. L'approche s'est avérée robuste, fonctionnant de manière cohérente, que les données soient analysées en sections chevauchantes ou non chevauchantes. Bien que la méthode sépare clairement les régions codantes des régions non codantes, sa capacité à identifier précisément les interrupteurs régulateurs spécifiques est encore en développement. Ce travail offre une nouvelle façon complémentaire d'observer le génome, qui repose sur les propriétés mathématiques de la séquence elle-même plutôt que sur la simple comparaison avec d'autres séquences connues. Cela pourrait éventuellement aider les scientifiques à identifier les régions fonctionnelles du génome plus efficacement, offrant une compréhension plus profonde de la manière dont le code génétique est organisé pour soutenir la vie.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →