← Últimos artigos
🧬 biology

Information-theoretic profiling of structural organization in human genes

Este estudo emprega uma estrutura de agrupamento baseada em teoria da informação fundamentada na entropia de cluster de Kullback–Leibler para analisar a organização estrutural de genes humanos específicos envolvidos na regulação epigenética e em transtornos do neurodesenvolvimento, demonstrando que os perfis de entropia resultantes são robustos e úteis para genômica comparativa e caracterização funcional de genes.

Autores originais: Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

Publicado 2026-09-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

O genoma humano é uma vasta biblioteca que contém as instruções para construir e operar um ser humano. Ele é escrito em um código químico feito de quatro letras, que representam os blocos de construção do DNA. Durante décadas, os cientistas focaram na leitura das palavras específicas neste livro — os genes que codificam proteínas — para entender como a vida funciona. No entanto, os espaços entre essas palavras, e a maneira como as letras são organizadas dentro delas, guardam um tipo diferente de segredo. Essas regiões não são apenas preenchimento vazio; elas contêm padrões complexos de organização que ajudam a controlar quando e onde os genes são ligados ou desligados. Para compreender essas estruturas ocultas, pesquisadores estão recorrendo a um ramo da matemática originalmente desenvolvido para medir informação e incerteza. Ao tratar as sequências de DNA como fluxos de dados, eles podem buscar padrões estatísticos que revelem como o código genético é organizado, sem a necessidade de alinhar ou comparar as sequências com outras espécies. Essa abordagem permite que vejam a "textura" do genoma, identificando áreas que se comportam de uma forma altamente ordenada versus aquelas que parecem mais aleatórias.

Em um estudo recente, pesquisadores do Politecnico di Torino, na Itália, aplicaram essa abordagem baseada em informação a cinco genes humanos específicos conhecidos por estarem envolvidos na regulação de como o DNA é empacotado e lido. Esses genes, chamados ASH1L, NSD1, NSD2, NSD3 e SETD2, são cruciais para o desenvolvimento e estão ligados a várias doenças quando apresentam mau funcionamento. A equipe queria ver se a "impressão digital" matemática desses genes poderia revelar sua estrutura interna. Eles começaram convertendo as longas sequências de letras de DNA em uma série de números. Para fazer isso de forma justa, agruparam as letras de DNA em duas categorias baseadas em sua forma química: aquelas com dois anéis e aquelas com um. Isso criou um mapa numérico equilibrado de cada gene, estendendo-se do início do gene até mil letras antes e depois dele, garantindo que capturassem o ambiente regulatório circundante.

Os pesquisadores então analisaram esses mapas numéricos deslizando uma janela ao longo da sequência, observando pequenos segmentos de cada vez. Para cada segmento, mediram como as letras se agrupavam e compararam esse padrão com um conjunto de modelos gerados por computador. Esses modelos representavam diferentes tipos de aleatoriedade, variando desde o ruído completamente caótico até padrões com conexões de longo alcance, semelhantes à forma como um sistema meteorológico pode ter correlações ao longo do tempo. O objetivo era descobrir qual modelo de computador melhor correspondia à sequência real de DNA. Se um segmento de DNA se comportasse exatamente como a pura aleatoriedade, a correspondência seria perfeita. Se mostrasse uma estrutura específica e não aleatória, a distância matemática entre o DNA real e o modelo aleatório aumentaria. Essa distância, ou divergência, servia como um sinal de quão estruturada era aquela parte do gene.

Os resultados revelaram um padrão marcante e consistente em todos os cinco genes. As seções de DNA que codificam proteínas, conhecidas como éxons, mostraram um sinal forte e distinto. Essas regiões codificantes demonstraram consistentemente desviar dos modelos aleatórios, indicando que possuem uma estrutura interna específica e organizada. Em contraste, as seções não codificantes, chamadas íntrons, que compõem a vasta maioria do comprimento do gene, comportaram-se de forma muito mais semelhante aos modelos aleatórios e não correlacionados. A medida matemática destacou efetivamente a diferença entre as partes "de trabalho" do gene e as partes "de espaçamento". Quando os pesquisadores compararam esses perfis matemáticos com os mapas biológicos conhecidos dos genes, os picos no sinal alinharam-se perfeitamente com as localizações dos éxons codificantes de proteínas. Os vales no sinal correspondiam aos íntrons.

Essa descoberta sugere que o método baseado na teoria da informação pode distinguir entre DNA codificante e não codificante sem a necessidade de conhecer a função biológica previamente. O estudo também observou outros elementos regulatórios, como promotores e enhancers, que atuam como interruptores para os genes. A conexão entre o sinal matemático e esses elementos regulatórios foi menos clara e variou de gene para gene, sugerindo que, embora a estrutura de codificação seja robustamente capturada por este método, a organização dos interruptores regulatórios é mais complexa e dependente de contexto. Os pesquisadores descobriram que a força do sinal nas regiões codificantes estava intimamente ligada ao tamanho do gene e à quantidade de DNA codificante que ele continha.

O estudo demonstra que a organização estrutural dos genes humanos deixa uma assinatura estatística detectável. Ao utilizar um método que mede o quanto uma sequência difere da aleatoriedade pura, os pesquisadores foram capazes de mapear a arquitetura interna de genes complexos. A abordagem provou ser robusta, funcionando consistentemente quer os dados fossem analisados em seções sobrepostas ou não sobrepostas. Embora o método separe claramente as regiões codificantes das não codificantes, sua capacidade de identificar interruptores regulatórios específicos ainda está em desenvolvimento. O trabalho oferece uma nova maneira complementar de observar o genoma, que se baseia nas propriedades matemáticas da própria sequência, em vez de apenas compará-la com outras sequências conhecidas. Isso poderá, eventualmente, ajudar cientistas a identificar regiões funcionais no genoma de forma mais eficiente, proporcionando uma compreensão mais profunda de como o código genético é organizado para sustentar a vida.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →