← Últimos artículos
🧠 neurology

Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts

Este estudio demuestra que los oráculos genómicos de aprendizaje profundo no logran generalizar los efectos de las secuencias a través de diferentes contextos de huéspedes, ya que sus predicciones para la actividad de los elementos reguladores dependen altamente de la ubicación genómica específica y no pueden ser predichas de manera confiable únicamente por características de la secuencia.

Autores originales: Selahattin Alperen Uysal

Publicado 2026-09-21✓ Author reviewed ⓘ
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Selahattin Alperen Uysal

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje del genoma humano, ciertos tramos de ADN actúan como interruptores, encendiendo o apagando genes para controlar cómo funcionan las células. Los científicos han buscado durante mucho tiempo comprender el código preciso que indica a estos interruptores dónde trabajar y cuándo activarse. En años recientes, han surgido potentes programas informáticos para ayudar a decodificar este lenguaje. Estos programas, a menudo llamados "oráculos genómicos", pueden observar una cadena de letras de ADN y predecir cómo se comportará dentro de una célula viva, estimando si se abrirá para permitir la actividad génica o permanecerá cerrada. Debido a que estas herramientas digitales son rápidas y económicas en comparación con los experimentos de laboratorio, los investigadores utilizan cada vez más estos programas para diseñar nuevas secuencias de ADN, con la esperanza de crear interruptores personalizados que funcionen exactamente como se pretende. La esperanza subyacente es que, si un programa informático dice que una secuencia de ADN específica es un buen interruptor en una parte del genoma, seguirá siendo un buen interruptor si se mueve a una ubicación diferente.

Un nuevo estudio desafía este supuesto fundamental al probar si estas predicciones digitales se mantienen cuando la misma secuencia de ADN se coloca en diferentes vecindarios del genoma. Los investigadores se centraron en la esclerosis múltiple, una enfermedad en la que el sistema inmunológico ataca el sistema nervioso, y analizaron las regiones genéticas específicas que se sabe aumentan el riesgo de desarrollar la afección. Utilizaron un modelo de inteligencia artificial para generar miles de candidatas a secuencias de ADN que parecían poder funcionar como interruptores reguladores en las células inmunitarias. Luego utilizaron un oráculo genómico para calificar estas candidatas, seleccionando aquellas que la computadora predijo que serían las más activas. El equipo realizó entonces una prueba riguroosa: tomaron exactamente las mismas secuencias seleccionadas y las colocaron en veinticuatro ubicaciones diferentes dentro del genoma para ver si la predicción de la computadora se mantenía constante.

Los resultados revelaron una sorprendente falta de consistencia. Si bien el programa informático podía clasificar bien las secuencias dentro de una sola ubicación, sus predicciones no se generalizaron cuando las secuencias se movían. El efecto de un cambio específico en la secuencia de ADN no era una propiedad fija de la secuencia en sí; en cambio, dependía enteramente de dónde estuviera situada la secuencia en el genoma. En algunas ubicaciones, una edición específica del ADN hacía que la secuencia fuera más activa, mientras que en otras ubicaciones, esa misma edición hacía que fuera menos activa o no tenía ningún efecto. Los investigadores descubrieron que el comportamiento de la secuencia dependía tanto de su entorno que la variación entre diferentes ubicaciones era masiva, con el efecto revirtiendo su dirección en casi la mitad de los sitios probados.

Para entender qué estaba "viendo" realmente la computadora, el equipo realizó intervenciones directas en las secuencias de ADN. Probaron si la preferencia de la computadora era impulsada por la presencia de sitios de unión específicos para proteínas conocidas por controlar genes, o por la densidad de estos sitios. La respuesta fue negativa; eliminar estos sitios o cambiar su número no cambió la puntuación de la computadora de una manera predecible. En cambio, el factor que realmente importaba era el contenido de una estructura química específica llamada CpG, que involucra un apareamiento de dos letras de ADN. Sin embargo, incluso este factor no actuó solo. Aumentar la cantidad de esta estructura en el ADN mejoró la puntuación en algunas ubicaciones genómicas, pero perjudicó la puntuación en otras. La dirección del efecto estaba determinada por la ubicación huésped, no por la edición en sí misma.

El estudio también probó si un segundo programa informático, entrenado de forma independiente, produciría los mismos resultados. Este nuevo modelo, construido con una arquitectura diferente y entrenado con datos distintos, confirmó el hallazgo principal: el efecto de la edición del ADN era altamente inestable y variaba drásticamente según la ubicación genómica. Sin embargo, los dos programas no coincidieron en cuáles ubicaciones mostrarían un efecto positivo o negativo, lo que sugiere que, si bien la inestabilidad es un fenómeno real, los detalles específicos de cómo un modelo interpreta una ubicación son únicos para ese modelo.

Quizás de manera más crítica, los investigadores comprobaron si las secuencias seleccionadas por la computadora funcionaban mejor en un experimento del mundo real. Compararon las puntuaciones de la computadora con la actividad medida de un ensayo de laboratorio a gran escala que involucraba miles de elementos de ADN. Los criterios de selección de la computadora no lograron predecir qué secuencias eran verdaderamente activas en las células. De hecho, las secuencias que la computadora calificó como las de mejor rendimiento a menudo mostraban el comportamiento opuesto en el laboratorio, con los elementos más específicos y activos recibiendo las puntuaciones más bajas del oráculo. Esta desconexión sugiere que el objetivo específico que la computadora estaba optimizando no refleja la actividad biológica real del ADN.

Los investigadores también descubrieron que un método matemático mucho más simple, basado en el conteo de patrones de letras en el ADN, podía generar secuencias tan bien como los complejos modelos de inteligencia artificial de aprendizaje profundo. Este método simple, que no requiere computadoras potentes y puede ajustarse en segundos, igualó el rendimiento de las redes neuronales avanzadas en todas las medidas probadas. Este hallazgo implica que la complejidad de los modelos de aprendizaje profundo no era necesaria para capturar los patrones esenciales de las secuencias de ADN en este contexto.

En última instancia, el estudio concluye que un efecto a nivel de secuencia aprendido o medido por un oráculo genómico no es una propiedad de la secuencia por sí sola. Es una propiedad de la secuencia combinada con el contexto genómico específico en el que se encuentra. Esta dependencia de la ubicación no es predecible a partir de características simples y económicas del ADN circundante. Para los científicos que diseñan nuevos elementos genéticos, esto significa que un diseño elegido y validado en una simulación computacional en una ubicación determinada no ofrece ninguna garantía sobre cómo se comportará una vez que se mueva o se inserte en otro lugar. Los hallazgos sirven como una advertencia de que estas poderosas herramientas digitales, aunque útiles, aún no pueden confiarse para predecir el comportamiento de secuencias diseñadas a través del diverso paisaje del genoma humano sin una verificación experimental directa en múltiples ubicaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →