← Últimos artículos
📄 molecular biology

An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites

Los autores presentan Albatross, un modelo de lenguaje de ARN entrenado únicamente con datos de secuencias que supera significativamente a los métodos existentes en la predicción de estructuras de sitios internos de entrada al ribosoma, permitiendo el descubrimiento de nuevas subclases funcionales y acelerando la identificación de dianas antivirales.

Autores originales: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Publicado 2026-09-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Los virus son maestros del disfraz, pero sus secretos más críticos suelen esconderse a plena vista dentro de su código genético. Para muchos virus, incluidos los picornavirus que causan desde el resfriado común hasta devastadoras enfermedades neurológicas, las instrucciones para fabricar nuevas partículas virales no son solo una simple lista de letras. Se pliegan en formas tridimensionales complejas. Estas formas actúan como interruptores y asideros, permitiendo al virus secuestrar la maquinaria de fabricación de proteínas de la célula. Una de las formas más importantes de estas es llamada Sitio de Entrada Interna del Ribosoma, o IRES. A diferencia de las células humanas, que normalmente necesitan una caperuza específica al inicio de sus instrucciones genéticas para comenzar a leerlas, estos IRESes virales actúan como una invitación directa, permitiendo que el virus comience a construir proteínas de inmediato e independientemente. Comprender exactamente cómo se pliegan estos IRESes es vital para entender por qué algunos virus infectan tejidos específicos, por qué algunos causan enfermedades graves mientras que otros no, y cómo podríamos diseñar fármacos para detenerlos. Sin embargo, estas estructuras son notoriamente difíciles de mapear. Son largas, altamente variables y cambian de forma dependiendo del entorno, lo que hace que los métodos tradicionales de predicción sean lentos y a menudo inexactos.

Un equipo de investigadores ha desarrollado ahora una nueva forma de ver estas formas ocultas, evitando la necesidad de experimentos costosos y lentos. Crearon un sistema de inteligencia artificial, al que llamaron Albatross, entrenado exclusivamente con las secuencias genéticas puras de miles de estos elementos virales. El sistema no recibió ninguna información sobre cómo se pliega el ARN, las reglas de la química o la física de la estabilidad. Simplemente se le alimentó con millones de secuencias y se le pidió que aprendiera los patrones dentro de ellas. Sorprendentemente, el modelo aprendió a predecir la estructura tridimensional de estos elementos virales con alta precisión, simplemente reconociendo las relaciones estadísticas entre las letras de la secuencia. Cuando los investigadores probaron Albatross contra una biblioteca de 96 IRESes virales de longitud completa, las predicciones del modelo fueron mucho más precisas que las de los mejores métodos existentes. Mientras que otras herramientas identificaron correctamente menos de la mitad de las conexiones estructurales reales, Albatross acertó el 80 por ciento de las veces.

El poder de este enfoque reside en lo que el modelo realmente aprendió. No solo memorizó las formas; aprendió la lógica del virus. Al analizar cómo un cambio en una parte de la secuencia afectaba la predicción de otra parte, el modelo identificó qué piezas del ARN deben estar cerca una de otra para funcionar. Esto permitió a los investigadores distinguir entre formas que son meramente estables y aquellas que son esenciales para que el virus funcione. De hecho, el modelo fue tan bueno detectando estructuras funcionales que pudo predecir qué partes del ARN tenían más probabilidades de estar involucradas en el inicio del proceso de infección. Esta capacidad permitió al equipo construir un atlas masivo de más de 75,000 estructuras predichas, cubriendo una vasta diversidad de virus que nunca habían sido estudiados con este nivel de detalle.

Utilizando este nuevo mapa, los investigadores descubrieron algo completamente nuevo. Encontraron un subgrupo de estructuras virales previamente desconocido que incluía un tallo extendido, un patrón de plegamiento específico que no se había visto antes en esta clase de virus. Los investigadores probaron este descubrimiento en el laboratorio, confirmando que el tallo extendido era real y que desempeñaba un papel crucial en la capacidad del virus para funcionar. Este hallazgo sugiere que el modelo puede descubrir verdades biológicas que antes eran invisibles para los científicos. Además, el equipo demostró que este método no se limita a un solo tipo de virus. Cuando aplicaron la misma estrategia de entrenamiento al material genético de hantavirus y sensores bacterianos, el modelo identificó con éxito interacciones complejas de largo alcance e incluso la capacidad de una sola molécula de ARN de cambiar entre dos formas diferentes según su entorno.

Las implicaciones de este trabajo se extienden mucho más allá del mapeo de virus. Durante décadas, los científicos han luchado por predecir la estructura del ARN porque las moléculas son muy flexibles y las reglas que las gobiernan son muy compleas. Los métodos tradicionales suelen depender del cálculo de la energía de cada forma posible, un proceso que se vuelve imposible para secuencias largas. Otros métodos requieren comparar muchos virus similares para encontrar patrones, lo cual falla cuando los virus son demasiado diferentes. Albatross evita estos problemas aprendiendo directamente de los datos de la secuencia misma. Los investigadores encontraron que la precisión del modelo mejoraba a medida que aumentaban el tamaño de los datos de entrenamiento y el tamaño del modelo, lo que sugiere que este enfoque puede seguir mejorando con más datos.

Este estudio representa un cambio significativo en cómo abordamos la biología del ARN. En lugar de tratar estas moléculas como rompecabezas estáticos para ser resueltos con ecuaciones de física, los investigadores las trataron como un lenguaje para ser aprendido. Los resultados muestran que la historia evolutiva de un virus está codificada en su secuencia de una manera que una inteligencia artificial puede decodificar. Al revelar la lógica estructural de estos elementos virales, el trabajo proporciona una poderosa nueva herramienta para comprender cómo operan los virus y cómo podrían ser detenidos. La capacidad de predecir estas estructuras a escala significa que los científicos ahora pueden explorar el potencial funcional de miles de secuencias virales que antes eran demasiado difíciles de estudiar, abriendo la puerta a nuevos descubrimientos en virología y medicina.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →