← Últimos artículos
🧬 biology

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA introduce un marco de entrenamiento continuo agnóstico al modelo que integra Arquitecturas Predictivas de Incrustación Conjunta con objetivos generativos tradicionales para desplazar los modelos fundacionales genómicos desde la reconstrucción a nivel de token hacia la alineación semántica, logrando un rendimiento de vanguardia a través de diversos parámetros de referencia genómicos.

Autores originales: Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Mariss
Publicado 2026-08-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina el cuerpo humano como una biblioteca masiva y antigua. Dentro de esta biblioteca, cada una de las instrucciones para construir y hacer funcionar a una persona está escrita en un código compuesto por solo cuatro letras: A, C, G y T. Este código es el ADN. Durante mucho tiempo, los científicos han intentado enseñar a las computadoras a leer esta biblioteca, con la esperanza de que, si una computadora entiende la "gramática" del ADN, pueda predecir cómo funciona nuestro cuerpo, por qué nos enfermamos o cómo reparar fallos genéticos.

Para lograr esto, los investigadores utilizan algo llamado "Modelos Fundacionales". Piensa en ellos como estudiantes superinteligentes que han leído millones de libros (secuencias de ADN) y han aprendido las reglas del lenguaje. Por lo general, estos estudiantes aprenden jugando al juego de "completar el espacio en blanco". Si cubres una palabra en una oración, el estudiante tiene que adivinar cuál era basándose en las palabras que la rodean. Esto funciona muy bien para aprender las reglas locales de la oración, como cómo encajan las palabras entre sí. Pero aquí está el problema: conocer la gramática no siempre significa que entiendas la historia. Un estudiante puede saber que "El gato se sentó en el..." suele ir seguido de "tapete", pero es posible que no entienda que el gato en realidad se está escondiendo de un perro, o que toda la escena es parte de un misterio mayor. En el ADN, esto significa que las computadoras son buenas detectando patrones pequeños, pero a menudo pierden de vista el panorama general de cómo las diferentes partes del código trabajan juntas para controlar la vida.

Aquí es donde entra un nuevo estudio llamado JEPA-DNA. Los investigadores, un equipo de NVIDIA y centros médicos en Israel y los EE. UU., decidieron mejorar a estos estudiantes lectores de ADN. Introdujeron un nuevo método de entrenamiento que obliga a la computadora a dejar de simplemente adivinar las letras faltantes y empezar a adivinar el significado de las partes faltantes. En lugar de preguntar "¿Qué letra va aquí?", preguntan "¿Cuál es el trabajo de este fragmento entero de ADN?".

El equipo probó este nuevo método en 17 tareas diferentes, que van desde encontrar dónde comienzan los genes (promotores) hasta predecir cómo los cambios genéticos afectan la salud. Lo probaron en tres tipos diferentes de computadoras lectoras de ADN (DNABERT-2, NTv3 e HyenaDNA) para asegurarse de que funcionara para todos. Los resultados fueron impresionantes: al añadir este nuevo entrenamiento "enfocado en el significado", las computadoras mejoraron en casi todas las tareas. Por ejemplo, en una tarea llamada "GUE Promoter", el nuevo método mejoró el rendimiento en más de un 11%. En otra tarea relacionada con variantes de enfermedades, aumentó la capacidad de detectar problemas en más de un 12%.

El artículo sugiere que este enfoque funciona porque enseña a la computadora a mirar el "bosque" en lugar de solo los "árboles". Mientras que los métodos antiguos eran excelentes para memorizar la sintaxis local (el orden específico de las letras), JEPA-DNA ayuda al modelo a comprender el contexto funcional global (qué es lo que esa secuencia realmente hace en el cuerpo). Los investigadores descubrieron que esta nueva forma de aprendizaje crea un "modelo de mundo" de la biología, donde la computadora entiende las reglas de la vida, no solo la ortografía. Incluso demostraron que este método funciona mejor que los mejores modelos disponibles actualmente, estableciendo un nuevo estándar para lo que estos sistemas de IA pueden lograr. Es como tomar a un estudiante que era bueno en ortografía y enseñarle a ser un crítico literario que comprende la trama, los personajes y el tema, todo al mismo tiempo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →