← Últimos artículos
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

Este artículo presenta Botanic1, una familia de modelos de lenguaje genómicos de contexto largo e integrados con agentes, entrenados en datos vegetales no anotados que superan a los modelos existentes en la predicción de regiones asociadas a rasgos y proporcionan información biológica a través de la interpretabilidad mecanística, todo ello mientras se pone a disposición de la comunidad investigadora para acelerar el desarrollo de cultivos resilientes al clima.

Autores originales: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Publicado 2026-09-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina un mundo donde el código de la vida está escrito en un lenguaje de cuatro letras: A, C, G y T. Estas letras forman las secuencias de ADN que dictan cómo crece una planta, cómo resiste la sequía y cómo lucha contra las enfermedades. Durante décadas, los científicos han intentado leer este lenguaje, pero es un texto masivo y complejo con miles de millones de palabras, gran parte de él escrito en un dialecto que cambia de una especie a otra. Cuando una planta se enfrenta a un clima riguroso o a una nueva plaga, la solución suele residir en un cambio minúsculo en este código: un simple intercambio de una letra que podría hacer que un cultivo sea más fuerte. Encontrar ese cambio específico es como buscar una aguja en un pajar, pero el pajar tiene el tamaño de una biblioteca y la aguja es invisible a la vista desnuda. Los métodos tradicionales dependen de la comparación de muchas plantas para encontrar patrones, pero esto es lento, costoso y a menudo deja a los investigadores con miles de posibilidades en lugar de una respuesta clara.

Un equipo de investigadores en París ha introducido ahora una nueva forma de leer este texto biológico. Han construido una familia de modelos de inteligencia artificial, que llaman Botanic1, diseñados específicamente para comprender la gramática del ADN vegetal. A diferencia de otras herramientas anteriores que necesitaban que los humanos les enseñaran las reglas de la biología, estos modelos aprendieron el lenguaje por sí mismos. Se les alimentó con las secuencias genéticas de 320 especies de plantas diferentes, que van desde diminutos musgos hasta árboles imponentes, y se les pidió que predijeran las letras faltantes en la secuencia. Al hacer esto millones de veces, los modelos aprendieron las reglas ocultas de cómo se estructura el ADN, cómo se activan y desactivan los genes y cómo los pequeños cambios en el código afectan a la planta. El resultado es un sistema que puede observar un tramo largo de ADN y detectar instantáneamente qué partes son críticas para la supervivencia de la planta y qué cambios podrían ser perjudiciales o beneficiosos.

Los investigadores no solo construyeron un modelo; crearon una "fábrica" que utiliza agentes de software inteligente para gestionar todo el proceso de entrenamiento y prueba de estos modelos. Estos agentes se encargan del trabajo pesado, organizando datos, ejecutando experimentos y corrigiendo errores, lo que permite a los científicos humanos centrarse en las grandes ideas. Este enfoque les permitió entrenar modelos capaces de leer secuencias de ADN de hasta 128.000 letras de longitud, una extensión que captura las interacciones de largo alcance entre diferentes partes del genoma que antes era imposible analizar en conjunto. En las pruebas, estos modelos superaron a todas las demás herramientas existentes para comprender la genética vegetal, incluidos aquellos que eran mucho más grandes y fueron entrenados con mucha más información. Fueron capaces de identificar las partes más importantes del ADN, como los límites donde los genes comienzan y terminan, e incluso detectaron las señales específicas que indican a una célula cómo cortar y pegar sus instrucciones genéticas.

Lo que hace que este descubrimiento sea particularmente poderoso es que los modelos aprendieron estas reglas sin que se les dijera cuáles eran. Cuando los investigadores examinaron el interior de los modelos para ver qué habían aprendido, descubrieron que la IA había descubierto de forma independiente conceptos biológicos como los "sitios de empalme" (splice sites), que son las instrucciones para cómo se edita un gen antes de convertirse en una proteína. En un ejemplo sorprendente, el modelo identificó una ubicación específica en un gen que las bases de datos científicas estándar habían marcado incorrectamente durante más de veinte años. La lógica interna del modelo señalaba un lugar diferente, y cuando los investigadores comprobaron la historia de ese gen, descubrieron que la descripción original de 1999 era en realidad la correcta y que el modelo había redescubierto la verdad que se había perdido en actualizaciones posteriores. Esto sugiere que estos modelos pueden actuar como un nuevo tipo de microscopio, revelando verdades biológicas que están ocultas en los datos pero que pasan desapercibidas para la anotación humana.

El equipo también demostró cómo estos modelos pueden trabajar junto a los investigadores humanos de una manera nueva. Establecieron un escenario en el que se le pidió a un agente de inteligencia artificial de propósito general que encontrara la causa de un rasgo específico en los melones: por qué algunas plantas producen flores femeninas y otras producen tanto flores masculinas como femeninas. El agente recibió una lista de miles de diferencias genéticas y se le pidió que encontrara la responsable. Cuando el agente intentó resolverlo utilizando únicamente las herramientas estándar, pudo reducir la lista, pero no pudo elegir la respuesta correcta. Sin embargo, cuando los investigadores le dieron al agente acceso al modelo Botanic1 como herramienta, el agente clasificó inmediatamente el cambio genético correcto como el candidato número uno. El modelo proporcionó una medida continua de qué tan sorprendente era un cambio genético, lo que ayudó al agente a distinguir la verdadera causa del ruido.

Este trabajo representa un paso significativo en la forma en que estudiamos las plantas. Al enseñar a las máquinas a leer el lenguaje del ADN, los investigadores han creado herramientas que pueden acelerar la búsqueda de cultivos que puedan resistir un clima cambiante. Estos modelos no son solo más rápidos; son más precisos y pueden ver patrones que antes eran invisibles. Ofrecen una forma de pasar de adivinar qué genes podrían ser importantes a saber con alta confianza cuáles lo son. A medida que los investigadores ponen estas herramientas a disposición de la comunidad científica, abren la puerta a una nueva era de la biología vegetal, donde el complejo código de la vida puede entenderse y mejorarse con una velocidad y precisión que antes estaban fuera de nuestro alcance. Los modelos ya están disponibles para que otros científicos los utilicen, prometiendo ayudar a cultivar mejores cultivos y a comprender los mecanismos fundamentales de la vida en el reino vegetal.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →