← Últimos artigos
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

Este artigo apresenta o Botanic1, uma família de modelos de linguagem genômica de contexto longo e integrados a agentes, treinados em dados vegetais não anotados, que superam os modelos existentes na previsão de regiões associadas a características e fornecem insights biológicos por meio de interpretabilidade mecanística, tudo isso enquanto são disponibilizados à comunidade de pesquisa para acelerar o desenvolvimento de culturas resilientes ao clima.

Autores originais: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Publicado 2026-09-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Imagine um mundo onde o código da vida é escrito em uma linguagem de quatro letras: A, C, G e T. Essas letras formam as sequências de DNA que ditam como uma planta cresce, como ela resiste à seca e como ela combate doenças. Por décadas, cientistas tentaram ler essa linguagem, mas é um texto massivo e complexo com bilhões de palavras, grande parte dele escrita em um dialeto que muda de uma espécie para outra. Quando uma planta enfrenta um clima rigoroso ou uma nova praga, a solução muitas vezes reside em uma pequena mudança nesse código — uma única troca de letra que pode tornar uma cultura mais forte. Encontrar essa mudança específica é como procurar uma agulha em um palheiro, mas o palheiro tem o tamanho de uma biblioteca, e a agulha é invisível a olho nu. Os métodos tradicionais dependem da comparação de muitas plantas para encontrar padrões, mas isso é lento, caro e frequentemente deixa os pesquisadores com milhares de possibilidades em vez de uma resposta clara.

Uma equipe de pesquisadores em Paris introduziu agora uma nova maneira de ler este texto biológico. Eles construíram uma família de modelos de inteligência artificial, que chamam de Botanic1, projetada especificamente para entender a gramática do DNA vegetal. Ao contrário de ferramentas anteriores que precisavam ser ensinadas as regras da biologia por humanos, esses modelos aprenderam a linguagem por conta própria. Eles foram alimentados com as sequências genéticas de 320 espécies de plantas diferentes, variando de pequenos musgos a árvores imensas, e receberam a tarefa de prever letras ausentes na sequência. Ao fazer isso milhões de vezes, os modelos aprenderam as regras ocultas de como o DNA é estruturado, como os genes são ligados e desligados, e como pequenas mudanças no código afetam a planta. O resultado é um sistema que pode olhar para um longo trecho de DNA e sentir instantaneamente quais partes são críticas para a sobrevivência da planta e quais mudanças podem ser prejudiciais ou benéficas.

Os pesquisadores não construíram apenas um modelo; eles criaram uma "fábrica" que utiliza agentes de software inteligentes para gerenciar todo o processo de treinamento e teste desses modelos. Esses agentes lidam com o trabalho pesado, organizando dados, executando experimentos e corrigindo erros, permitindo que os cientistas humanos se concentrem nas grandes ideias. Essa abordagem permitiu que eles treinassem modelos capazes de ler sequências de DNA de até 128.000 letras de comprimento, um comprimento que captura as interações de longo alcance entre diferentes partes do genoma que eram anteriormente impossíveis de analisar em conjunto. Em testes, esses modelos superaram todas as outras ferramentas existentes para compreender a genética vegetal, incluindo aquelas que eram muito maiores e treinadas com muito mais dados. Eles foram capazes de identificar as partes mais importantes do DNA, como os limites onde os genes começam e terminam, e até mesmo detectar os sinais específicos que dizem a uma célula como cortar e colar suas instruções genéticas.

O que torna essa descoberta particularmente poderosa é que os modelos aprenderam essas regras sem que lhe fossem ditadas. Quando os pesquisadores olharam dentro dos modelos para ver o que eles haviam aprendido, descobriram que a IA havia descoberto independentemente conceitos biológicos como "sítios de splicing", que são as instruções de como um gene é editado antes de se tornar uma proteína. Em um exemplo marcante, o modelo identificou um local específico em um gene que os bancos de dados científicos padrão haviam marcado incorretamente por mais de vinte anos. A lógica interna do modelo apontava para um ponto diferente e, quando os pesquisadores verificaram o histórico daquele gene, descobriram que a descrição original de 1999 estava corre na verdade correta, e o modelo havia redescoberto a verdade que havia sido perdida em atualizações posteriores. Isso sugere que esses modelos podem agir como um novo tipo de microscópio, revelando verdades biológicas que estão escondidas nos dados, mas ignoradas pela anotação humana.

A equipe também demonstrou como esses modelos podem trabalhar ao lado de pesquisadores humanos de uma nova maneira. Eles estabeleceram um cenário onde um agente de inteligência artificial de propósito geral foi solicitado a encontrar a causa de um traço específico em melões: por que algumas plantas produzem flores femininas e outras produzem tanto flores masculinas quanto femininas. O agente recebeu uma lista de milhares de diferenças genéticas e foi solicitado a encontrar a responsável. Quando o agente tentou resolver isso usando apenas ferramentas padrão, ele conseguiu reduzir a lista, mas não conseguiu escolher a resposta correta. No entanto, quando os pesquisadores deram ao agente acesso ao modelo Botanic1 como uma ferramenta, o agente imediatamente classificou a mudança genética correta como o candidato número um. O modelo forneceu uma medida contínua de quão surpreendente era uma mudança genética, o que ajudou o agente a distinguir a verdadeira causa do ruído.

Este trabalho representa um passo significativo no modo como estudamos as plantas. Ao ensinar as máquinas a ler a linguagem do DNA, os pesquisadores criaram ferramentas que podem acelerar a busca por culturas que possam resistir a um clima em mudança. Esses modelos não são apenas mais rápidos; eles são mais precisos e podem ver padrões que antes eram invisíveis. Eles oferecem uma maneira de passar de adivinhar quais genes podem ser importantes para saber, com alta confiança, quais eles são. À medida que os pesquisadores liberam essas ferramentas para a comunidade científica, eles abrem as portas para uma nova era da biologia vegetal, onde o código complexo da vida pode ser compreendido e melhorado com uma velocidade e precisão que antes eram inalcançáveis. Os modelos agora estão disponíveis para que outros cientistas os utilizem, prometendo ajudar a cultivar melhores plantações e compreender os mecanismos fundamentais da vida no reino vegetal.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →