← Nieuwste papers
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

Dit artikel introduceert Botanic1, een familie van long-context, agent-geïntegreerde genomische taalmodellen getraind op niet-geannoteerde plantgegevens die bestaande modellen overtreffen in het voorspellen van kenmerkgeassocieerde regio's en biologische inzichten bieden door middel van mechanistische interpreteerbaarheid, terwijl ze tegelijkertijd beschikbaar worden gesteld aan de onderzoeksgemeenschap om de ontwikkeling van klimaatbestendige gewassen te versnellen.

Oorspronkelijke auteurs: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Gepubliceerd 2026-09-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je een wereld voor waarin de code van het leven is geschreven in een taal van vier letters: A, C, G en T. Deze letters vormen de DNA-sequenties die bepalen hoe een plant groeit, hoe ze bestand is tegen droogte en hoe ze vecht tegen ziekten. Decennialang hebben wetenschappers geprobeerd deze taal te lezen, maar het is een enorme, complexe tekst met miljarden woorden, waarvan een groot deel geschreven is in een dialect dat van soort naar soort verandert. Wanneer een plant te maken krijgt met een hard klimaat of een nieuwe plaag, ligt de oplossing vaak in een minuscule verandering in deze code — een enkele letterwissel die een gewas sterker kan maken. Het vinden van die specifieke verandering is als het zoeken naar een speld in een hooiberg, maar de hooiberg is zo groot als een bibliotheek en de speld is onzichtbaar voor het blote oog. Traditionele methoden vertrouwen op het vergelijken van veel planten om patronen te vinden, maar dit is traag, duur en laat onderzoekers vaak achter met duizenden mogelijkheden in plaats van één duidelijk antwoord.

Een team van onderzoekers in Parijs heeft nu een nieuwe manier geïntroduceerd om deze biologische tekst te lezen. Ze hebben een familie van kunstmatige intelligentiemodellen gebouwd, die ze Botanic1 noemen, die specifiek zijn ontworpen om de grammatica van plantendna te begrijpen. In tegen tegenstelling tot eerdere tools, die door mensen moesten worden onderwezen in de regels van de biologie, leerden deze modellen de taal uit zichzelf. Ze werden gevoed met de genetische sequenties van 320 verschillende plantensoorten, variërend van kleine mossen tot reusachtige bomen, en kregen de opdracht om ontbrekende letters in de sequentie te voorspellen. Door dit miljoenen keren te doen, leerden de modellen de verborgen regels van hoe DNA is gestructureerd, hoe genen aan- en uitgeschakeld worden en hoe minuscule veranderingen in de code de plant beïnvloeden. Het resultaat is een systeem dat naar een lang stuk DNA kan kijken en direct kan aanvoelen welke delen cruciaal zijn voor het overleven van de plant en welke veranderingen schadelijk of gunstig kunnen zijn.

De onderzoekers hebben niet alleen één model gebouwd; ze hebben een "fabriek" gecreëerd die intelligente softwareagenten gebruikt om het hele proces van het trainen en testen van deze modellen te beheren. Deze agenten doen het zware werk: ze organiseren data, voeren experimenten uit en herstellen fouten, waardoor menselijke wetenschappers zich kunnen concentreren op de grote ideeën. Deze aanpak stelde hen in staat om modellen te trainen die DNA-sequenties tot 128.000 letters lang kunnen lezen, een lengte die de langetermijninteracties tussen verschillende delen van het genoom vastlegt die voorheen onmogelijk gezamenlijk te analyseren waren. In tests presteerden deze modellen beter dan alle andere bestaande tools voor het begrijpen van plantengenetica, inclusief die die veel groter waren en getraind waren op veel meer data. Ze waren in staat om de belangrijkste delen van het DNA te identificeren, zoals de grenzen waar genen beginnen en stoppen, en zelfs de specifieke signalen op te sporen die een cel vertellen hoe ze de genetische instructies moet knippen en plakken.

Wat deze ontdekking bijzonder krachtig maakt, is dat de modellen deze regels leerden zonder dat ze werden verteld wat ze waren. Wanneer de onderzoekers in de modellen keken om te zien wat ze hadden geleerd, ontdekten ze dat de AI biologische concepten zoals "splice sites" (spleetplaatsen) onafhankelijk had ontdekt, wat de instructies zijn voor hoe een gen wordt bewerkt voordat het een eiwit wordt. In één opvallend voorbeeld identificeerde het model een specifieke locatie in een gen die de standaard wetenschappelijke databases al meer dan twintig jaar onjuist hadden gemarkeerd. De logica van het model wees naar een andere plek, en toen de onderzoekers de geschiedenis van dat gen controleerden, bleek dat de oorspronkelijke beschrijving uit 1999 eigenlijk correct was en dat het model de waarheid had herontdekt die verloren was gegaan in latere updates. Dit suggereert dat deze modellen kunnen fungeren als een nieuw soort microscoop, die biologische waarheden onthult die verborgen liggen in de data maar door mensen over het hoofd worden gezien.

Het team heeft ook gedemonstreerd hoe deze modellen op een nieuwe manier naast menselijke onderzoekers kunnen werken. Ze stelden een scenario op waarbij een algemene AI-agent de opdracht kreeg om de oorzaak van een specifiek kenmerk in meloenen te vinden: waarom sommige planten vrouwelijke bloemen produceren en andere zowel mannelijke als vrouwelijke bloemen. De agent kreeg een lijst met duizenden genetische verschillen en de opdracht om de ene te vinden die verantwoordelijk is. Wanneer de agent probeerde dit op te lossen met alleen standaardtools, kon hij de lijst wel inkorten, maar kon hij niet het juiste antwoord kiezen. Echter, toen de onderzoekers de agent toegang gaven tot het Botanic1-model als een hulpmiddel, rangschikte de agent de juiste genetische verandering onmiddellijk als de belangrijkste kandidaat. Het model leverde een continue maatstaf voor hoe verrassend een genetische verandering was, wat de agent hielp om de werkelijke oorzaak te onderscheiden van de ruis.

Dit werk vormt een belangrijke stap voorwaarts in de manier waarop we planten bestuderen. Door machines te leren de taal van DNA te lezen, hebben de onderzoekers instrumenten gecreëerd die de zoektocht naar gewassen die bestand zijn tegen een veranderend klimaat kunnen versnellen. Deze modellen zijn niet alleen sneller; ze zijn nauwkeuriger en kunnen patronen zien die voorheen onzichtbaar waren. Ze bieden een manier om van het gissen welke genen belangrijk zouden kunnen zijn, naar weten met een hoge mate van zekerheid welke genen dat zijn. Nu de onderzoekers deze tools beschikbaar stellen aan de wetenschappelijke gemeenschap, openen ze de deur naar een nieuw tijdperk in de plantenbiologie, waarin de complexe code van het leven begrepen en verbeterd kan worden met een snelheid en precisie die voorheen onbereikbaar was. De modellen zijn nu beschikbaar voor andere wetenschappers om te gebruiken, met de belofte te helpen bij het kweken van betere gewassen en het begrijpen van de fundamentele mechanismen van het leven in het plantenrijk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →