BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era
Dieses Paper stellt Botanic1 vor, eine Familie von Long-Context-, Agent-integrierten Genom-Sprachmodellen, die auf unannotierten Pflanzendaten trainiert wurden und bestehende Modelle bei der Vorhersage von merkmalassoziierten Regionen übertreffen sowie biologische Erkenntnisse durch mechanistische Interpretierbarkeit liefern, während sie gleichzeitig der Forschungsgemeinschaft zur Verfügung gestellt werden, um die Entwicklung klimaresilienter Nutzpflanzen zu beschleunigen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine Welt vor, in der der Code des Lebens in einer Sprache aus vier Buchstaben geschrieben ist: A, C, G und T. Diese Buchstaben bilden die DNA-Sequenzen, die bestimmen, wie eine Pflanze wächst, wie sie Trockenheit widersteht und wie sie Krankheiten bekämpft. Jahrzehntelang haben Wissenschaftler versucht, diese Sprache zu lesen, aber es handelt sich um einen massiven, komplexen Text mit Milliarden von Wörtern, wovon ein Großteil in einem Dialekt verfasst ist, der sich von einer Spezies zur anderen unterscheidet. Wenn eine Pflanze mit einem harten Klima oder einem neuen Schädling konfrontiert wird, liegt die Lösung oft in einer winzigen Änderung dieses Codes – dem Austausch eines einzigen Buchstabens, der eine Nutzpflanze stärker machen könnte. Das Finden dieser spezifischen Änderung gleicht der Suche nach der Nadel im Heuhaufen, aber der Heuhaufen ist so groß wie eine Bibliothek, und die Nadel ist für das bloße Auge unsichtbar. Traditionelle Methoden verlassen sich darauf, viele Pflanzen zu vergleichen, um Muster zu finden, aber dies ist langsam, teuer und hinterlässt den Forschern oft tausende Möglichkeiten anstatt einer einzigen klaren Antwort.
Ein Forscherteam in Paris hat nun einen neuen Weg eingeführt, diesen biologischen Text zu lesen. Sie haben eine Familie von Modellen der künstlichen Intelligenz entwickelt, die sie Botanic1 nennen und die speziell darauf ausgelegt sind, die Grammatik der Pflanzendna zu verstehen. Im Gegensatz zu früheren Werkzeugen, denen Menschen die Regeln der Biologie beibringen mussten, lernten diese Modelle die Sprache von selbst. Man fütterte sie mit den genetischen Sequenzen von 320 verschiedenen Pflanzenarten, die von winzigen Moosen bis hin zu hoch aufragenden Bäumen reichten, und bat sie, fehlende Buchstaben in der Sequenz vorherzusagen. Durch diesen Vorgang Millionen Male zu wiederholen, lernten die Modelle die verborgenen Regeln, wie DNA strukturiert ist, wie Gene an- und ausgeschaltet werden und wie winzige Änderungen im Code die Pflanze beeinflussen. Das Ergebnis ist ein System, das einen langen DNA-Abschnitt betrachten und sofort erkennen kann, welche Teile entscheidend für das Überleben der Pflanze sind und welche Änderungen schädlich oder vorteilhaft sein könnten.
Die Forscher haben nicht nur ein Modell gebaut; sie haben eine „Fabrik“ geschaffen, die intelligente Software-Agenten nutzt, um den gesamten Prozess des Trainings und Testens dieser Modelle zu steuern. Diese Agenten erledigen die schwere Arbeit, organisieren Daten, führen Experimente durch und beheben Fehler, sodass sich die menschlichen Wissenschaftler auf die großen Ideen konzentrieren können. Dieser Ansatz ermöglichte es ihnen, Modelle zu trainieren, die DNA-Sequenzen von bis zu 128.000 Buchstaben lesen können – eine Länge, die die Fernwirkungen zwischen verschiedenen Teilen des Genoms erfasst, die zuvor unmöglich gemeinsam analysiert werden konnten. In Tests übertrafen diese Modelle jedes andere existierende Werkzeug zum Verständnis der Pflanzengenetik, einschließlich jener, die viel größer waren und mit weitaal mehr Daten trainiert wurden. Sie waren in der Lage, die wichtigsten Teile der DNA zu identifizieren, wie etwa die Grenzen, an denen Gene beginnen und enden, und sogar die spezifischen Signale zu entdecken, die einer Zelle mitteilen, wie sie ihre genetischen Anweisungen ausschneiden und einfügen soll.
Was diese Entdeckung besonders kraftvoll macht, ist, dass die Modelle diese Regeln lernten, ohne dass man sie darüber aufklärte, was sie waren. Als die Forscher in die Modelle blickten, um zu sehen, was sie gelernt hatten, fanden sie heraus, dass die KI biologische Konzepte wie „Spleißstellen“ unabhängig entdeckt hatte, also die Anweisungen dafür, wie ein Gen editiert wird, bevor es zu einem Protein wird. In einem bemerkenswerten Beispiel identifizierte das Modell eine spezifische Stelle in einem Gen, die in den Standard-Wissenschaftsdatenbanken seit über zwanzig Jahren falsch markiert war. Die interne Logik des Modells deutete auf einen anderen Punkt hin, und als die Forscher die Geschichte dieses Gens überprüften, stellten sie fest, dass die ursprüngliche Beschreibung aus dem Jahr 1999 tatsächlich korrekt war und das Modell die Wahrheit wiederentdeckt hatte, die in späteren Aktualisierungen verloren gegangen war. Dies deutet darauf an, dass diese Modelle als eine neue Art von Mikroskop fungieren können, die biologische Wahrheiten offenbaren, die in den Daten verborgen, aber von der menschlichen Annotation übersehen wurden.
Das Team demonstrierte auch, wie diese Modelle auf eine neue Weise mit menschlichen Forschern zusammenarbeiten können. Sie entwarfen ein Szenario, in dem ein universell einsetzender KI-Agent gefragt wurde, die Ursache für ein spezifisches Merkmal bei Melonen zu finden: Warum produzieren einige Pflanzen weibliche Blüten und andere sowohl männliche als auch weibliche Blüten? Dem Agenten wurde eine Liste von tausenden genetischen Unterschieden vorgelegt, und er wurde gebeten, denjenigen zu finden, der dafür verantwortlich ist. Als der Agent versuchte, dies nur mit Standardwerkzeugen zu lösen, konnte er die Liste zwar einschränken, aber nicht die richtige Antwort auswählen. Doch als die Forscher dem Agenten Zugang zum Botanic1-Modell als Werkzeug gaben, setzte der Agent die korrekte genetische Veränderung sofort auf Platz eins der Kandidatenliste. Das Modell lieferte ein kontinuierliches Maß dafür, wie überraschend eine genetische Veränderung war, was dem Agenten half, die wahre Ursache vom Rauschen zu unterscheiden.
Diese Arbeit stellt einen bedeutenden Fortschritt dar in der Art und Weise, wie wir Pflanzen untersuchen. Indem sie Maschinen beibrachten, die Sprache der DNA zu lesen, haben die Forscher Werkzeuge geschaffen, die die Suche nach Nutzpflanzen, die einem sich ändernden Klima standhalten können, beschleunigen können. Diese Modelle sind nicht nur schneller, sie sind auch präziser und können Muster erkennen, die zuvor unsichtbar waren. Sie bieten einen Weg, um von der Vermutung, welche Gene wichtig sein könnten, zum Wissen mit hoher Konfidenz darüber, welche es tatsächlich sind, zu gelangen. Während die Forscher diese Werkzeuge der wissenschaftlichen Gemeinschaft zugänglich machen, öffnen sie die Tür zu einer neuen Ära der Pflanzenbiologie, in der der komplexe Code des Lebens mit einer Geschwindigkeit und Präzision verstanden und verbessert werden kann, die zuvor unerreichbar war. Die Modelle stehen nun anderen Wissenschaftlern zur Verfügung und versprechen, beim Züchten besserer Nutzpflanzen und beim Verständnis der grundlegenden Mechanismen des Lebens im Pflanzenreich zu helfen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.