← नवीनतम पेपर
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

यह शोध पत्र Botanic1 को प्रस्तुत करता है, जो अनएनोटेटेड (unannotated) पादप डेटा पर प्रशिक्षित लॉन्ग-कॉन्टेक्स्ट, एजेंट-एकीकृत जीनोमिक लैंग्वेज मॉडल्स का एक परिवार है, जो लक्षण-जुड़े क्षेत्रों (trait-associated regions) की भविष्यवाणी करने में मौजूदा मॉडलों से बेहतर प्रदर्शन करते हैं और मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) के माध्यम से जैविक अंतर्दृष्टि प्रदान करते हैं, और यह सब जलवायु-लचीली फसल विकास को गति देने के लिए अनुसंधान समुदाय के लिए उपलब्ध कराया गया है।

मूल लेखक: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

प्रकाशित 2026-09-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए एक ऐसी दुनिया की जहाँ जीवन का कोड चार अक्षरों की एक भाषा में लिखा गया है: A, C, G और T। ये अक्षर DNA अनुक्रम (sequences) बनाते हैं जो यह निर्धारित करते हैं कि एक पौधा कैसे बढ़ता है, वह सूखे का सामना कैसे करता है, और वह बीमारियों से कैसे लड़ता है। दशकों से, वैज्ञानिकों ने इस भाषा को पढ़ने की कोशिश की है, लेकिन यह एक विशाल, जटिल पाठ है जिसमें अरबों शब्द हैं, जिसका अधिकांश हिस्सा एक ऐसी बोली में लिखा गया है जो एक प्रजाति से दूसरी प्रजाति में बदल जाती है। जब कोई पौधा कठोर जलवायु या किसी नए कीट का सामना करता है, तो समाधान अक्सर इस कोड में एक सूक्ष्म परिवर्तन में छिपा होता है—एक एकल अक्षर का बदलाव जो फसल को अधिक मजबूत बना सकता है। उस विशिष्ट परिवर्तन को खोजना एक घास के ढेर में सुई खोजने जैसा है, लेकिन वह घास का ढेर एक पुस्तकालय के आकार का है, और सुई नग्न आंखों से अदृश्य है। पारंपरिक तरीके कई पौधों की तुलना करके पैटर्न खोजने पर निर्भर करते हैं, लेकिन यह धीमा, महंगा है, और अक्सर शोधकर्ताओं को एक स्पष्ट उत्तर के बजाय हजारों संभावनाओं के साथ छोड़ देता है।

पेरिस के शोधकर्ताओं ने अब इस जैविक पाठ को पढ़ने का एक नया तरीका पेश किया है। उन्होंने आर्टिफिशियल इंटेलिजेंस मॉडल्स का एक परिवार बनाया है, जिसे वे 'बोटैनिक1' (Botanic1) कहते हैं, जिसे विशेष रूप से पौधों के DNA के व्याकरण को समझने के लिए डिज़ाइन किया गया है। पिछले उपकरणों के विपरीत, जिन्हें मनुष्यों द्वारा जीव विज्ञान के नियम सिखाने की आवश्यकता थी, इन मॉडल्स ने यह भाषा स्वयं सीखी। उन्हें 320 विभिन्न पौधों की प्रजातियों के आनुवंशिक अनुक्रमों (genetic sequences) को दिया गया था, जिनमें छोटे काई (mosses) से लेकर ऊंचे पेड़ तक शामिल थे, और उन्हें अनुक्रम में लुप्त अक्षरों की भविष्यवाणी करने के लिए कहा गया था। ऐसा लाखों बार करके, मॉडल्स ने सीखा कि DNA की संरचना कैसी होती है, जीन कैसे चालू और बंद होते हैं, और कोड में सूक्ष्म परिवर्तन पौधे को कैसे प्रभावित करते हैं। परिणाम स्वरूप, एक ऐसा सिस्टम तैयार हुआ जो DNA के एक लंबे हिस्से को देख सकता है और तुरंत महसूस कर सकता है कि कौन से भाग पौधे के अस्तित्व के लिए महत्वपूर्ण हैं और कौन से परिवर्तन हानिकारक या फायदेमंद हो सकते हैं।

शोधकर्ताओं ने केवल एक मॉडल नहीं बनाया; उन्होंने एक "फैक्ट्री" बनाई है जो इन मॉडल्स के प्रशिक्षण और परीक्षण की पूरी प्रक्रिया को प्रबंधित करने के लिए बुद्धिमान सॉफ्टवेयर एजेंटों का उपयोग करती है। ये एजेंट भारी काम संभालते हैं, जैसे डेटा को व्यवस्थित करना, प्रयोग चलाना और त्रुटियों को ठीक करना, जिससे मानव वैज्ञानिक बड़े विचारों पर ध्यान केंद्रित कर सकें। इस दृष्टिकोण ने उन्हें ऐसे मॉडल्स को प्रशिक्षित करने की अनुमति दी जो 1,28,000 अक्षरों तक लंबे DNA अनुक्रमों को पढ़ सकते हैं, जो एक ऐसी लंबाई है जो जीनोम के विभिन्न हिस्सों के बीच लंबी दूरी की अंतःक्रियाओं (long-range interactions) को पकड़ती है जिन्हें पहले एक साथ विश्लेषण करना असंभव था। परीक्षणों में, इन मॉडल्स ने पौधों के आनुवंशिकी को समझने के लिए मौजूद अन्य सभी उपकरणों को पीछे छोड़ दिया, जिनमें वे भी शामिल थे जो बहुत बड़े थे और कहीं अधिक डेटा पर प्रशिक्षित थे। वे DNA के सबसे महत्वपूर्ण हिस्सों की पहचान करने में सक्षम थे, जैसे कि वे सीमाएँ जहाँ जीन शुरू और समाप्त होते हैं, और यहाँ तक कि उन विशिष्ट संकेतों को भी पहचान सके जो एक कोशिका को अपने आनुवंशिक निर्देशों को काटने और जोड़ने (cut and paste) के बारे में बताते हैं।

जो इस खोज को विशेष रूप से शक्तिशाली बनाता है वह यह है कि मॉडल्स ने ये नियम बिना बताए सीखे। जब शोधकर्ताओं ने मॉडल्स के भीतर झाँका कि उन्होंने क्या सीखा है, तो उन्होंने पाया कि AI ने "स्प्लिस साइट्स" (splice sites) जैसे जैविक सिद्धांतों की स्वतंत्र रूप से खोज की थी, जो वे निर्देश हैं कि प्रोटीन बनने से पहले एक जीन को कैसे संपादित (edit) किया जाता है। एक उल्लेखनीय उदाहरण में, मॉडल ने एक जीन में एक विशिष्ट स्थान की पहचान की जिसे मानक वैज्ञानिक डेटाबेस ने बीस वर्षों से गलत चिह्नित किया था। मॉडल के आंतरिक तर्क ने एक अलग स्थान की ओर इशारा किया, और जब शोधकर्ताओं ने उस जीन के इतिहास की जाँच की, तो उन्होंने पाया कि 1999 का मूल विवरण वास्तव में सही था और मॉडल ने उस सत्य को पुनः खोज लिया था जो बाद के अपडेट में खो गया था। यह सुझाव देता है कि ये मॉडल्स एक नए प्रकार के सूक्ष्मदर्शी (microscope) के रूप में कार्य कर सकते हैं, जो उन जैविक सत्यों को प्रकट करते हैं जो डेटा में छिपे हुए हैं लेकिन मानवीय एनोटेशन (annotation) से छूट गए हैं।

टीम ने यह भी प्रदर्शित किया कि ये मॉडल्स मानव शोधकर्ताओं के साथ एक नए तरीके से कैसे काम कर सकते हैं। उन्होंने एक परिदृश्य सेट किया जहाँ एक सामान्य-उद्देश्य वाले आर्टिफिशियल इंटेलिजेंस एजेंट को खरबूजे (melons) के एक विशिष्ट लक्षण का कारण खोजने के लिए कहा गया था: क्यों कुछ पौधे मादा फूल पैदा करते हैं और अन्य दोनों (नर और मादा) फूल पैदा करते हैं। एजेंट को हजारों आनुवंशिक अंतरों की एक सूची दी गई और उसे जिम्मेदार कारक खोजने के लिए कहा गया। जब एजेंट ने केवल मानक उपकरणों का उपयोग करके इसे हल करने का प्रयास किया, तो वह सूची को सीमित तो कर सका लेकिन सही उत्तर नहीं चुन सका। हालाँकि, जब शोधकर्ताओं ने एजेंट को 'बोटैनिक1' मॉडल तक पहुँच प्रदान की, तो एजेंट ने तुरंत सही आनुवंशिक परिवर्तन को नंबर एक उम्मीदवार के रूप में रैंक किया। मॉडल ने एक निरंतर माप (continuous measure) प्रदान किया कि एक आनुवंशिक परिवर्तन कितना आश्चर्यजनक था, जिसने एजेंट को वास्तविक कारण को शोर (noise) से अलग करने में मदद की।

यह कार्य पौधों के अध्ययन के क्षेत्र में एक महत्वपूर्ण प्रगति है। मशीनों को DNA की भाषा पढ़ना सिखाकर, शोधकर्ताओं ने ऐसे उपकरण बनाए हैं जो उन फसलों की खोज को तेज कर सकते हैं जो बदलते जलवायु का सामना कर सकें। ये मॉडल्स न केवल तेज़ हैं; वे अधिक सटीक हैं और उन पैटर्नों को देख सकते हैं जो पहले अदृश्य थे। वे अनुमान लगाने से कि कौन से जीन महत्वपूर्ण हो सकते हैं, उच्च विश्वास के साथ यह जानने की ओर बढ़ने का एक तरीका प्रदान करते हैं कि कौन से जीन वास्तव में महत्वपूर्ण हैं। जैसे-जैसे शोधकर्ता इन उपकरणों को वैज्ञानिक समुदाय के लिए जारी कर रहे हैं, वे पौधों के जीव विज्ञान के एक नए युग के द्वार खोल रहे हैं, जहाँ जीवन के जटिल कोड को उस गति और सटीकता के साथ समझा और सुधारा जा सकता है जो पहले पहुंच से बाहर थी। ये मॉडल्स अब अन्य वैज्ञानिकों के उपयोग के लिए उपलब्ध हैं, जो बेहतर फसलें उगाने और पौधों के साम्राज्य में जीवन के मौलिक तंत्र को समझने में मदद करने का वादा करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →