← नवीनतम पेपर
🧬 biology

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

यह शोध पत्र दबायोकलेक्शन (TheBioCollection) को प्रस्तुत करता है, जो एक एकीकृत 52.6B-टोकन प्री-ट्रेनिंग कॉर्पस है जो विविध जैविक संसाधनों को गणनात्मक गुणों और निर्देश कार्यों से समृद्ध एक सुसंगत प्रारूप में संकलित करता है, जो एक 16B-पैरामीटर मॉडल की सामान्य भाषाई क्षमताओं को संरक्षित करते हुए कई डोमेन में इसकी जैविक समझ और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

प्रकाशित 2026-07-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

जीव विज्ञान की दुनिया की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ किताबें हर जगह बिखरी हुई हैं। कुछ बहुत छोटी आणविक ब्लूप्रिंट्स (molecular blueprints) हैं, कुछ विशाल प्रोटीन निर्देश नियमावलियाँ (protein instruction manuals) हैं, और कुछ इस बात के जटिल मानचित्र हैं कि कोशिकाएं आपस में कैसे संवाद करती हैं। समस्या क्या है? ये "किताबें" हजारों अलग-अलग, भ्रमित करने वाली भाषाओं में लिखी गई हैं—कुछ केवल संख्याओं की सूचियाँ हैं, अन्य ग्राफ हैं, और कई ऐसे स्वरूपों (formats) में बंद हैं जिन्हें एक सुपर-स्मार्ट कंप्यूटर मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) वास्तव में पढ़ नहीं सकता।

यहाँ THEBIOCOLLECTION आता है, डिजिटल पुस्तकालयाध्यक्षों (librarians) की एक टीम, जिन्होंने इस अव्यवस्था को साफ करने का निर्णय लिया। उन्होंने इन बिखरे हुए संसाधनों को केवल एकत्र ही नहीं किया; उन्होंने एक विशाल, एकीकृत प्रशिक्षण सेट बनाया जिसमें 52.6 बिलियन टोकन (सोचिए ये व्यक्तिगत शब्द या सूचना के टुकड़े हैं) शामिल हैं, जो उन सभी अस्त-व्यस्त स्वरूपों को एक एकल, पठनीय भाषा में बदल देते हैं।

महान अनुवाद कार्य
टीम ने सूक्ष्म अणुओं, प्रोटीन अनुक्रमों (sequences), डीएनए अनुक्रमों और यहाँ तक कि पूरी कोशिकाओं से डेटा लिया, और कुछ चतुर काम किया: उन्होंने केवल डेटा को कॉपी-पेस्ट नहीं किया। उन्होंने नए तथ्यों को गणना करने और उन्हें प्राकृतिक वाक्यों के रूप में लिखने के लिए विशेष "अनुवादक उपकरणों" (translator tools) का उपयोग किया।

  • इसके बजाय कि केवल एक अणु को रासायनिक कोड दिया जाए, सिस्टम ने उसका भार, उसमें कितनी रिंग्स हैं, और वह कितना "ड्रग-लाइक" (दवा जैसा) है, इसकी गणना की, और फिर उन सभी का वर्णन करने वाला एक वाक्य लिखा।
  • इसके बजाय कि केवल एक प्रोटीन के अनुक्रम को सूचीबद्ध किया जाए, उन्होंने उसके आकार और कोशिका में उसके स्थान के बारे में विवरण भी जोड़ा।
  • उन्होंने उन चीजों के लिए नए "प्रश्नोत्तरी प्रश्न" (निर्देश कार्य) भी बनाए जो पहले गायब थे, जैसे कि कंप्यूटर को एक नया प्रोटीन बाइंडर डिजाइन करने या डीएनए स्ट्रैंड पर एक विशिष्ट स्थान खोजने के लिए कहना।

प्रयोग: एक मस्तिष्क को सिखाना
यह देखने के लिए कि क्या यह नई लाइब्रेरी वास्तव में काम करती है, शोधकर्ताओं ने एक आधारभूत कंप्यूटर मस्तिष्क जिसे Gravity-16B-A3B कहा जाता है (जिसने पहले कभी जीव विज्ञान डेटा नहीं देखा था) को लिया और उसे यह नया संग्रह खिलाया। उन्होंने मस्तिष्क की संरचना (architecture) को बिल्कुल वैसा ही रखा ताकि परिणाम शुद्ध रूप से नए डेटा के कारण हों, न कि इसलिए कि उन्होंने स्वयं मस्तिष्क को बदल दिया।

परिणाम: दो अंकों की छलांग
परिणाम आश्चर्यजनक रूप से मजबूत थे। इस नए संग्रह पर प्रशिक्षण के बाद, जीव विज्ञान संबंधी कार्यों को संभालने की मॉडल की क्षमता दोगुनी से अधिक हो गई।

  • इसका समग्र स्कोर 0.223 से बढ़कर 0.499 हो गया।
  • यह हर चीज़ में काफी बेहतर हो गया: छोटे अणुओं को समझना, प्रोटीन डिजाइन करना, डीएनए पर स्थान खोजना, और यहाँ तक कि यह समझना कि कोशिकाएं परिवर्तनों के प्रति कैसे प्रतिक्रिया करती हैं।
  • सबसे बड़े सुधार उन क्षेत्रों में हुए जहाँ डेटा संरचित (structured) और उपकरणों द्वारा गणना किया गया था, जैसे कि विशिष्ट डीएनए नियामक स्थानों (DNA regulatory spots) को खोजना (बढ़कर 0,134 से 0.516 होना) और प्रोटीन बाइंडर डिजाइन करना (बढ़कर 0.234 से 0.645 होना)।

जो इसने नहीं किया (The "No-Go" Zone)
यह ध्यान रखना महत्वपूर्ण है कि इस शोध पत्र ने क्या नहीं पाया। शोधकर्ताओं ने स्पष्ट रूप से परीक्षण किया कि क्या इस पूरे जीव विज्ञान डेटा को जोड़ने से कंप्यूटर मस्तिष्क सामान्य मानव भाषा बोलने या सामान्य पहेलियों को हल करने की अपनी क्षमता को "भूल" जाएगा। उन्होंने अपने नए मॉडल की तुलना एक ऐसे मॉडल से की जिसने केवल सामान्य विज्ञान लेखों और वेब टेक्स्ट को पढ़ा था।

  • परिणाम? जीव विज्ञान-प्रशिक्षित मॉडल सामान्य भाषा कार्यों के लिए लगभग उतना ही अच्छा रहा जितना कि वह मॉडल जिसने केवल वेब टेक्स्ट पढ़ा था।
  • यह शोध पत्र इस विचार को खारिज करता है कि आपको जैविक समझ प्राप्त करने के लिए सामान्य बुद्धिमत्ता का त्याग करना पड़ता है। मॉडल ने अपनी दुनिया के बारे में चैट करने या तर्क करने की क्षमता खोए बिना जीव विज्ञान सीखा।
  • यह पत्र यह भी सुझाव देता है कि केवल विज्ञान लेखों (जैसे PubMed से) को पढ़ने से थोड़ा लाभ होता है, लेकिन यह इस विचार के खिलाफ तर्क देता है कि केवल टेक्स्ट पढ़ना ही पर्याप्त है। THEBIOCOLLECTION में मौजूद संरचित, टूल-आधारित डेटा ने बहुत बड़ा बढ़ावा दिया, विशेष रूप से उन कार्यों के लिए जिनमें सटीक, गैर-पाठ्य (non-textual) तथ्यों की आवश्यकता होती है।

क्रॉस-डोमेन जादू
सबसे शानदार निष्कर्षों में से एक यह है कि मॉडल ने न केवल एक चीज़ में अच्छा होना सीखा; इसने विभिन्न क्षेत्रों के बीच संबंध बनाना भी शुरू कर दिया। जब एक प्रोटीन के कार्य को उसके संबंधित पाथवे (pathway) से जोड़ने या एक ड्रग को उस जीन से जोड़ने के लिए पूछा गया जिसे वह प्रभावित करता है, तो मॉडल की सटीकता 0.313 से बढ़कर 0.507 हो गई। यह बताता है कि मॉडल विभिन्न जैविक परतों के बीच "सोचना" सीख रहा है, न कि केवल तथ्यों को रट रहा है।

निष्कर्ष
यह शोध पत्र सुझाव देता है कि एक जीव विज्ञान-सक्षम AI बनाने का "सीक्रेट सॉस" (secret sauce) आवश्यक रूप से एक नया, जटिल मस्तिष्क आर्किटेक्चर नहीं है। इसके बजाय, यह एक उच्च-गुणवत्ता वाले, एकीकृत और टूल-समृद्ध डेटा लाइब्रेरी के बारे में है। बिखरे हुए, अस्त-व्यस्त जैविक डेटा को एक सुसंगत, पठनीय कहानी में बदलकर, शोधकर्ताओं ने दिखाया कि आप एक सामान्य AI को दुनिया के बाकी हिस्सों को समझने की अपनी क्षमता को तोड़े बिना, जीवन की गहरी, जटिल भाषा को समझने के लिए सिखा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →