← नवीनतम पेपर
🧬 biology

Cross-kingdom phenotype annotations for 35,856 species generated with a web-search-enabled language model

यह शोध पत्र एक व्यापक क्रॉस-किंगडम फेनोटाइप डेटासेट प्रस्तुत करता है जिसमें 35,856 पशु, पादप और कवक प्रजातियों के लिए 7 मिलियन से अधिक एनोटेशन शामिल हैं, जिन्हें व्यापक-स्तर के तुलनात्मक जीव विज्ञान और संरक्षण अनुसंधान को सुगम बनाने के लिए वेब-सर्च-सक्षम लार्ज लैंग्वेज मॉडल पाइपलाइन के माध्यम से तैयार किया गया है।

मूल लेखक: Tyler M. Moore

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tyler M. Moore

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सार्वभौमिक "जीवन का विश्वकोश" (encyclopedia of life) बनाने की कोशिश कर रहे हैं जो पृथ्वी पर मौजूद हर जानवर, पौधे और कवक (fungus) का वर्णन करता हो। आप यह जानना चाहते हैं जैसे: क्या इसके पास कवच है? क्या यह पानी के नीचे रहता है? क्या यह जहरीला है? क्या यह पौधों को खाता है?

आमतौर पर, इस विश्वकोश को भरना एक हाथ से भित्ति चित्र (mural) बनाने जैसा है, जहाँ आप एक बार में एक छोटा सा ब्रशस्ट्रोक लगाते हैं। वैज्ञानिकों को प्रत्येक प्रजाति के लिए उत्तर खोजने हेतु हजारों पुरानी किताबों और वैज्ञानिक शोध पत्रों को पढ़ना पड़ता है। यह धीमा, महंगा है और अक्सर इसमें बड़े अंतराल रह जाते हैं क्योंकि कुछ जानवर प्रसिद्ध होते हैं (जैसे शेर) जबकि अन्य बहुत ही अल्पज्ञात (obscure) होते हैं (जैसे किसी विशिष्ट प्रकार की फफूंद) और उन अल्पज्ञात जीवों के लिए किताबें मौजूद ही नहीं होतीं।

"लाइफडाइव" (LifeDive) प्रोजेक्ट: एक सुपरपावर वाला डिजिटल लाइब्रेरियन

यह शोध पत्र LifeDive नामक एक नया डेटासेट पेश करता है। हर किताब को पढ़ने के लिए हजारों मानव शोधकर्ताओं को काम पर रखने के बजाय, लेखक ने एक "अति-बुद्धिमान" कंप्यूटर प्रोग्राम (एक लार्ज लैंग्वेज मॉडल) का उपयोग किया है जिसके पास एक विशेष सुपरपावर है: यह लाइव इंटरनेट खोज सकता है।

इस कंप्यूटर को केवल एक लाइब्रेरी पढ़ने वाले रोबोट के रूप में नहीं, बल्कि एक डिजिटल जासूस के रूप में सोचें जो किसी दूरस्थ जंगल के विशिष्ट कीड़े या गुफा में पाए जाने वाले दुर्लभ मशरूम के बारे में तथ्यों को तुरंत खोज सकता है, ठीक वैसे ही जैसे एक इंसान गूगल का उपयोग करता है।

उन्होंने इसे कैसे किया

  1. लक्ष्य सूची (The Target List): टीम ने लगभग 36,000 प्रजातियों (जानवरों, पौधों और कवकों) की एक मास्टर सूची से शुरुआत की। उन्होंने यह सुनिश्चित करने के लिए कि डेटा केवल "आकर्षक" जानवरों जैसे पांडा के बारे में न हो, इसमें सामान्य और दुर्लभ जीवों का मिश्रण चुना।
  2. प्रश्नावली (The Questionnaire): उन्होंने 196 प्रश्नों की एक मानकीकृत परीक्षा बनाई जो जीव विज्ञान (कोशिका भित्ति, विष) से लेकर व्यवहार (निशाचर, सामाजिक) और यहाँ तक कि मनुष्य उन्हें कैसे देखते हैं (क्या यह सुंदर है? क्या यह एक कीट है?) तक फैला हुआ था।
  3. जासूसी कार्य (The Detective Work): कंप्यूटर से सूची में दी गई प्रत्येक प्रजाति के लिए इन 196 प्रश्नों के उत्तर देने के लिए कहा गया। चूंकि यह वेब सर्च कर सकता था, इसलिए यह उन प्रजातियों के बारे में भी उत्तर खोज सका जिनके बारे में किसी भी मानव विशेषज्ञ ने गहराई से अध्ययन नहीं किया है।
  4. पैमाना (The Scale): परिणाम स्वरूप 7 मिलियन उत्तरों वाली एक विशाल स्प्रेडशीट तैयार हुई।

"कॉन्फिडेंस स्केल" (The Confidence Scale)

कंप्यूटर ने केवल "हाँ" या "ना" नहीं कहा। इसने अपनी निश्चितता दिखाने के लिए 5-पॉइंट स्केल का उपयोग किया:

  • निश्चित रूप से नहीं (Definitely No)
  • शायद नहीं (Probably No)
  • अज्ञात / लागू नहीं (Unknown / Not Applicable) (कंप्यूटर ने स्वीकार किया कि वह नहीं जानता)
  • शायद हाँ (Probably Yes)
  • निश्चित रूप से हाँ (Definitely Yes)

यह महत्वपूर्ण है। इसका अर्थ है कि डेटा आपको न केवल यह बताता है कि वह गुण क्या है, बल्कि यह भी बताता है कि कंप्यूटर उस उत्तर के बारे में कितना आश्वस्त है।

गड़बड़ियों को ठीक करना (Cleaning Up the Mess)

चूंकि कंप्यूटर स्मार्ट है लेकिन पूर्ण नहीं है, इसलिए कभी-कभी वह अनुमान लगा लेता है या कुछ चीजें छोड़ देता है। इसे ठीक करने के लिए, शोधकर्ताओं ने एक सांख्यिकीय "खाली स्थान भरने" वाले टूल (जिसे रैंडम फॉरेस्ट इमप्यूटेशन कहा जाता है) का उपयोग किया।

  • उपमा (Analogy): कल्पना कीजिए कि एक क्रॉसवर्ड पहेली है जहाँ कुछ खाने खाली हैं। यदि आप जानते हैं कि एक पंक्ति में "FISH" और एक कॉलम में "GILLS" शब्द आता है, तो आप तार्किक रूप से गायब अक्षर का अनुमान लगा सकते हैं। कंप्यूटर ने अन्य 195 प्रश्नों से सीखे गए पैटर्न का उपयोग करके खाली स्थानों को भरने के लिए यही किया।

क्या यह काम आया? ("स्पॉट चेक")

लेखकों ने केवल कंप्यूटर पर भरोसा नहीं किया; उन्होंने इसे एक कठोर परीक्षण से गुजारा:

  • "गोल्ड स्टैंडर्ड" चेक: उन्होंने कंप्यूटर के उत्तरों की तुलना मौजूदा, विश्वसनीय डेटाबेस (जैसे FishBase या PanTHERIA) के साथ उन प्रजातियों के लिए की जो पहले से ज्ञात थीं। कंप्यूटर के उत्तर बड़े वर्गों के लिए मौजूदा मानव-क्यूरेटेड डेटा के साथ लगभग पूरी तरह मेल खा गए (अक्सर 95% से अधिक सहमति) जैसे कि "क्या इसमें रीढ़ है?" या "क्या इसमें कवच है?"।
  • "विशेषज्ञ ऑडिट" (The Expert Audit): उन्होंने 200 यादृच्छिक प्रजातियों को लिया और एक दूसरे AI (एक दूसरी राय के रूप में) से काम की जांच करवाई। दोनों AI उत्तरों की दिशा के बारे में लगभग 95-97% समय सहमत थे।
  • "ग्रुपिंग" टेस्ट: उन्होंने डेटा को देखने के लिए कि क्या यह जैविक रूप से तर्कसंगत है। क्या सभी मछलियाँ एक साथ समूह में आईं? क्या सभी मशरूम एक साथ समूह में आए? हाँ। कंप्यूटर ने स्वाभाविक रूप से समान जीवों को एक साथ समूहित किया, जिससे सिद्ध हुआ कि वह जीवन के "स्वरूप" को समझता है, भले ही वह जीवविज्ञानी न हो।

यह डेटा क्या है (और क्या नहीं है)

यह शोध पत्र इस डेटासेट के बारे में बहुत स्पष्ट है कि यह किसके लिए है:

  • यह है: अन्वेषण (Exploration) के लिए एक शक्तिशाली उपकरण। यह पैटर्न पहचानने, नए विचार उत्पन्न करने, या यह खोजने के लिए बेहतरीन है कि किन प्रजातियों को अगली बार मानव विशेषज्ञ द्वारा देखने की आवश्यकता है। यह वैश्विक जीवन के गुणों के एक "प्रथम ड्राफ्ट" की तरह है।
  • यह नहीं है: प्रयोगशाला में किसी विशिष्ट जानवर को मापने वाले वैज्ञानिक के विकल्प के रूप में। आपको इस डेटासेट के किसी एकल उत्तर को बिना जांचे एक पूर्ण, अपरिवर्तनीय तथ्य के रूप में उद्धृत नहीं करना चाहिए, विशेष रूप से दुर्लभ या अजीब प्रजातियों के लिए।

निष्कर्ष (The Bottom Line)

यह शोध पत्र जीवन के गुणों का एक विशाल, क्रॉस-किंगडम मानचित्र प्रस्तुत करता है, जिसे वेब-सर्च करने वाले AI द्वारा बनाया गया है। यह एक टेलीस्कोप होने जैसा है जो आपको हर तारे को हाथ से मापने के बजाय तुरंत जीवन के ब्रह्मांड के सामान्य आकार को देखने की अनुमति देता है। यह पूर्ण नहीं है, लेकिन यह वैज्ञानिकों को बेहतर प्रश्न पूछने और अध्ययन के लिए सबसे दिलचस्प प्रजातियों को खोजने के लिए एक शुरुआती बिंदु प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →