A PubMed-Scale Dataset of Structured Biomedical Abstracts
यह शोध पत्र स्ट्रक्चर्ड पबमेड (Structured PubMed) का परिचय देता है, जो 23.2 मिलियन से अधिक बायोमेडिकल एब्स्ट्रैक्ट्स का एक व्यापक डेटासेट है जो बड़े पैमाने पर टेक्स्ट माइनिंग और सूचना निष्कर्षण को सुगम बनाने के लिए लेखक-संरचित रिकॉर्ड्स को स्वचालित रूप से लेबल किए गए अनस्ट्रक्चर्ड एब्स्ट्रैक्ट्स के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास 2.3 करोड़ से अधिक मेडिकल रिसर्च पेपर्स का एक विशाल पुस्तकालय है। अब, कल्पना कीजिए कि उन किताबों के अधिकांश सारांश (एब्स्ट्रैक्ट्स) एक ही बड़े, बिना टूटे हुए टेक्स्ट ब्लॉक के रूप में लिखे गए हैं। यह एक ऐसी रेसिपी को पढ़ने जैसा है जहाँ सामग्री, पकाने के चरण और अंतिम स्वाद परीक्षण सब एक ही पैराग्राफ में आपस में मिल गए हों। यह बिल्कुल सटीक जानकारी ढूँढना कठिन बना देता है।
यह शोध पत्र "स्ट्रक्चर्ड पबमेड" (Structured PubMed) नामक एक प्रोजेक्ट का परिचय देता है, जो अनिवार्य रूप से एक विशाल डिजिटल सफाई दल (cleanup crew) है। उनका लक्ष्य उन अव्यवस्थित, टेक्स्ट ब्लॉक वाले सारांशों को व्यवस्थित रूप से पाँच विशिष्ट अनुभागों में विभाजित करना था: पृष्ठभूमि (Background), उद्देश्य (Objective), विधियाँ (Methods), परिणाम (Results), और निष्कर्ष (Conclusions)।
उन्होंने इसे कैसे किया, इसे एक सरल उपमा के माध्यम से समझाया गया है:
दो-भाग वाला सफाई दल
शोधकर्ताओं ने उनके 2.32 करोड़ पेपर्स को दो ढेरों में विभाजित किया:
"पहले से ही व्यवस्थित" ढेर (5.9 मिलियन पेपर्स):
कुछ लेखकों ने अपने सारांश पहले से ही स्पष्ट शीर्षकों (headings) के साथ लिखे थे, जैसे कि एक अच्छी तरह से व्यवस्थित कुकबुक। शोधकर्ताओं ने बस इन मौजूदा शीर्षकों को मानकीकृत (standardize) किया। इसे एक ऐसी किताब लेने के समान समझें जिसमें पहले से ही अध्याय के शीर्षक मौजूद हैं और बस यह सुनिश्चित करना कि फॉन्ट सुसंगत हो।"अव्यवस्थित" ढेर (17.2 मिलियन पेपर्स):
अधिकांश पेपर्स में कोई शीर्षक नहीं था। इसे ठीक करने के लिए, शोधकर्ताओं ने एक परिष्कृत आर्टिफिशियल इंटेलिजेंस (विशेष रूप से, GPT-4.1-mini नामक एक लार्ज लैंग्वेज मॉडल) का उपयोग एक अति-तेज, अत्यधिक सटीक लाइब्रेरियन के रूप में किया।
AI लाइब्रेरियन कैसे काम करता है
आपको चिंता हो सकती है कि AI टेक्स्ट को फिर से लिख देगा या अपनी ओर से कुछ बना लेगा (hallucinate)। इसे रोकने के लिए, शोधकर्ताओं ने AI को बहुत सख्त निर्देश दिए, जैसे कि एक सख्त शिक्षक निबंध को ग्रेड देता है:
- "केवल कॉपी-पेस्ट करें": AI को टेक्स्ट को शब्द-दर-शब्द (verbatim) निकालने के लिए कहा गया था। वह एक भी कॉमा या पर्यायवाची शब्द नहीं बदल सकता था। उसे कैंची और गोंद की तरह काम करना था, यानी टेक्स्ट के टुकड़ों को काटना और उन्हें सही बॉक्स में चिपकाना।
- "कोई अनुमान न लगाएं": यदि कोई अनुभाग मौजूद नहीं था (जैसे कि यदि किसी पेपर में स्पष्ट "उद्देश्य" नहीं था), तो AI को उसे खाली छोड़ने के लिए कहा गया था बजाय इसके कि वह कुछ नया आविष्कार करे।
- "सीमाओं को पहचानें": AI को भाषा की अपनी समझ का उपयोग करके यह पता लगाना था कि एक विचार कहाँ समाप्त हुआ और दूसरा कहाँ शुरू हुआ। उदाहरण के लिए, उसे यह अंतर करना था कि "यहाँ हमने यह अध्ययन क्यों किया" (पृष्ठभूमि) और "यहाँ हम क्या करने की योजना बना रहे हैं" (उद्देश्य) के बीच क्या अंतर है।
क्या यह सफल रहा?
यह जाँचने के लिए कि उनका AI लाइब्रेरियन कितना अच्छा काम कर रहा है, शोधकर्ताओं ने एक परीक्षण किया। उन्होंने 30,000 पेपर्स लिए जिनमें पहले से ही सटीक शीर्षक थे, शीर्षकों को हटाकर उन्हें अव्यवस्थित बनाया, और फिर AI से उन शीर्षकों को वापस लगाने के लिए कहा।
उन्होंने AI के काम की तुलना मूल, मानव-लिखित शीर्षकों से की। परिणाम प्रभावशाली थे:
- AI अविश्वसनीय रूप से सटीक था, और उन मेट्रिक्स पर उच्च स्कोर किया जो यह मापते हैं कि AI के 'कट' मानव के 'कट' से कितने मेल खाते हैं।
- यह विभिन्न प्रकार के अध्ययनों (जैसे क्लिनिकल ट्रायल बनाम ऑब्जर्वेशनल स्टडीज) में सुसंगत था।
- यह पुराने, सरल कंप्यूटर प्रोग्रामों की तुलना में बहुत बेहतर था जो केवल कीवर्ड्स (keywords) को खोजते थे।
यह क्यों महत्वपूर्ण है?
इस प्रोजेक्ट से पहले, यदि आप चिकित्सा साहित्य में विशिष्ट जानकारी (जैसे "इस अध्ययन के परिणाम क्या थे?") खोजने के लिए कंप्यूटर प्रोग्रामों का उपयोग करना चाहते थे, तो आप फंस जाते थे। आप केवल उन 5.9 मिलियन पेपर्स को आसानी से खोज सकते थे जिनमें पहले से ही शीर्षक मौजूद थे। बाकी के 1.7 करोड़ पेपर्स एक 'ब्लैक बॉक्स' की तरह थे।
अब, स्ट्रक्चर्ड पबमेड के साथ, शोधकर्ताओं के पास 2.3 करोड़ से अधिक पेपर्स का एक एकीकृत डेटासेट है जहाँ प्रत्येक पेपर को उन्हीं पाँच अनुभागों में व्यवस्थित किया गया है। यह वैज्ञानिकों और डेवलपर्स को निम्नलिखित अनुमति देता है:
- चिकित्सा टेक्स्ट को समझने के लिए बेहतर AI मॉडल को प्रशिक्षित करना।
- पूरे पबमेड के इतिहास में विशिष्ट जानकारी (जैसे केवल "परिणाम") खोजने के लिए।
- विभिन्न प्रकार के अध्ययनों के लेखन के तरीके की तुलना करना, क्योंकि अब वे सभी एक ही संरचना साझा करते हैं।
संक्षेप में, यह शोध पत्र चिकित्सा सारांशों के अब तक के सबसे बड़े संगठित संग्रह के निर्माण का वर्णन करता है, जिसने टेक्स्ट के एक अराजक ढेर को स्मार्ट AI टूल्स का उपयोग करके एक व्यवस्थित, खोजने योग्य पुस्तकालय में बदल दिया है जो मूल शब्दों का सम्मान करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।