← नवीनतम पेपर
💬 NLP

A PubMed-Scale Dataset of Structured Biomedical Abstracts

यह शोध पत्र स्ट्रक्चर्ड पबमेड (Structured PubMed) का परिचय देता है, जो 23.2 मिलियन से अधिक बायोमेडिकल एब्स्ट्रैक्ट्स का एक व्यापक डेटासेट है जो बड़े पैमाने पर टेक्स्ट माइनिंग और सूचना निष्कर्षण को सुगम बनाने के लिए लेखक-संरचित रिकॉर्ड्स को स्वचालित रूप से लेबल किए गए अनस्ट्रक्चर्ड एब्स्ट्रैक्ट्स के साथ जोड़ता है।

मूल लेखक: Chia-Hsuan Chang, Haerin Song, Brian Ondov, Hua Xu

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chia-Hsuan Chang, Haerin Song, Brian Ondov, Hua Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास 2.3 करोड़ से अधिक मेडिकल रिसर्च पेपर्स का एक विशाल पुस्तकालय है। अब, कल्पना कीजिए कि उन किताबों के अधिकांश सारांश (एब्स्ट्रैक्ट्स) एक ही बड़े, बिना टूटे हुए टेक्स्ट ब्लॉक के रूप में लिखे गए हैं। यह एक ऐसी रेसिपी को पढ़ने जैसा है जहाँ सामग्री, पकाने के चरण और अंतिम स्वाद परीक्षण सब एक ही पैराग्राफ में आपस में मिल गए हों। यह बिल्कुल सटीक जानकारी ढूँढना कठिन बना देता है।

यह शोध पत्र "स्ट्रक्चर्ड पबमेड" (Structured PubMed) नामक एक प्रोजेक्ट का परिचय देता है, जो अनिवार्य रूप से एक विशाल डिजिटल सफाई दल (cleanup crew) है। उनका लक्ष्य उन अव्यवस्थित, टेक्स्ट ब्लॉक वाले सारांशों को व्यवस्थित रूप से पाँच विशिष्ट अनुभागों में विभाजित करना था: पृष्ठभूमि (Background), उद्देश्य (Objective), विधियाँ (Methods), परिणाम (Results), और निष्कर्ष (Conclusions)।

उन्होंने इसे कैसे किया, इसे एक सरल उपमा के माध्यम से समझाया गया है:

दो-भाग वाला सफाई दल

शोधकर्ताओं ने उनके 2.32 करोड़ पेपर्स को दो ढेरों में विभाजित किया:

  1. "पहले से ही व्यवस्थित" ढेर (5.9 मिलियन पेपर्स):
    कुछ लेखकों ने अपने सारांश पहले से ही स्पष्ट शीर्षकों (headings) के साथ लिखे थे, जैसे कि एक अच्छी तरह से व्यवस्थित कुकबुक। शोधकर्ताओं ने बस इन मौजूदा शीर्षकों को मानकीकृत (standardize) किया। इसे एक ऐसी किताब लेने के समान समझें जिसमें पहले से ही अध्याय के शीर्षक मौजूद हैं और बस यह सुनिश्चित करना कि फॉन्ट सुसंगत हो।

  2. "अव्यवस्थित" ढेर (17.2 मिलियन पेपर्स):
    अधिकांश पेपर्स में कोई शीर्षक नहीं था। इसे ठीक करने के लिए, शोधकर्ताओं ने एक परिष्कृत आर्टिफिशियल इंटेलिजेंस (विशेष रूप से, GPT-4.1-mini नामक एक लार्ज लैंग्वेज मॉडल) का उपयोग एक अति-तेज, अत्यधिक सटीक लाइब्रेरियन के रूप में किया।

AI लाइब्रेरियन कैसे काम करता है

आपको चिंता हो सकती है कि AI टेक्स्ट को फिर से लिख देगा या अपनी ओर से कुछ बना लेगा (hallucinate)। इसे रोकने के लिए, शोधकर्ताओं ने AI को बहुत सख्त निर्देश दिए, जैसे कि एक सख्त शिक्षक निबंध को ग्रेड देता है:

  • "केवल कॉपी-पेस्ट करें": AI को टेक्स्ट को शब्द-दर-शब्द (verbatim) निकालने के लिए कहा गया था। वह एक भी कॉमा या पर्यायवाची शब्द नहीं बदल सकता था। उसे कैंची और गोंद की तरह काम करना था, यानी टेक्स्ट के टुकड़ों को काटना और उन्हें सही बॉक्स में चिपकाना।
  • "कोई अनुमान न लगाएं": यदि कोई अनुभाग मौजूद नहीं था (जैसे कि यदि किसी पेपर में स्पष्ट "उद्देश्य" नहीं था), तो AI को उसे खाली छोड़ने के लिए कहा गया था बजाय इसके कि वह कुछ नया आविष्कार करे।
  • "सीमाओं को पहचानें": AI को भाषा की अपनी समझ का उपयोग करके यह पता लगाना था कि एक विचार कहाँ समाप्त हुआ और दूसरा कहाँ शुरू हुआ। उदाहरण के लिए, उसे यह अंतर करना था कि "यहाँ हमने यह अध्ययन क्यों किया" (पृष्ठभूमि) और "यहाँ हम क्या करने की योजना बना रहे हैं" (उद्देश्य) के बीच क्या अंतर है।

क्या यह सफल रहा?

यह जाँचने के लिए कि उनका AI लाइब्रेरियन कितना अच्छा काम कर रहा है, शोधकर्ताओं ने एक परीक्षण किया। उन्होंने 30,000 पेपर्स लिए जिनमें पहले से ही सटीक शीर्षक थे, शीर्षकों को हटाकर उन्हें अव्यवस्थित बनाया, और फिर AI से उन शीर्षकों को वापस लगाने के लिए कहा।

उन्होंने AI के काम की तुलना मूल, मानव-लिखित शीर्षकों से की। परिणाम प्रभावशाली थे:

  • AI अविश्वसनीय रूप से सटीक था, और उन मेट्रिक्स पर उच्च स्कोर किया जो यह मापते हैं कि AI के 'कट' मानव के 'कट' से कितने मेल खाते हैं।
  • यह विभिन्न प्रकार के अध्ययनों (जैसे क्लिनिकल ट्रायल बनाम ऑब्जर्वेशनल स्टडीज) में सुसंगत था।
  • यह पुराने, सरल कंप्यूटर प्रोग्रामों की तुलना में बहुत बेहतर था जो केवल कीवर्ड्स (keywords) को खोजते थे।

यह क्यों महत्वपूर्ण है?

इस प्रोजेक्ट से पहले, यदि आप चिकित्सा साहित्य में विशिष्ट जानकारी (जैसे "इस अध्ययन के परिणाम क्या थे?") खोजने के लिए कंप्यूटर प्रोग्रामों का उपयोग करना चाहते थे, तो आप फंस जाते थे। आप केवल उन 5.9 मिलियन पेपर्स को आसानी से खोज सकते थे जिनमें पहले से ही शीर्षक मौजूद थे। बाकी के 1.7 करोड़ पेपर्स एक 'ब्लैक बॉक्स' की तरह थे।

अब, स्ट्रक्चर्ड पबमेड के साथ, शोधकर्ताओं के पास 2.3 करोड़ से अधिक पेपर्स का एक एकीकृत डेटासेट है जहाँ प्रत्येक पेपर को उन्हीं पाँच अनुभागों में व्यवस्थित किया गया है। यह वैज्ञानिकों और डेवलपर्स को निम्नलिखित अनुमति देता है:

  • चिकित्सा टेक्स्ट को समझने के लिए बेहतर AI मॉडल को प्रशिक्षित करना।
  • पूरे पबमेड के इतिहास में विशिष्ट जानकारी (जैसे केवल "परिणाम") खोजने के लिए।
  • विभिन्न प्रकार के अध्ययनों के लेखन के तरीके की तुलना करना, क्योंकि अब वे सभी एक ही संरचना साझा करते हैं।

संक्षेप में, यह शोध पत्र चिकित्सा सारांशों के अब तक के सबसे बड़े संगठित संग्रह के निर्माण का वर्णन करता है, जिसने टेक्स्ट के एक अराजक ढेर को स्मार्ट AI टूल्स का उपयोग करके एक व्यवस्थित, खोजने योग्य पुस्तकालय में बदल दिया है जो मूल शब्दों का सम्मान करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →