HARVEST: Unlocking the Dark Bioactivity Data of Pharmaceutical Patents via Agentic AI
यह शोध पत्र HARVEST को प्रस्तुत करता है, जो एक एजेंटिक AI पाइपलाइन है जो फार्मास्युटिकल पेटेंटों से 3.36 मिलियन पहले से अप्राप्य बायोएक्टिविटी रिकॉर्ड्स को स्वायत्त रूप से निकालता है, जिससे इस नए प्राप्त डेटा पर मूल्यांकन किए जाने पर वर्तमान AI मॉडलों में महत्वपूर्ण सामान्यीकरण अंतराल (generalization gaps) का पता चलता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
दवा की खोज (drug discovery) की दुनिया की कल्पना एक विशाल पुस्तकालय के रूप में करें। दशकों से, वैज्ञानिक इस पुस्तकालय के भीतर छिपे नई दवाओं के "गुप्त नुस्खों" को खोजने की कोशिश कर रहे हैं।
पुस्तकालय का अधिकांश हिस्सा खुला और सुव्यवस्थित है (जैसे कि प्रसिद्ध BindingDB, एक सार्वजनिक डेटाबेस जिसका वैज्ञानिक उपयोग करते हैं)। लेकिन एक बहुत बड़ा, धूल भरा, बंद तहखाना है जिसमें लाखों बक्से रखे हैं। इन बक्सों में फार्मास्युटिकल पेटेंट (औषधीय पेटेंट) हैं—वे कानूनी दस्तावेज़ जहाँ कंपनियाँ अपनी नई दवा प्रयोगों का वर्णन करती हैं।
समस्या यह है कि ये बक्से अव्यवस्थित तालिकाओं, रासायनिक चित्रों और कानूनी शब्दावली के एक जटिल मिश्रण में लिखे गए हैं। वे तकनीकी रूप से "सार्वजनिक" हैं, लेकिन किसी के पास उन्हें मैन्युअल रूप से पढ़ने और व्यवस्थित करने का समय या पैसा नहीं है। यही वह चीज़ है जिसे लेखक "डार्क डेटा" (Dark Data) कहते हैं। यह वहाँ मौजूद है, लेकिन कंप्यूटरों के लिए अदृश्य है।
यहाँ बताया गया है कि कैसे HARVEST प्रोजेक्ट इस तहखाने को खोलता है:
1. समस्या: "डार्क डेटा" का तहखाना
हर साल, कंपनियाँ हजारों पेटेंट दायर करती हैं। इनके अंदर ऐसी तालिकाएँ होती हैं जो कहती हैं, "कंपाउंड A प्रोटीन B के साथ इतनी मजबूती से जुड़ता है।"
- पुराना तरीका: मानव विशेषज्ञों को इन दस्तावेजों को एक-एक करके पढ़ना पड़ता, डेटा को कंप्यूटर में टाइप करना पड़ता और गलतियों की जाँच करनी पड़ती। अमेरिका के सभी पेटेंटों को पढ़ने के लिए विशेषज्ञों की एक टीम को बिना रुके 55 साल तक काम करना पड़ता।
- परिणाम: इस कारण से अधिकांश डेटा अंधेरे में ही रह जाता है। नई दवाओं की खोज करने वाले AI मॉडल ऐसे छात्रों की तरह हैं जो केवल एक छोटे, पुराने टेक्स्टबुक का उपयोग करके परीक्षा की तैयारी कर रहे हैं, जिससे वे अधिकांश उत्तरों को खो देते हैं।
2. समाधान: "एजेंटिक AI" की टीम (HARVEST)
55 साल के मानव श्रम के बजाय, लेखकों ने HARVEST बनाया, जो AI एजेंटों (विशेषज्ञ रोबोटों) की एक टीम है जो एक सुव्यवस्थित असेंबली लाइन की तरह मिलकर काम करते हैं।
इसे एक सुपर-डिटेक्टिव के बजाय एक विशेषज्ञ जासूसी दस्ते के रूप में सोचें:
- एजेंट 1 (द स्काउट - खोजकर्ता): पेटेंट को स्कैन करता है ताकि यह पता लगाया जा सके कि जैविक लक्ष्य (यानी "ताले") कहाँ वर्णित हैं।
- एजेंट 2 (द अकाउंटेंट - लेखाकार): संख्याओं (दवा कितनी मजबूत है) को निकालता है।
- एजेंट 3 (द ट्रांसलेटर - अनुवादक): यह समझता है कि टेक्स्ट में दिया गया "Compound 42" वास्तव में एक विशिष्ट रासायनिक संरचना है।
- एजेंट 4 और 5 (द लाइब्रेरियन - पुस्तकालयाध्यक्ष): अव्यवस्थित रासायनिक चित्रों को एक मानक डिजिटल प्रारूप (SMILES) में बदलते हैं और प्रोटीन के नामों को एक सार्वभौमिक आईडी कार्ड (UniProt) से मिलाते हैं।
जादुई आँकड़े:
- गति: उन्होंने एक सप्ताह से भी कम समय में 164,877 पेटेंटों को प्रोसेस किया।
- लागत: इसमें केवल $0.11 प्रति दस्तावेज़ का खर्च आया। (कल्पना कीजिए कि एक पूरा पेटेंट पढ़ने के लिए केवल 11 सेंट देने पड़ रहे हैं!)
- आउटपुट: उन्होंने 3.36 मिलियन नए डेटा पॉइंट अनलॉक किए, जिसमें 1,108 प्रोटीन लक्ष्य शामिल हैं जिनके बारे में सार्वजनिक डेटाबेस में पहले किसी को पता नहीं था।
3. गुणवत्ता जाँच: क्या AI भ्रमित (Hallucinate) हो रहा है?
आप चिंतित हो सकते हैं, "क्या एक रोबोट वास्तव में एक अस्त-व्यस्त पेटेंट को इंसान से बेहतर पढ़ सकता है?"
लेखकों ने HARVEST का परीक्षण 'गोल्ड स्टैंडर्ड' (मानव-क्यूरेटेड डेटा) के विरुद्ध किया।
- सटीकता: AI 91% बार मानव विशेषज्ञों के साथ सहमत हुआ।
- "यूनिट कन्वर्जन" की जीत: इंसान अक्सर "नैनोमीटर" और "माइक्रोमीटर" को समझने में ऐसी गलतियाँ करते हैं जो 1,000 गुना की त्रुटि पैदा कर सकती हैं। AI ने विशेष रूप से इन गलतियों को करने में इंसानों से कम गलतियाँ कीं।
- कवरेज: क्योंकि यह इतना सस्ता है, HARVEST ने उन हजारों "उबाऊ" पेटेंटों को भी पढ़ा जिन्हें इंसानों ने इसलिए छोड़ दिया था क्योंकि वे उन्हें प्रयास करने लायक नहीं समझते थे। इससे छिपे हुए रत्न सामने आए।
4. नया बेंचमार्क: H-Bench (अंतिम परीक्षा)
एक बार जब उन्होंने डेटा को अनलॉक कर लिया, तो उन्हें एहसास हुआ कि ड्रग डिस्कवरी के लिए उपयोग किए जाने वाले AI मॉडल वास्तव में काफी कमजोर थे।
- उपमा: कल्पना कीजिए कि एक छात्र जिसने एक विशिष्ट अभ्यास टेस्ट के उत्तर रट लिए हैं। वह उसमें 'A' ग्रेड प्राप्त करता है। लेकिन जब आप उसे एक नया टेस्ट देते हैं जिसमें नए प्रश्न हैं (HARVEST डेटा), तो वह असफल हो जाता है।
- परीक्षण (H-Bench): लेखकों ने नए अनलॉक किए गए डेटा का उपयोग करके H-Bench नामक एक नई, सख्त परीक्षा बनाई।
- परिणाम: जब उन्होंने एक शीर्ष-स्तरीय AI मॉडल (Boltz-2) का इस नई परीक्षा पर परीक्षण किया, तो वह संघर्ष करता दिखा। यदि दवा वैसी ही थी जैसी उसने पहले देखी थी, तो वह अच्छा अनुमान लगा सकता था, लेकिन यदि दवा का आकार नया था या प्रोटीन एक नया प्रकार का था, तो AI भटक जाता था।
- सबक: वर्तमान AI ने वास्तव में इस "भौतिकी" (physics) को नहीं सीखा है कि दवाएं प्रोटीन से कैसे जुड़ती हैं; यह ज्यादातर केवल पैटर्न को याद कर रहा है। हमें उन्हें स्मार्ट बनाने के लिए इस नए "डार्क डेटा" पर प्रशिक्षित करने की आवश्यकता है।
यह क्यों महत्वपूर्ण है
- लोकतांत्रीकरण: पहले, केवल महंगी सदस्यता वाले अमीर कंपनियों के पास ही इस डेटा तक पहुँच थी। अब, कोई भी विश्वविद्यालय या छोटा लैब इस डेटासेट को मुफ्त में डाउनलोड कर सकता है।
- गति: अब हम नए पेटेंट फाइल होने के साथ ही दवा के अंतर्संबंधों के बारे में अपने ज्ञान को वास्तविक समय में अपडेट कर सकते हैं, बजाय इसके कि वर्षों तक इंसानों के पीछे चलने का इंतज़ार किया जाए।
- भविष्य: यह साबित करता है कि "डार्क डेटा" केवल एक समस्या नहीं है; यह एक सोने की खान है जिसे खोदने के लिए सही AI उपकरणों की आवश्यकता है।
संक्षेप में: HARVEST एक रोबोटिक लाइब्रेरियन है जिसने एक सप्ताह में कुछ ही पैसों में लाखों ड्रग पेटेंटों के धूल भरे, अराजक तहखाने को साफ कर दिया, जिससे दुनिया को बीमारियों को तेजी से ठीक करने में मदद करने के लिए ज्ञान का एक विशाल नया पुस्तकालय मिल गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।