LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence
यह शोध पत्र ड्रग एसेट ड्यू डिलिजेंस (drug asset due diligence) के लिए एक LLM-आधारित एजेंट सिस्टम का परिचय और बेंचमार्किंग करता है जो अनस्ट्रक्चर्ड VC मेमो को एक स्ट्रक्चर्ड इवैल्यूएशन कॉर्पस में परिवर्तित करता है, जिससे प्रतिस्पर्धी खोज (competitor discovery) में 83% रिकॉल प्राप्त होता है और विश्लेषक टर्नअराउंड समय 2.5 दिनों से घटकर लगभग 3 घंटे हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत बड़े केस को सुलझाने की कोशिश कर रहे हैं: "इस विशिष्ट ड्रग मार्केट में अन्य सभी खिलाड़ी कौन हैं?"
बायोटेक निवेश की दुनिया में, कोई फंड किसी नई दवा में पैसा लगाने का निर्णय लेने से पहले, उन्हें पूरी "प्रतिस्पर्धी परिदृश्य" (competitive landscape) को जानना होता है। उन्हें यह पता लगाने की आवश्यकता होती है कि उस विशिष्ट बीमारी से लड़ने वाली हर एक अन्य दवा कौन सी है। इसे ड्यू डिलिजेंस (Due Diligence) कहा जाता है।
वर्तमान में, ऐसा करना एक सुई को घास के ढेर में खोजने जैसा है, जहाँ वह घास का ढेर हजारों अलग-अलग भाषाओं, टूटी हुई वेबसाइटों, धुंधली छवियों और गुप्त रिपोर्टों से बना है। मानव विशेषज्ञों को इन उलझनों के बीच से उत्तर खोजने के लिए मैन्युअल रूप से (लगभग 2.5 दिन प्रति दवा) खुदाई करने में समय बिताना पड़ता है।
यह पेपर एक नए AI जासूसी दल (जिसे BIOPTIC AGENT कहा जाता है) का परिचय देता है जो यह काम बहुत तेज़ी से और बेहतर तरीके से करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: ड्रग नामों का "खोया और पाया" (Lost and Found)
लेखक बताते हैं कि प्रतिस्पर्धियों को खोजना अविश्वसनीय रूप से कठिन है क्योंकि:
- नाम अस्त-व्यस्त हैं: एक दवा को अलग-अलग देशों में "ड्रग X," "द ब्लू पिल," या उसके रासायनिक कोड द्वारा जाना जा सकता है।
- सूचना बिखरी हुई है: सुराग वैज्ञानिक शोध पत्रों, सरकारी परीक्षण सूचियों, प्रेस विज्ञप्तियों और उन PDF में छिपे होते हैं जो स्प्रेडशीट की तरह दिखते हैं।
- नियम बदलते रहते हैं: हर दिन नई दवाएं आती हैं, और पुरानी गायब हो जाती हैं।
मौजूदा AI उपकरण (जैसे मानक खोज इंजन या साधारण चैटबॉट्स) अक्सर "लॉन्ग-टेल" प्रतिस्पर्धियों—उन अस्पष्ट प्रतिस्पर्धियों को जो खोजने में कठिन हैं—को मिस कर देते हैं। वे अक्सर "हैलुसिनेट" (भ्रमित होकर मनगढ़ंत बातें बनाना) भी करते हैं जब उन्हें वास्तविक उत्तर नहीं मिलता।
2. समाधान: AI एजेंटों की एक टीम
एक अकेले AI से "सब कुछ खोजने के लिए" कहने के बजाय, लेखकों ने विशेषीकृत AI एजेंटों की एक पदानुक्रमित टीम (hierarchical team) बनाई है। इसे एक अच्छी तरह से व्यवस्थित समाचार कक्ष या जासूसी दल की तरह समझें:
- द पार्सर (द आर्काइविस्ट - संग्रहकर्ता): यह एजेंट अव्यवस्थित, असंरचित रिपोर्टों (चार्ट और टेक्स्ट वाले PDF) को पढ़ता है और उन्हें व्यवस्थित सूचियों में बदल देता है। यह दवाओं के नाम और उनके द्वारा ठीक की जाने वाली बीमारियों को निकालता है।
- द एक्सप्लोरर (द डिटेक्टिव - जासूस): यह मुख्य एजेंट है। यह केवल अनुमान नहीं लगाता; यह प्रतिस्पर्धियों का शिकार करने के लिए "वेब" (इंटरनेट) पर जाता है। यह REACT (तर्क, कार्य, अवलोकन) नामक रणनीति का उपयोग करता है।
- उपमा: कल्पना कीजिए कि एक जासूस केवल एक प्रश्न नहीं पूछता। वह एक प्रश्न पूछता है, उत्तर पढ़ता है, महसूस करता है कि उसे और जानकारी की आवश्यकता है, उस जानकारी के आधार पर एक नया प्रश्न पूछता है, और इस लूप को कई बार दोहराता है। वे एक ही समय में विभिन्न वेबसाइटों पर खोजने के लिए कई "स्काउट्स" भी भेजते हैं।
- द वैलिडेटर (द जज - न्यायाधीश): यह सबसे महत्वपूर्ण सुरक्षा कदम है। एक्सप्लोरर को 50 दवाएं मिल सकती हैं, लेकिन 10 फर्जी या अप्रासंगिक हो सकती हैं। वैलिडेटर एक सख्त न्यायाधीश की तरह कार्य करता है। यह एक्सप्लोरर द्वारा खोजी गई प्रत्येक दवा की नियमों के विरुद्ध जांच करता है: "क्या वास्तव में इस बात का प्रमाण है कि यह दवा इस विशिष्ट बीमारी से लड़ती है?" यदि उत्तर 'नहीं' है, तो यह उस दवा को बाहर कर देता है। यह सुनिश्चित करता है कि अंतिम सूची अत्यधिक सटीक हो।
3. प्रशिक्षण डेटा: पेशेवरों से सीखना
इस AI टीम को सिखाने के लिए, लेखकों ने केवल सार्वजनिक डेटा का उपयोग नहीं किया। उन्होंने एक बायोटेक वेंचर कैपिटल फंड से 5 वर्षों के निजी, वास्तविक दुनिया के निवेश मेमो का उपयोग किया।
- उन्होंने इन अव्यवस्थित, हस्तलिखित शैली की रिपोर्टों को लिया और उन्हें साफ करने के लिए अपने स्वयं के AI का उपयोग किया ताकि एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया जा सके।
- यह डेटासेट इस बात का परीक्षण (exam) बन गया कि क्या उनका नया AI टीम प्रतिस्पर्धा से बेहतर है।
4. परिणाम: गति और सटीकता
लेखकों ने अपने BIOPTIC AGENT का परीक्षण अन्य प्रसिद्ध AI सिस्टमों (जैसे OpenAI का Deep Research और Perplexity) के विरुद्ध किया।
- स्कोर: BIOPTIC AGENT ने ज्ञात प्रतिस्पर्धियों में से 83% को खोजा (Recall)।
- OpenAI Deep Research ने 65% खोजा।
- Perplexity ने 60% खोजा।
- गति: एक वेंचर कैपिटल फंड के साथ किए गए वास्तविक परीक्षण में, एक विश्लेषक को प्रतिस्पर्धी विश्लेषण पूरा करने में लगने वाला समय 2.5 दिनों से घटकर लगभग 3 घंटे रह गया। यह 20 गुना तेज़ है।
- गुणवत्ता: भले ही यह तेज़ था, लेकिन इसने सटीकता से समझौता नहीं किया। "जज" एजेंट ने गलत चेतावनियों को सफलतापूर्वक फ़िल्टर किया, जिससे यह सुनिश्चित हुआ कि अंतिम सूची भरोसेमंद है।
5. यह क्यों काम करता है: "बिटर लेसन" बनाम "स्कैफोल्ड"
यह पेपर AI में एक बहस पर चर्चा करता है: क्या हमें बस एक सुपर-स्मार्ट दिमाग (एक बड़ा मॉडल) का उपयोग करना चाहिए और उम्मीद करनी चाहिए कि वह इसे सुलझा लेगा? या हमें एक संरचना (एक "स्कैफोल्ड") बनानी चाहिए जो AI को चरण-दर-चरण काम करने के लिए मजबूर करे?
लेखक मिले कि इस विशिष्ट, अव्यवस्थित काम के लिए, स्कैफोल्ड जीतता है।
- एक सिंगल-पास AI (जो एक बार में उत्तर देने की कोशिश करता है) तब विफल हो जाता है जब जानकारी ढूंढना कठिन हो।
- BIOPTIC AGENT इसलिए सफल होता है क्योंकि इसे खोजते रहने, अपने काम की जांच करने, और उत्तर देने से पहले साक्ष्य सत्यापित करने के लिए बनाया गया है। यह केवल "सोच" नहीं रहा है; यह "शिकार" कर रहा है।
सारांश
यह पेपर एक तैनात (deployed) प्रणाली प्रस्तुत करता है जो एक अति-कुशल अनुसंधान टीम के रूप में कार्य करती है। यह दवा प्रतिस्पर्धियों का मानचित्रण करने के काम को लेता है, हर संभावित सुराग का पीछा करने के लिए एक बहु-चरणीय AI प्रक्रिया का उपयोग करता है, और फिर निष्कर्षों को सत्यापित करने के लिए एक सख्त "जज" AI का उपयोग करता है। परिणाम एक ऐसा उपकरण है जो मानव विशेषज्ञों की तुलना में 20 गुना तेज़ है और अन्य शीर्ष AI सिस्टम की तुलना में अधिक प्रतिस्पर्धियों को खोजता है, जबकि त्रुटि दर को कम रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।