DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering
यह शोध पत्र DrugClaw को प्रस्तुत करता है, जो एक मल्टी-एजेंट रिट्रीवल-ऑगमेंटेड सिस्टम है जो प्राथमिक नियामक या सहकर्मी-समीक्षित स्रोतों पर आधारित दवा संबंधी सूचनात्मक उत्तर उत्पन्न करता है, और नए अथॉरिटी-अवेयर DrugAudit बेंचमार्क का उपयोग करके मौजूदा मॉडलों के विरुद्ध सटीकता, स्रोत निष्ठा और साक्ष्य गुणवत्ता में अपने बेहतर प्रदर्शन को प्रमाणित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।
बड़ी समस्या: "आत्मविश्वासी लेकिन गलत" डॉक्टर
कल्प_िए कि आपने किसी दवा के बारे में एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल) से एक विशिष्ट प्रश्न पूछा: "क्या यह दवा लिवर को नुकसान पहुँचाती है, और यह कहाँ लिखा है?"
लाइब्रेरियन आपको बहुत ही सहज और आत्मविश्वासपूर्ण उत्तर दे सकता है। लेकिन यहाँ एक पेंच है:
- भ्रम (Hallucinations): कभी-कभी, लाइब्रेरियन ऐसी संख्याएँ या तथ्य बना देता है जो सुनने में वास्तविक लगते हैं लेकिन पूरी तरह से मनगढ़ंत होते हैं।
- खराब स्रोत (Bad Sources): भले ही तथ्य सही हो, लाइब्रेरियन उस दवा के बारे में किसी "समरी ब्लॉग" या "समाचार लेख" का हवाला दे सकता है, बजाय मूल, आधिकारिक सरकारी रिपोर्ट या पीयर-रिव्यू मेडिकल स्टडी के। चिकित्सा की दुनिया में, सारांश का हवाला देना वास्तविक रडार डेटा के बजाय मौसम के पूर्वानुमान का हवाला देने जैसा है। यह जोखिम भरा है।
यह शोध पत्र तर्क देता है कि चिकित्सा में, आप उत्तर कहाँ से प्राप्त करते हैं यह उतना ही महत्वपूर्ण है जितना कि उत्तर क्या है।
समाधान: "DrugClaw" (अति-जांच करने वाला जासूस)
लेखकों ने DrugClaw नामक एक नया सिस्टम बनाया है। इसे एक अकेले लाइब्रेरियन के रूप में नहीं, बल्कि एक सुरक्षित, हाई-टेक ऑफिस में मिलकर काम करने वाली विशेषज्ञ जासूसों की एक टीम के रूप में समझें।
- टीम: एक AI के अनुमान लगाने के बजाय, DrugClaw आठ अलग-अलग "एजेंट्स" (विशेषज्ञों) का उपयोग करता है। एक जांच की योजना बनाता है, एक फाइलों की खोज करता है, एक साक्ष्यों की जाँच करता है, और एक "रिफ्लेक्टर" (गुणवत्ता नियंत्रण निरीक्षक) के रूप में कार्य करता है।
- सुरक्षित कार्यालय (Sandbox): AI को अनियंत्रित होने या गलत फाइलों तक पहुँचने से रोकने के लिए, जासूस एक "सैंडबॉक्स" में काम करते हैं। यह एक बंद कमरे की तरह है जहाँ वे केवल एक विशिष्ट, पूर्व-अनुमोदित सूची वाले उपकरणों और डेटाबेस का ही उपयोग कर सकते हैं। वे कुछ भी "गूगल" नहीं कर सकते; उन्हें 70+ विश्वसनीय स्रोतों (जैसे FDA, आधिकारिक ड्रग लेबल और मेडिकल जर्नल्स) के एक सख्त रजिस्टर से डेटा निकालना होगा।
- "रिफ्लेक्शन" लूप (The Reflection Loop): यह सिस्टम की सुपरपावर है। टीम द्वारा कुछ तथ्य एकत्र करने के बाद, "रिफ्लेक्टर" एजेंट पूछता है: "क्या यह पर्याप्त है? क्या यह मूल स्रोत से है? क्या हमें और गहराई में जाने की आवश्यकता है?"
- यदि उत्तर है "नहीं, हमें और प्रमाण चाहिए," तो टीम वापस काम पर लग जाती है।
- यदि उत्तर है "हमें कुछ नहीं मिला," तो सिस्टम उत्तर देने से मना कर देता है। यह झूठ बनाने के बजाय "मुझे नहीं पता" कहना पसंद करेगा। इसे "कैलिब्रेटेड एब्स्टेंशन" (calibrated abstention) कहा जाता है।
पैमाना: "DrugAudit" (एक सख्त ग्रेडिंग प्रणाली)
यह सिद्ध करने के लिए कि DrugClaw काम करता है, लेखकों ने DrugAudit नामक एक नया परीक्षण बनाया है। कल्पना कीजिए कि एक शिक्षक छात्र के निबंध को ग्रेड दे रहा है, लेकिन एक ट्विस्ट के साथ:
- पुराना ग्रेडिंग: शिक्षक केवल यह देखता है कि उत्तर सही है या नहीं।
- DrugAudit ग्रेडिंग: शिक्षक तीन चीजें जाँचता है:
- स्रोत अधिकार (Source Authority): क्या छात्र ने मूल सरकारी दस्तावेज़ का हवाला दिया, या केवल उस वेबसाइट का जिसने उसे कॉपी किया था? (DrugClv मूल खोजने में माहिर है)।
- स्निपेट मैच (Snippet Match): क्या छात्र ने वास्तव में उस विशिष्ट पैराग्राफ को पढ़ा जिसका उसने हवाला दिया, या उसने केवल शीर्षक को कॉपी किया?
- विश्वसनीयता (Faithfulness): क्या छात्र ने ऐसा तथ्य गढ़ा जो स्रोत में नहीं था?
लेखकों ने उत्तरों को ग्रेड देने के लिए दो अलग-अलग "AI न्यायाधीशों" (दो अलग-अलग हेड टीचर की तरह) का उपयोग किया। वे एक-दूसरे के साथ लगभग पूरी तरह सहमत थे (98% सहमति), जो परिणामों को बहुत भरोसेमंद बनाता है।
परिणाम: स्वर्ण पदक विजेता
जब उन्होंने अन्य स्मार्ट AI सिस्टम (सीधे बड़े भाषा मॉडलों सहित) के विरुद्ध DrugClaw का परीक्षण किया:
- प्राथमिक स्रोत दर: DrugClaw ने 91.8% बार मूल, आधिकारिक दस्तावेजों का हवाला दिया। दूसरा सबसे अच्छा सिस्टम केवल लगभग 81.7% बार ऐसा कर पाया।
- सत्यवादिता: DrugClaw के तथ्य गढ़ने की संभावना बहुत कम थी।
- अस्वीकरण (Refusal): जब कोई डेटा उपलब्ध नहीं था, तो DrugClaw ने 91-97% बार सही ढंग से "मुझे नहीं पता" कहा। अन्य सिस्टम अनुमान लगाने की कोशिश करते थे और गलत साबित हुए।
ट्रेड-ऑफ (समझौता)
पत्र एक छोटी सी कमी का उल्लेख करता है: "ग्राफ मोड" (गहन जांच करने वाली जासूस टीम) को सोचने में अधिक समय (लगभग 46 सेकंड) लगता है और यह लंबे उत्तर लिखता है जिसे ग्रेडिंग AI के लिए पूरी तरह से समझना कभी-कभी कठिन होता है। हालांकि, लेखक तर्क देते हैं कि उच्च-जोखिम वाले चिकित्सा प्रश्नों के लिए, सटीकता और प्रमाण अतिरिक्त समय के लायक हैं।
एक वाक्य में सारांश
यह शोध पत्र DrugClaw को पेश करता है, जो जासूसों की एक ऐसी AI टीम है जो अनुमान लगाने से इनकार करती है, केवल मूल सरकारी और चिकित्सा रिकॉर्ड का हवाला देती है, और यह सिद्ध करने के लिए एक सख्त नई ग्रेडिंग प्रणाली (DrugAudit) का उपयोग करती है कि यह बिना कुछ मनगढ़ंत बनाए दवाओं के सवालों के जवाब देने के लिए सबसे विश्वसनीय उपकरण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।