ChainTrust-LLM: Secure and Auditable Hallucination Mitigation in Medical LLMs Using Blockchain and Expert Feedback
यह शोध पत्र ChainTrust-LLM को प्रस्तुत करता है, जो एक नवीन ढांचा है जो मेडिकल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) का पता लगाने और उन्हें कम करने के लिए विशेषज्ञ फीडबैक को एक DAG-आधारित ब्लॉकचेन लेजर के साथ एकीकृत करता है, जिससे न्यूनतम विलंबता (latency) के साथ सुरक्षित, ऑडिट योग्य इंटरैक्शन सुनिश्चित करते हुए त्रुटि दरों में 64.8% की कमी आती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आप एक सुपर-स्मार्ट रोबोट लाइब्रेरियन से बात कर सकते हैं जिसने अब तक की लिखी गई हर मेडिकल टेक्स्टबुक पढ़ ली है। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है, बातचीत करने, सवालों के जवाब देने और यहाँ तक कि डॉक्टरों को मरीजों को चीजें समझाने में मदद करने में अद्भुत है। लेकिन यहाँ एक पेंच है: कभी-कभी, यह रोबोट बहुत अधिक आत्मविश्वासी हो जाता है और अपनी ओर से बातें बनाने लगता है। यह आपको बता सकता है कि एक निश्चित दवा उस बीमारी को ठीक करती है जिसे वह नहीं करती, या एक लक्षण का मतलब कुछ ऐसा है जो वह नहीं है। चिकित्सा की दुनिया में, इन मनगढ़ंत तथ्यों को "हैलुसिनेशन" (hallucinations) कहा जाता है, और ये खतरनाक हैं क्योंकि ये गलत निर्णय लेने की ओर ले जा सकते हैं।
इसे ठीक करने के लिए, वैज्ञानिक एक ऐसा सिस्टम बनाने की कोशिश कर रहे हैं जो एक सख्त संपादक (editor) की तरह काम करे। वे एक ऐसा तरीका चाहते हैं जिससे रोबोट के काम की जाँच की जा सके, हर सुधार का एक स्थायी रिकॉर्ड रखा जा सके, और यह सुनिश्चित किया जा सके कि रोबोट अपनी गलतियों से सीखे बिना उन्हें भूले नहीं। यहीं पर "ट्रस्ट" (विश्वास) का विचार आता है। यदि रोबोट एक सवाल का सही जवाब देता है, तो हम उस पर अधिक भरोसा करते हैं; यदि वह गलत होता है, तो हम उस पर कम भरोसा करते हैं। लेकिन इस भरोसे को ट्रैक करना और यह सुनिश्चित करना कि कोई गुप्त रूप से रिकॉर्ड को बदल न सके, एक बड़ी चुनौती है। इसीलिए शोधकर्ता मानव विशेषज्ञों को एक विशेष प्रकार के डिजिटल लेजर "ब्लॉकचेन" के साथ जोड़ने पर विचार कर रहे हैं, जो एक सार्वजनिक नोटबुक की तरह है जिसे एक बार लिखने के बाद कोई मिटा या बदल नहीं सकता।
यही बात "ChainTrust-LLM" के बारे में है। शोधकर्ताओं ने, मुहम्मद इस्माइल मोहम्मद और उनकी टीम के नेतृत्व में, मेडिकल हैलुसिनेशन की समस्या को हल करने का प्रयास किया, विशेष रूप से हाइपोथायरायडिज्म (थायराइड ग्रंथि की एक समस्या) नामक स्थिति के लिए। उन्होंने देखा कि जब रोबोट थकान, वजन बढ़ने या मासिक धर्म चक्र में समस्या जैसे लक्षणों के बारे में बात करते हैं, तो वे अक्सर विवरणों को गलत बताते हैं। इसे ठीक करने के लिए, उन्होंने एक नया फ्रेमवर्क बनाया जिसे ChainTrust-LLM कहा जाता है। इसे एक हाई-टेक सुरक्षा जाल (safety net) के रूप में समझें जो रोबोट की गलतियों और सुधारों को सुरक्षित रूप से लॉग करता है, जिससे भविष्य के प्रदर्शन को बेहतर बनाने के लिए एक ऑडिट योग्य ट्रेल (auditable trail) बनता है।
यह प्रणाली कैसे काम करती है, इसे एक सरल कहानी से समझते हैं: कल्पना कीजिए कि मेडिकल रोबोट एक परीक्षा दे रहा छात्र है। हर बार जब वह एक प्रश्न का उत्तर देता है, तो तीन वास्तविक जीवन के डॉक्टर (विशेषज्ञ) उस उत्तर की जाँच करते हैं। यदि छात्र सही है, तो वे थम्स-अप देते हैं; यदि वह गलत है, तो वे थम्स-डाउन देते हैं और सही उत्तर लिखते हैं। लेकिन इन नोट्स को कागज के ढेर में रखने के बजाय, ChainTrust-LLM हर एक ग्रेड और सुधार को "डिजिटल डायरी" में लिखता है जो ब्लॉकचेन का उपयोग करती है। यह डायरी अपरिवर्तनीय है, जिसका अर्थ है कि एक बार गलती दर्ज होने के बाद, वह प्रमाण के रूप में हमेशा के लिए वहीं रहती है।
इस प्रणाली में समय के बारे में एक विशेष नियम भी है। यदि रोबोट आज एक सवाल का सही जवाब देता है, तो उसका "ट्रस्ट स्कोर" बढ़ जाता है। लेकिन यदि लंबे समय तक इसकी जाँच नहीं की जाती है, तो उसका ट्रस्ट स्कोर धीरे-धीरे कम होता जाता है, जैसे बैटरी कम हो रही हो। यह सुनिश्चित करता है कि सिस्टम ताज़ा बना रहे और पुरानी, संभावित रूप से आउटडेटेड जानकारी पर निर्भर न रहे। जब रोबोट गलती करता है, तो सिस्टम सत्य से अंतर के आधार पर झूठ को पकड़ने के लिए एक "रिस्क डिटेक्टर" (जोखिम डिटेक्टर) का उपयोग करता है, और फिर पूरी घटना को सुरक्षित रूप से लॉग करता है।
टीम ने इस विचार का परीक्षण तीन प्रसिद्ध मेडिकल रोबोट्स पर किया: GPT-4, MedPaLM, और Claude। उन्होंने हाइपोथायरायडिज्म के लक्षणों, उपचारों और लैब टेस्ट के बारे में 300 अलग-अलग सवाल पूछे। ChainTrust-LLM का उपयोग करने से पहले, ये रोबोट अक्सर गलतियाँ कर रहे थे। उदाहरण के लिए, GPT-4 23.1% समय हैलुसिनेशन (मनगढ़ंत बातें बनाना) कर रहा था। इस नए सिस्टम को लागू करने के बाद, वह संख्या नाटकीय रूप से गिरकर 8.5% रह गई। यह लगभग 63% की कमी है। अन्य रोबोटों के लिए भी सुधार उतने ही बड़े थे, जिसमें गलती की दर 64.8% तक कम हो गई।
केवल रोबोटों ने गलतियाँ कम ही नहीं कीं, बल्कि सिस्टम यह जानने में भी बहुत बेहतर हो गया कि वह कब सही है और कब गलत। उनका "ट्रस्ट कैलिब्रेशन एक्यूरेसी" (जो मूल रूप से यह है कि रोबोट का आत्मविश्वास वास्तविकता से कितना मेल खाता है) GPT-4 के लिए लगभग 75% से बढ़कर 91% से अधिक हो गया। विशेषज्ञों ने भी उत्तरों की जाँच करते समय एक-दूसरे के साथ अधिक सहमति जताई, उनका एग्रीमेंट स्कोर 0.65 से बढ़कर 0.87 हो गया। इसका मतलब है कि सिस्टम केवल त्रुटियों को ठीक नहीं कर रहा था; यह सत्य की एक विश्वसनीय, साझा समझ भी बना रहा था।
इस शोध का एक सबसे शानदार हिस्सा यह है कि यह कितनी तेजी से काम करता है। अतिरिक्त जाँच और ब्लॉकचेन रिकॉर्डिंग होने के बावजूद, इस सिस्टम ने केवल एक मामूली देरी जोड़ी। औसतन, एक ट्रांजेक्शन को लॉग करने में केवल 211 मिलीसेकंड (एक चौथाई सेकंड से भी कम) का समय लगा। यह सुझाव देता है कि ऐसे सिस्टम का उपयोग अस्पतालों में बिना किसी देरी के वास्तव में किया जा सकता है।
पेपर यह निष्कर्ष निकालता है कि ChainTrust-LLM मेडिकल AI को सुरक्षित बनाने का एक मजबूत और सुरक्षित तरीका है। मानव विशेषज्ञों, समय-आधारित ट्रस्ट सिस्टम और अपरिवर्तनीय ब्लॉकचेन रिकॉर्ड को जोड़कर, उन्होंने एक ऐसा फ्रेमवर्क बनाया है जो चिकित्सा सलाह में खतरनाक झूठ को काफी हद तक कम करता है। हालांकि इस अध्ययन ने विशेष रूप से थकान और वजन बढ़ने जैसे हाइपोथायरायडिज्म के लक्षणों पर ध्यान केंद्रित किया, लेकिन यह पद्धति अन्य चिकित्सा क्षेत्रों में भी AI को भरोसेमंद बनाने के लिए एक मार्ग प्रशस्त करती है। यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत ठीक कर देती है, लेकिन यह हमारे डिजिटल मेडिकल सहायकों पर विश्वास करने वाले भविष्य की ओर एक बहुत ही आशाजनक कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।