ChatIBD: design, safeguards, and early international use of a guideline-grounded generative AI tool for inflammatory bowel disease (IBD) professionals
यह शोध पत्र ChatIBD के डिज़ाइन, परिचालन सुरक्षा उपायों और इसके प्रारंभिक अंतर्राष्ट्रीय परिनियोजन का वर्णन करता है, जो इंफ्लेमेटरी बाउल डिजीज (IBD) पेशेवरों के लिए एक रिट्रीवल-ऑगमेंटेड जेनरेटिव एआई टूल है, जिसने अपने पहले छह महीनों के दौरान इसकी व्यवहार्यता और वैश्विक स्वीकार्यता को प्रदर्शित किया है और साथ ही इसकी सटीकता एवं नैदानिक प्रभावशीलता के और अधिक औपचारिक सत्यापन की आवश्यकता पर भी बल दिया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक पुस्तकालय है जहाँ हर किताब अलग लेखक द्वारा लिखी गई है, और उनमें से कुछ लेखक तो अपनी मर्जी से चीजें गढ़ने के लिए कुख्यात हैं। यह सामान्य-उद्देश्य वाले आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया है। ये डिजिटल मस्तिष्क अविश्वसनीय रूप से स्मार्ट हैं और लगभग किसी भी विषय पर बात कर सकते हैं, लेकिन उनकी एक कठिन आदत है जिसे "हैलुसिनेशन" (hallucination) कहा जाता है। यह एक ऐसे छात्र की तरह है, जिसे जब इतिहास की किसी घटना के बारे में विशिष्ट प्रश्न पूछा जाता है, तो वह आत्मविश्वास के साथ एक ऐसी कहानी गढ़ देता है जो सुनने में वास्तविक लगती है लेकिन वास्तव में कभी हुई ही नहीं। चिकित्सा जगत में, जहाँ एक गलत तथ्य खतरनाक हो सकता है, यह एक बड़ी समस्या है। डॉक्टरों को ऐसे उत्तरों की आवश्यकता होती है जो न केवल चतुर हों, बल्कि पूरी तरह से सत्य और वास्तविक, विश्वसनीय स्रोतों पर आधारित हों।
इसे हल करने के लिए, वैज्ञानिक "विशेष पुस्तकालयाध्यक्ष" (specialized librarians) बना रहे हैं। AI को पूरे पुस्तकालय में भटकने देने के बजाय, वे उसे एक छोटे, क्यूरेटेड कमरे के भीतर बंद कर देते हैं जिसमें केवल सबसे विश्वसनीय चिकित्सा पाठ्यपुस्तकें और नियम पुस्तिकाएं होती हैं। इस तकनीक को 'रिट्रीवल-ऑगमेंटेड जनरेशन' (Retrieval-Augmented Generation - RAG) कहा जाता है। इसे ऐसे समझें जैसे AI को चश्मे का एक जोड़ा दिया गया हो जो उसे केवल स्वीकृत पुस्तकों के पन्नों को ही देखने की अनुमति देता है। जब आप कोई प्रश्न पूछते हैं, तो AI को उन विशिष्ट पन्नों के अंदर से उत्तर खोजना होता है और आपको ठीक से दिखाना होता है कि उसने वह उत्तर किस पृष्ठ से प्राप्त किया है। यदि उत्तर उन पुस्तकों में नहीं है, तो AI को कुछ भी मनगढ़ंत बनाने के बजाय यह कहने के लिए प्रोग्राम किया गया है कि, "मुझे नहीं पता।" यह शोध पत्र एक नए, विशेष पुस्तकालयाध्यक्ष के बारे में है जिसे विशेष रूप से उन डॉक्टरों के लिए डिज़ाइन किया गया है जो इन्फ्लेमेटरी बाउल डिजीज (IBD) का इलाज करते हैं, जो आंतों में दर्दनाक सूजन का कारण बनता है।
शोध पत्र: ChatIBD के पहले छह महीने
इस अध्ययन के पीछे के शोधकर्ता, डॉक्टरों की एक टीम जो ChatIBD नामक टूल के निर्माता भी हैं, यह देखना चाहते थे कि उनका नया AI पुस्तकालयाध्यक्ष वास्तविक दुनिया में कैसा प्रदर्शन करता है। उन्होंने इसे केवल लैब में टेस्ट नहीं किया; उन्होंने इसे छह महीने के लिए इंटरनेट पर खुला छोड़ दिया यह देखने के लिए कि डॉक्टर वास्तव में इसका उपयोग कैसे करते हैं।
सेटअप: एक सुरक्षित चैटबॉट
ChatIBD एक वेबसाइट है जहाँ डॉक्टर IBD के बारे में प्रश्न पूछ सकते हैं। लेकिन एक नियमित चैटबॉट के विपरीत जो अनुमान लगा सकता है, यह सख्त सुरक्षा नियमों के साथ बनाया गया है। यह एक "क्यूरेटेड कॉर्पस" (curated corpus) पर आधारित है, जो एक फैंसी तरीका है यह कहने का कि शीर्ष संगठनों के 32 से 35 आधिकारिक चिकित्सा दिशानिर्देशों का एक विशिष्ट संग्रह। जब कोई डॉक्टर प्रश्न पूछता है, तो सिस्टम केवल उत्तर के बारे में "सोचता" नहीं है; यह पहले उन विशिष्ट दिशानिर्देशों में से प्रासंगिक टेक्स्ट खोजने के लिए खोजबीन करता है। फिर यह टेक्स्ट का सारांश देने के लिए एक AI का उपयोग करता है और महत्वपूर्ण रूप से, इसे उस सटीक पृष्ठ का क्लिक करने योग्य लिंक प्रदान करना चाहिए जहाँ से उत्तर आया है।
इसे और अधिक सुरक्षित बनाने के लिए, सिस्टम में एक विशेष "डोजिंग कार्ड" (dosing card) फीचर है। यदि कोई डॉक्टर मरीज को कितनी दवा देनी है, इसके बारे में पूछता है, तो AI संख्या का अनुमान नहीं लगाता है। इसके बजाय, यह आधिकारिक यूरोपीय नियमों के आधार पर एक अलग, मैन्युअल रूप से जांचे गए डेटाबेस से खुराक निकालता है और उसे एक स्पष्ट कार्ड के रूप में प्रदर्शित करता है। AI को केवल यह पहचानने की अनुमति है कि किस दवा के बारे में पूछा जा रहा है; संख्याएँ स्वयं एक कठोर, अपरिवर्तनीय सूची से आती हैं।
प्रयोग: इसका उपयोग किसने और कैसे किया?
अध्ययन में 1 अक्टूबर, 2025 से अप्रैल 1, 2026 के बीच एकत्र किए गए डेटा को देखा गया। इस दौरान 913 लोगों ने टूल के लिए पंजीकरण किया। उनमें से 684 (लगभग 75%) ने वास्तव में कम से कम एक संदेश भेजा, और 349 (लगभग 38%) "सक्रिय उपयोगकर्ता" थे, जिसका अर्थ है कि उन्होंने तीन या अधिक संदेश भेजे।
टूल का उपयोग 69 विभिन्न देशों के डॉक्टरों द्वारा और 28 विभिन्न भाषाओं में किया गया। सबसे सक्रिय उपयोगकर्ता यूनाइटेड किंगडम और स्पेन से थे। दिलचस्प बात यह है कि टूल का उपयोग ज्यादातर कार्यदिवसों (85.1% समय) पर किया गया, जो बताता है कि डॉक्टर इसका उपयोग काम के दौरान त्वरित संदर्भ के रूप में कर रहे थे, न कि देर रात तक पढ़ाई करने वाले साथी के रूप में।
उन्होंने क्या पाया?
सबसे आम प्रश्न दवाओं के बारे में थे। लगभग आधे संदेश (46.6%) दवाओं के उपचार के बारे में थे। सिस्टम ने अपने विशेष "डोजिंग कार्ड" को 1,332 बार सफलतापूर्वक ट्रिगर किया, जो दर्शाता है कि डॉक्टर त्वरित, सुरक्षित खुराक की जाँच के लिए इस पर भरोसा कर रहे थे।
शोधकर्ताओं ने यह भी देखा कि डॉक्टर क्या करने की कोशिश कर रहे थे। सबसे आम लक्ष्य "गाइडलाइन सिंथेसिस" (guideline synthesis) था, जहाँ एक डॉक्टर AI से पूछता है कि किसी विशिष्ट विषय के बारे में नियम क्या कहते हैं। अन्य सामान्य अनुरोधों में परिभाषाएँ पूछना, सुरक्षा चेतावनियों की जाँच करना, या उपचार के क्रम को समझना शामिल था।
सुरक्षा जाँच: क्या यह चूक गया?
टीम ने टूल के प्रदर्शन पर कड़ी नज़र रखी। उन्होंने 16 बार ऐसे मामले दर्ज किए जब उपयोगकर्ताओं ने स्पष्ट प्रतिक्रिया (feedback) दी। उनमें से 15 सकारात्मक रेटिंग थे। हालाँकि, एक नकारात्मक रेटिंग मिली जिसने सुरक्षा समीक्षा को ट्रिगर किया। एक डॉक्टर ने 'रिसंकुज़ुमैब' (Risankizumab) नामक दवा के बारे में एक प्रतिक्रिया को फ्लैग किया। AI का वाक्य थोड़ा अस्पष्ट था और इसे गलत तरीके से यह समझने के लिए इस्तेमाल किया जा सकता था कि वह दवा कुछ रोगियों के लिए वास्तव में जितनी खराब है उससे अधिक खराब है। टीम ने इसकी समीक्षा की, महसूस किया कि वाक्यांश जोखिम भरा था, और सिस्टम को बदल दिया ताकि भविष्य में उस तरह की भ्रम की स्थिति को रोका जा सके।
इसका क्या अर्थ है (और क्या नहीं है)
अध्ययन यह दर्शाता है कि ChatIBD का अंतर्राष्ट्रीय स्तर पर उपयोग किया जा रहा है और उन डॉक्टरों द्वारा बार-बार उपयोग किया जा रहा है जिन्हें लगता है कि यह जटिल चिकित्सा नियमों को समझने में उपयोगी है। यह सुझाव देता है कि एक विशेष, दिशानिर्देश-आधारित AI पेशेवरों के लिए एक व्यावहारिक उपकरण हो सकता है।
हालाँकि, लेखक परिणामों को बहुत अधिक बढ़ा-चढ़ाकर बताने में बहुत सावधान हैं। वे स्पष्ट रूप से कहते हैं कि यह अध्ययन यह साबित नहीं करता है कि टूल चिकित्सकीय रूप से सटीक, सुरक्षित या मरीजों के इलाज के लिए प्रभावी है। उन्होंने यह नहीं मापा कि क्या मरीज बेहतर हुए या क्या डॉक्टरों ने कम गलतियाँ कीं; उन्होंने केवल यह मापा कि कितने लोगों ने टूल का उपयोग किया और उन्होंने इसका उपयोग कैसे किया। फ्लैग की गई एक त्रुटि इस बात की याद दिलाती है कि सख्त सुरक्षा उपायों के बावजूद, मानवीय समीक्षा अभी भी आवश्यक है।
संक्षेप में, ChatIBD ने अपने पहले वास्तविक दुनिया के परीक्षण को पास कर लिया है, यह दिखाते हुए कि यह मौजूद है, उपयोग किया जा रहा है, और जब इसकी ओर इशारा किया गया तो इसने अपनी गलतियों को पकड़ा। लेकिन शोधकर्ता इस बात पर जोर देते हैं कि यह तो बस शुरुआत है। टूल एक आशाजनक "विशेष पुस्तकालयाध्यक्ष" है, लेकिन इसे उच्च-जोखिम वाले रोगी देखभाल की दुनिया में पूरी तरह से भरोसेमंद साबित करने के लिए अभी और अधिक कठोर परीक्षण की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।