Evidence-processing errors and their correction in an LLM-assisted systematic review: a retrospective methodological case study
यह पूर्वव्यापी पद्धतिगत केस स्टडी इस बात की जांच करती है कि कैसे प्रलेखित साक्ष्य-प्रसंस्करण त्रुटियों ने एक एलएलएम-सहायता प्राप्त व्यवस्थित समीक्षा को प्रभावित किया, जो यह प्रदर्शित करता है कि एक ऑडिट योग्य वर्कफ़्लो ने त्रुटि का पता लगाने और सुधार को जारी किए गए आउटपुट से सफलतापूर्वक जोड़ा और भविष्य की समीक्षा टीमों के लिए परिचालन संबंधी नियम प्रदान किए।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पहेली को हल करने की कोशिश कर रहे हैं जहाँ टुकड़े हज़ारों अलग-अलग किताबों में बिखरे हुए हैं, और कुछ किताबें बिल्कुल एक ही समूह के लोगों का वर्णन करती हैं। यह एक व्यवस्थित समीक्षा (systematic review) की दैनिक वास्तविकता है, जो एक विशिष्ट चिकित्सा प्रश्न पर उपलब्ध सभी साक्ष्यों को एकत्र करने के लिए उपयोग की जाने वाली एक कठोर वैज्ञानिक पद्धति है। शोधकर्ता ऐसा किसी विशिष्ट चिकित्सा प्रश्न पर छिपे हुए वास्तविक उत्तर को खोजने के लिए करते हैं, लेकिन यह प्रक्रिया अविश्वसनीय रूप से नाजुक है। एक भी गलती—जैसे कि तारीख को गलत पढ़ना, अनजाने में एक ही रोगी को दो बार गिन लेना, या यह समझने में चूक कि परिणाम अच्छा है या बुरा—अंतिम निष्कर्ष को बदल सकती है। अब, इस जानकारी के पहाड़ को छाँटने में मदद करने के लिए कृत्रिम बुद्धिमत्ता (AI) को जोड़ने की कल्पना करें। हालांकि ये कंप्यूटर प्रोग्राम अविश्वसनीय गति से डेटा को पढ़ और व्यवस्थित कर सकते हैं, वे पूर्ण नहीं हैं। वे सूक्ष्म गलतियाँ कर सकते हैं जिन्हें पहचानना कठिन होता है, और यदि वे त्रुटियाँ निकल गईं, तो पूरा वैज्ञानिक निष्कर्ष गलत हो सकता है। आधुनिक विज्ञान के लिए महत्वपूर्ण प्रश्न केवल यह नहीं है कि क्या कंप्यूटर काम कर सकता है, बल्कि यह है कि हम उसकी गलतियों को कैसे पकड़ सकते हैं और अंतिम उत्तर को विश्वसनीय कैसे सुनिश्चित कर सकते हैं।
चीन के शोधकर्ताओं की एक टीम ने इस प्रश्न का उत्तर देने का निर्णय लिया और उन्होंने अपने ही हाल ही में पूरे किए गए एक वास्तविक प्रोजेक्ट को पीछे मुड़कर देखा। उन्होंने एक परिष्कृत प्रणाली का उपयोग किया था जिसमें बड़े भाषा मॉडल (large language models)—मानवीय भाषा को समझने में सक्षम उन्नत AI उपकरण—को सख्त मानवीय निरीक्षण के साथ जोड़ा गया था, ताकि इस बात की समीक्षा की जा सके कि सर्जरी से पहले के सामाजिक संबंध बाद में रिकवरी को कैसे प्रभावित करते हैं। केवल अपने अंतिम चिकित्सा निष्कर्षों को प्रस्तुत करने के बजाय, उन्होंने प्रक्रिया पर ही ध्यान केंद्रित किया। उन्होंने अपने स्वयं के पूर्ण प्रोजेक्ट को एक प्रयोगशाला के रूप में इस्तेमाल किया ताकि यह जांचा जा सके कि चीजें वास्तव में कहाँ गलत हुईं, त्रुटियों को कैसे पाया गया, और परिणामों को जनता के सामने जारी करने से पहले उन्हें कैसे ठीक किया गया। उनका लक्ष्य यह साबित करना नहीं था कि उनकी विशिष्ट समीक्षा पूर्ण थी, बल्कि त्रुटियों का एक पारदर्शी मानचित्र बनाना था जो घटित हुई थीं और उन सुरक्षा उपायों का विवरण देना था जिन्होंने विज्ञान को बर्बाद होने से रोका।
शोधकर्ताओं ने अपने प्रोजेक्ट के पूरे इतिहास की जांच की, प्रारंभिक अध्ययन की खोज से लेकर अंतिम प्रकाशन तक। उन्होंने पचास विशिष्ट मूल-कारण घटनाओं (root-cause events) की खोज की, जो गलतियों के होने के मौलिक कारण थे। ये केवल मामूली टाइपिंग की गलतियाँ नहीं थीं; इनमें से कुछ त्रुटियों ने समीक्षा के संयुक्त सांख्यिकीय परिणामों को पहले ही बदल दिया था, जिसे बाद में पकड़ा गया और सुधारा गया। उदाहरण के लिए, एक मामले में, सिस्टम ने उन रोगियों के डेटा को शामिल कर लिया था जो गलत समय पर अपने फॉलो-अप से शुरू हुए थे, जिससे जीवित रहने के आंकड़ों (survival statistics) में त्रुटि आई। दूसरे मामले में, AI यह समझने में विफल रहा कि दो अलग-अलग रिपोर्टें रोगियों के एक ही समूह का वर्णन करती हैं, जिससे उन रोगियों को दो बार गिना गया, जिसने उस साक्ष्य के भार को कृत्रिम रूप से बढ़ा दिया। टीम ने ऐसी त्रुटियां भी पाईं जहाँ कंप्यूटर ने परिणाम की दिशा को गलत समझा, यह मान लिया कि एक नकारात्मक परिणाम सकारात्मक था, या जहाँ उसने विश्लेषण के लिए गलत प्रकार के डेटा का चयन किया।
इस अध्ययन को जो बात विशेष रूप से मूल्यवान बनाती है, वह है कि टीम ने इन त्रुटियों को कैसे संभाला। उन्होंने केवल गलतियों को हटाया नहीं और यह दिखावा नहीं किया कि वे कभी हुई ही नहीं थीं। इसके बजाय, उन्होंने एक ऐसी प्रणाली बनाई जो एक विस्तृत ऑडिट ट्रेल (audit trail) की तरह कार्य करती थी। जब भी कोई गलती पाई गई, उन्होंने दर्ज किया कि वास्तव में क्या गलत हुआ, उसका परिणाम क्या था, और उसे कैसे ठीक किया गया। उन्होंने विफलता के चार विशिष्ट मार्गों का पता लगाया ताकि यह दिखाया जा सके कि स्रोत दस्तावेज़ को समझने में एक छोटी सी त्रुटि कैसे पूरे सिस्टम में फैल सकती है, जिससे यह बदल जाता है कि किन अध्ययनों को शामिल किया गया, उनका कितना भार था, और यहाँ तक कि परिणाम की अंतिम विश्वास रेटिंग भी बदल जाती है। उदाहरण के लिए, जब उन्हें एहसास हुआ कि अध्ययनों के बीच एक ओवरलैप छूट गया था, तो उन्होंने लिंक को ठीक किया, जिससे गणना में शामिल अध्ययनों की संख्या बदल गई और अंतिम ऑड्स रेशियो (odds ratio) में थोड़ा बदलाव आया। एक अन्य उदाहरण में, पूर्वाग्रह के जोखिम (risk of bias) के संबंध में सुधार ने साक्ष्य की गुणवत्ता के मूल्यांकन को बदल दिया, भले ही अंतिम ग्रेड सबसे निचले स्तर पर ही रहा।
शोधकर्ताओं ने पाया कि अधिकांश त्रुटियाँ स्वचालित जाँच और मानवीय समीक्षा के संयोजन द्वारा पकड़ी गईं। सिस्टम को इस तरह डिज़ाइन किया गया था कि यदि कोई नियम टूटता है—जैसे कि एक रोगी को दो बार गिनना या गलत समय सीमा का उपयोग करना—तो प्रक्रिया रुक जाएगी और समस्या को चिह्नित करेगी। इसके बाद मनुष्यों ने अंतिम निर्णय लेने के लिए हस्तक्षेप किया। अंत में, उन्होंने पचास में से छियालीस त्रुटियों को सुलझा लिया, जबकि चार को घोषित गैर-महत्वपूर्ण सीमाओं के रूप में स्वीकार किया गया जिन्होंने मुख्य निष्कर्षों को नहीं बदला। अंतिम समीक्षा में 445 अद्वितीय अध्ययनों का प्रतिनिधित्व करने वाली 454 रिपोर्ट शामिल थीं, और प्रक्रिया के दौरान हुई पचास त्रुटियों के बावजूद, टीम अंतिम वैज्ञानिक आउटपुट जारी करने से पहले सुधारे गए हिस्सों को ठीक करने में सक्षम रही। उन्होंने अपने कार्य को कोड के एक अलग सेट के साथ पूरी प्रक्रिया को फिर से चलाकर और दो स्वतंत्र समीक्षकों से एक ही स्रोत दस्तावेजों की जांच करवाकर सत्यापित किया, जिससे पुष्टि हुई कि अंतिम संख्याएँ सुसंगत थीं और फाइलें पूरी तरह से मेल खाती थीं।
यह कार्य यह दावा नहीं करता है कि कृत्रिम बुद्धिमत्ता मानव वैज्ञानिकों को बदलने के लिए तैयार है या ये उपकरण त्रुटिहीन हैं। वास्तव में, अध्ययन स्पष्ट रूप से दिखाता है कि एक स्पष्ट, ऑडिट योग्य प्रक्रिया के बिना केवल AI पर निर्भर रहने से गलत परिणाम प्राप्त होते। शोधकर्ता इस बात पर जोर देते हैं कि उनके निष्कर्ष इस एक विशिष्ट प्रोजेक्ट के लिए हैं और इनका उपयोग सभी AI प्रणालियों के लिए सामान्य त्रुटि दर की गणना करने के लिए नहीं किया जा सकता है। हालाँकि, वे नियमों और उदाहरणों का एक ठोस सेट प्रदान करते हैं जिसका उपयोग अन्य शोध टीमें अपने स्वयं के सुरक्षा जाल बनाने के लिए कर सकती हैं। त्रुटियाँ कैसे होती हैं और उन्हें उनके स्रोत तक कैसे ट्रैक किया जा सकता है, इसका सटीक दस्तावेजीकरण करके, टीम ने दिखाया है कि शक्तिशाली AI उपकरणों का उपयोग उच्च-दांव वाले विज्ञान (high-stakes science) में किया जा सकता है, बशर्ते कि गलतियों को पकड़ने, उन्हें ठीक करने और यह साबित करने के लिए एक कठोर प्रणाली मौजूद हो कि अंतिम उत्तर विश्वसनीय है। यह अध्ययन इस बात के लिए एक व्यावहारिक मार्गदर्शिका है कि भविष्य में विश्वास कैसे बनाया जाए जहाँ कंप्यूटर हमें दुनिया के चिकित्सा साहित्य को पढ़ने में मदद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।