Caught in the Web of Words: Do LLMs Fall for Spin in Medical Literature?
यह अध्ययन प्रकट करता है कि जबकि मूल्यांकित किए गए 22 लार्ज लैंग्वेज मॉडल्स (Large Language Models) आम तौर पर चिकित्सा साहित्य में मनुष्यों की तुलना में 'स्पिन' (पक्षपाती दृष्टिकोण) के प्रति अधिक संवेदनशील होते हैं और अपने सारांशों में इसे प्रसारित कर सकते हैं, उन्हें इस तरह के पूर्वाग्रह को पहचानने और कम करने के लिए प्रभावी ढंग से प्रॉम्प्ट किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डॉक्टर हैं जो यह तय करने की कोशिश कर रहे हैं कि अपने मरीज को कौन सी नई दवा देनी है। आपके पास उस 50 पन्नों के वैज्ञानिक अध्ययन को पूरा पढ़ने का समय नहीं है, इसलिए आप एब्स्ट्रैक्ट (शुरुआत में दिया गया संक्षिप्त सारांश) पढ़ते हैं।
अब, कल्पना कीजिए कि उस अध्ययन के लेखक सेल्सपर्सन (विक्रेता) की तरह हैं। यदि उनकी नई दवा पूरी तरह से काम नहीं करती है, तो वे कहानी को "स्पिन" (मोड़ने) की कोशिश कर सकते हैं। वे कह सकते हैं, "देखो! आंकड़े सफलता की ओर एक रुझान दिखा रहे हैं!" भले ही गणित वास्तव में यह कह रहा हो कि "हमारे पास इस बात का कोई प्रमाण नहीं है कि यह काम करता है।" इसे स्पिन (Spin) कहा जाता है। यह एक जादूगर की तरह है जो आपका ध्यान इस बात से भटका देता है कि टोपी के अंदर खरगोश वास्तव में मौजूद नहीं है।
द दशकोंों से, हम जानते हैं कि इंसान (डॉक्टर) कभी-कभी इस चाल में फंस जाते हैं, लेकिन आमतौर पर, यदि वे बारीकी से देखते हैं तो वे इसे पकड़ने में काफी अच्छे होते हैं।
लेकिन यहाँ एक नया मोड़ है: हम अब इन अध्ययनों को हमारे लिए पढ़ने, उनका सारांश बनाने और उनका अर्थ समझाने के लिए AI (लार्ज लैंग्वेज मॉडल्स या LLMs) का उपयोग करने लगे हैं। यह शोध पत्र मुख्य प्रश्न पूछता है: क्या AI डॉक्टर से अधिक स्मार्ट है, या यह सेल्स पिच (बिक्री के दावों) के लिए एक और भी बड़ा शिकार है?
प्रयोग: "स्पिन" टेस्ट
शोधकर्ताओं ने कैंसर के बारे में 60 मेडिकल अध्ययन लिए। आधे अध्ययनों में "स्पन" (बिक्री के दावे वाला) एब्स्ट्रैक्ट था (सेल्स पिच वाला संस्करण), और अन्य आधे "न्यूट्रल" (तटस्थ) एब्स्ट्रैक्ट थे (ईमानदार, उबाऊ संस्करण)। दोनों संस्करणों में वास्तविक डेटा समान था; केवल शब्द बदले गए थे।
उन्होंने इन एब्स्ट्रैक्ट्स को 22 अलग-अलग AI मॉडल्स (प्रसिद्ध GPT-4, Claude और Llama सहित) को दिया और उनसे तीन चीजें पूछीं:
- क्या आप झूठ पकड़ सकते हैं? (स्पिन को पहचानें)।
- आप इस उपचार के बारे में क्या सोचते हैं? (परिणामों की व्याख्या करें)।
- क्या आप इसे पांचवीं कक्षा के बच्चे को समझा सकते हैं? (टेक्स्ट को सरल बनाएं)।
परिणाम: AI जाल में फंस गया
यहाँ क्या हुआ, इसे उपमाओं (analogies) के माध्यम से समझाया गया है:
1. AI एक "डिटेक्टिव" है जो झूठ बोलने में बुरा है
जब पूछा गया, "क्या यह एब्स्ट्रैक्ट सच्चाई को घुमा रहा है?" तो AI मॉडल वास्तव में काफी अच्छे थे। वे लगभग 67% समय स्पिन को पहचान सकते थे। यह एक रैंडम अनुमान से बेहतर है, लेकिन पूर्ण नहीं है। यह एक ऐसे जासूस की तरह है जो यह तो बता सकता है कि कोई पसीना छोड़ रहा है, लेकिन यह नहीं बता सकता कि वह कहाँ था, इस बारे में झूठ बोल रहा है या नहीं।
2. AI एक "फैन" है जो हाइप (चमक-धमक) पर विश्वास करता है
यही डरावना हिस्सा है। भले ही AI जानता था (या उसे बताया गया था) कि एब्स्ट्रैक्ट को घुमाया गया है, फिर भी उसने हाइप पर विश्वास किया।
- मानवीय प्रतिक्रिया: जब एक मानव डॉक्टर स्पन एब्स्ट्रैक्ट पढ़ता है, तो वह सोच सकता है, "हम्म, वे बढ़ा-चढ़ाकर बता रहे हैं, लेकिन डेटा कमजोर है।" वे उपचार को बिना कुछ किए से केवल थोड़ा बेहतर मानते हैं।
- AI की प्रतिक्रिया: AI ने उसी स्पन एब्स्ट्रैक्ट को देखा और सोचा, "वाह! यह अद्भुत है! यह उपचार एक चमत्कार है!"
- उपमा: कल्पना कीजिए कि एक कार सेल्समैन कहता है, "यह कार 50 मील प्रति गैलन का माइलेज देती है!" (जबकि वास्तव में यह 20 देती है)।
- एक मानव मैकेनिक कहता है, "यह झूठ है। यह एक खराब कार है।"
- AI कहता है, "50 MPG? यह तो अविश्वसनीय है! मैं ऐसी दस कारें खरीदना चाहता हूँ!"
- निष्कर्ष: AI, मानव विशेषज्ञों की तुलना में, स्पिन के प्रति कहीं अधिक संवेदनशील था। इसने नकली "चमत्कारी" इलाजों के लाभों को मनुष्यों की तुलना में बहुत अधिक बढ़ा-चढ़ाकर बताया।
3. AI एक "गॉसिप" (गपशप करने वाला) है जो अफवाह फैलाता है
शोधकर्ताओं ने फिर AI को इन स्पन एब्स्ट्रैक्ट्स को "साधारण अंग्रेजी" में फिर से लिखने के लिए कहा ताकि इसे पांचवीं कक्षा के बच्चे को समझाया जा सके।
- परिणाम: AI ने केवल शब्दों का अनुवाद नहीं किया; इसने स्पिन को और बढ़ा दिया।
- उपमा: कल्पना कीजिए कि आप एक बच्चे को एक कहानी सुनाते हैं जहाँ एक ड्रैगन "थोड़ा डरावना" है। यदि आप एक इंसान से इसे सरल रूप में फिर से बताने के लिए कहते हैं, तो वह कहता है, "ड्रैगन थोड़ा डरावना था।" यदि आप AI से पूछते हैं, तो वह कह सकता है, "ड्रैगन एक भयानक राक्षस था जो आग उगल रहा था!"
- AI ने मूल टेक्स्ट में सूक्ष्म अतिशयोक्ति को लिया और उसे और भी नाटकीय बना दिया। यह खतरनाक है क्योंकि यदि कोई मरीज AI के सारांश को पढ़ता है, तो उसे लग सकता है कि एक कमजोर उपचार एक रामबाण इलाज है।
अच्छी खबर: हम AI को "ट्रेन" कर सकते हैं
यह शोध पत्र केवल निराशाजनक नोट पर समाप्त नहीं होता है। शोधकर्ताओं ने पाया कि प्रॉम्प्ट इंजीनियरिंग (जो बस AI को बेहतर निर्देश देने का एक शानदार तरीका है) का उपयोग करके AI की इस भोलेपन को ठीक किया जा सकता है।
- पुराना तरीका: "इस एब्स्ट्रैक्ट को पढ़ें और बताएं कि क्या दवा काम करती है।" -> AI धोखा खा जाता है।
- नया तरीका: "इस एब्स्ट्रैक्ट को पढ़ें। पहले, मुझे बताएं कि क्या लेखक सच्चाई को घुमा रहा है। फिर, उसके आधार पर, मुझे बताएं कि क्या दवा काम करती है।"
- परिणाम: जब AI को "कदम-दर-कदम सोचने" और अपनी राय देने से पहले स्पिन को स्वीकार करने के लिए मजबूर किया गया, तो वह बहुत अधिक संदेही हो गया। इसने लाभों को बढ़ा-चढ़ाकर बताना बंद कर दिया।
निष्कर्ष
लार्ज लैंग्वेज मॉडल्स शक्तिशाली उपकरण हैं, लेकिन वर्तमान में वे मेडिकल हाइप (चिकित्सा प्रचार) के मामले में बहुत भोले हैं।
यदि हम चिकित्सा अनुसंधान का सारांश बनाने के लिए AI को बिना जांचे छोड़ देते हैं, तो यह अनजाने में डॉक्टरों और मरीजों को यह विश्वास दिला सकता है कि अप्रभावी उपचार चमत्कार हैं। हालांकि, यदि हम AI को अपना काम "चेक करना" और पहले स्पिन को ढूंढना सिखाते हैं, तो हम इसे स्वास्थ्य सेवा में एक अधिक विश्वसनीय साथी बना सकते हैं।
संक्षेप में: AI शब्दों को पढ़ने के लिए पर्याप्त स्मार्ट है, लेकिन इसे यह सिखाने के लिए एक इंसान (या बहुत विशिष्ट निर्देशों) की आवश्यकता है कि वह सेल्स पिच पर विश्वास न करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।