← नवीनतम पेपर
💬 NLP

Automatic Replication of LLM Mistakes in Medical Conversations

यह शोध पत्र MedMistake को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो सिम्युलेटेड मेडिकल बातचीत से LLM त्रुटियों को 3,390 सिंगल-शॉट QA पेयर्स के बेंचमार्क डेटासेट में निकालती और परिवर्तित करती है, जिसे चिकित्सा विशेषज्ञों द्वारा सत्यापित किया गया था और विशिष्ट चिकित्सा तर्क संबंधी गलतियों से बचने में 12 फ्रंटियर मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया गया था।

मूल लेखक: Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप डिजिटल डॉक्टरों की एक नई पीढ़ी को प्रशिक्षित कर रहे हैं। आप उन्हें आदर्श बनाना चाहते हैं, लेकिन अभी, वे बार-बार एक ही तरह की मूर्खतापूर्ण गलतियाँ कर रहे हैं। समस्या यह है कि इन गलतियों को ढूँढना घास के ढेर में सुई खोजने जैसा है, और वह घास का ढेर आग की लपटों में घिरा हुआ है। आमतौर पर, जब कोई डॉक्टर (या AI) बातचीत के दौरान कोई गलती करता है, तो वह त्रुटि एक लंबी चैट के बीच में कहीं खो जाती है। यह कहना कठिन हो जाता है कि, "हे, आप विशेष रूप से स्टेप 3 पर विफल रहे क्योंकि आप एलर्जी के बारे में पूछना भूल गए।"

यह शोध पत्र एक चतुर नया सिस्टम पेश करता है जिसे MedMistake कहा जाता है, जो इस समस्या को हल करने के लिए एक "गलती का जासूस" (Mistake Detective) के रूप में कार्य करता है। यह कैसे काम करता है, यहाँ इसके सरल चरण दिए गए हैं:

1. "नकली रोगी" सिमुलेशन (The "Fake Patient" Simulation)

सबसे पहले, शोधकर्ताओं ने एक विशाल सिमुलेशन तैयार किया। उनके पास एक AI है जो रोगी की भूमिका निभाता है और दूसरा AI जो डॉक्टर की भूमिका निभाता है। वे उन्हें स्वास्थ्य संबंधी समस्याओं के बारे में आपस में चैट करने देते हैं।

  • उपमा: इसे पायलटों के लिए फ्लाइट सिम्युलेटर की तरह समझें। "रोगी" AI एक टेस्ट पायलट है जो जानबूझकर (या स्वाभाविक रूप से) कठिन मौसम में विमान उड़ाता है, और "डॉक्टर" AI एक प्रशिक्षु पायलट है जो विमान को सुरक्षित लैंड कराने की कोशिश कर रहा है।

2. "सुपर-जज" पैनल (The "Super-Judge" Panel)

एक बार बातचीत समाप्त हो जाने के बाद, शोधकर्ता केवल अंतिम स्कोर नहीं देखते। वे चैट की समीक्षा करने के लिए दो अन्य सुपर-स्मार्ट AI (जो मेडिकल विशेषज्ञों के रूप में कार्य करते हैं) का एक पैनल बुलाते हैं।

  • उपमा: कल्पना कीजिए कि सख्त फिल्म समीक्षकों का एक पैनल एक मूवी सीन देख रहा है। वे केवल यह नहीं कहते कि "फिल्म खराब थी।" वे फिल्म को रोकते हैं और कहते, "मिनट 12 पर, अभिनेता रियरव्यू मिरर चेक करना भूल गया। यह एक महत्वपूर्ण सुरक्षा त्रुटि थी।"
  • ये जज बातचीत को 40 अलग-अलग प्रकार की गलतियों के लिए स्कैन करते हैं, जैसे कि ड्रग इंटरैक्शन (दवाओं के आपसी प्रभाव) की जांच करना भूल जाना या हार्ट अटैक के किसी रेड फ्लैग को मिस कर देना।

3. "अराजकता" को "फ्लैशकार्ड्स" में बदलना (Turning "Chaos" into "Flashcards")

यही असली जादू है। एक बार जब जज को कोई गलती मिल जाती है, तो सिस्टम उस विशिष्ट त्रुटि को लेता है और उसे एक एकल, छोटे प्रश्न में बदल देता है।

  • उपमा: कल्पना कीजिए कि मूल बातचीत 2 घंटे लंबी, भ्रमित करने वाली फिल्म थी। सिस्टम उस एक दृश्य को लेता है जहाँ नायक दरवाजा लॉक करना भूल गया था, उसे काट देता है, और उसे एक फ्लैशकार्ड में बदल देता है जो कहता है: "आप हृदय रोग के इतिहास वाले एक रोगी हैं। आपने अभी एक नई पेनकिलर ली है। जाने से पहले आपको एक चीज़ क्या चेक करनी चाहिए?"
  • यह एक जटिल, अव्यवस्थित बातचीत को एक सरल "क्विज़ प्रश्न" में बदल देता है जो ठीक उसी एक कौशल का परीक्षण करता है।

4. "तनाव परीक्षण" (The "Stress Test")

अब, शोधकर्ता इन हजारों फ्लैशकार्ड्स को दुनिया के सबसे बेहतरीन AI मॉडल्स (जैसे GPT-5, Claude, और Gemini) को दिखाते हैं ताकि यह देखा जा सके कि क्या वे सही उत्तर दे सकते हैं।

  • लक्ष्य: वे केवल यह नहीं देख रहे हैं कि AI स्मार्ट है या नहीं; वे यह देख रहे हैं कि क्या AI उन विशिष्ट जाल (traps) से बच सकता है जिनमें अन्य AI फंसे थे।
  • परिणाम: उन्होंने पाया कि दुनिया के सबसे स्मार्ट AI (जैसे GPT-5 और Gemini 2.5 Pro) भी इन विशिष्ट सुरक्षा प्रश्नों पर लगभग आधी बार विफल हो जाते हैं। यह ऐसा है जैसे यह पता चलना कि बेहतरीन रेस कार ड्राइवर भी एक ही विशिष्ट मोड़ पर दुर्घटनाग्रस्त हो जाते हैं।

यह क्यों महत्वपूर्ण है?

इससे पहले, यदि कोई AI गलती करता था, तो उसे दोबारा वह गलती न करने के लिए सिखाना कठिन था क्योंकि उसकी गलती एक लंबी बातचीत में दबी होती थी।

  • पुराना तरीका: "आपने पूरी बातचीत में बुरा प्रदर्शन किया।" (बहुत अस्पष्ट!)
  • MedMistake का तरीका: "आप ड्रग इंटरैक्शन के इस विशिष्ट प्रश्न में विफल रहे। यहाँ वह सटीक नियम है जिसे आपने तोड़ा। फिर से प्रयास करें।"

मुख्य निष्कर्ष (The Bottom Line)

शोधकर्ताओं ने 3,390 "ट्रैप क्वेश्चंस" (जाल वाले प्रश्नों) का एक विशाल पुस्तकालय बनाया है जो वास्तविक गलतियों पर आधारित हैं जो AI मॉडल करते हैं। उन्होंने यह सुनिश्चित करने के लिए 211 प्रश्नों की मानव डॉक्टरों द्वारा भी जांच करवाई कि वे वास्तविक, वैध चिकित्सा त्रुटियां हैं।

उन्होंने इस लाइब्रेरी को सार्वजनिक रूप से जारी किया है ताकि डेवलपर्स अपने AI मॉडल को सुरक्षित बनाने के लिए इसका उपयोग कर सकें। यह डिजिटल डॉक्टरों को एक स्टडी गाइड देने जैसा है जो विशेष रूप से उन्हें सबसे कठिन सुरक्षा परीक्षाओं को पास करने में मदद करने के लिए डिज़ाइन किया गया है, जिससे यह सुनिश्चित हो सके कि जब वे अंततः वास्तविक रोगियों से बात करें, तो वे उन महत्वपूर्ण विवरणों को मिस न करें जो जीवन बचा सकते हैं।

संक्षेप में: उन्होंने एक ऐसी मशीन बनाई है जो AI की गलतियों को ढूंढती है, उन्हें सरल क्विज़ में बदलती है, और इन क्विज़ का उपयोग अगली पीढ़ी के AI डॉक्टरों को अधिक सुरक्षित और सावधान बनाने के लिए करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →