← नवीनतम पेपर
📄 urology

Evaluation of Large Language Models for Post-Cystectomy Sexual Health Counseling in Women: A Pilot Study

इस पायलट अध्ययन ने सिस्टेक्टोमी के बाद यौन स्वास्थ्य परामर्श उत्पन्न करने के लिए तीन लार्ज लैंग्वेज मॉडल्स का मूल्यांकन किया, जिसमें पाया गया कि ChatGPT ने सबसे अधिक दिशानिर्देश-अनुरूप प्रतिक्रियाएं उत्पन्न कीं, जबकि सभी मॉडल्स ने अत्यधिक पठन जटिलता वाली सामग्री बनाई, जिसमें प्रॉम्प्ट संरचना द्वारा अनुपालन भारी रूप से प्रभावित हुआ।

मूल लेखक: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

प्रकाशित 2026-07-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास तीन अलग-अलग "डिजिटल लाइब्रेरियन" (ChatGPT, Gemini, और Perplexity) हैं और आप उनसे उन महिलाओं के लिए एक मार्गदर्शिका लिखने के लिए कहते हैं जो सिस्टेक्टोमी (cystectomy) नामक एक बड़ी मूत्राशय की सर्जरी कराने वाली हैं। विशेष रूप से, आप चाहते हैं कि वे समझाएं कि ऑपरेशन के बाद उनके यौन स्वास्थ्य और संबंधों पर क्या प्रभाव पड़ेगा।

यह अध्ययन इन लाइब्रेरियन के लिए एक रिपोर्ट कार्ड की तरह है। शोधकर्ता दो चीजें देखना चाहते थे:

  1. क्या उन्होंने नियम पुस्तिका का पालन किया? (क्या उन्होंने वह सभी महत्वपूर्ण सलाह शामिल की जो डॉक्टरों को देनी चाहिए?)
  2. क्या भाषा समझने में बहुत कठिन थी? (क्या उन्होंने एक प्रोफेसर की तरह लिखा या एक मिलनसार पड़ोसी की तरह?)

यहाँ उन्हें क्या मिला, जिसे सरल रूप में नीचे दिया गया है:

1. "नियम पुस्तिका" परीक्षण (गाइडलाइन एडहेरेंस)

शोधकर्ताओं ने लाइब्रेरियन को आधिकारिक चिकित्सा दिशानिर्देशों पर आधारित एक चेकलिस्ट दी। उन्होंने लाइब्रेरियन से सर्जरी के बाद के जीवन के बारे में छह अलग-अलग प्रश्न पूछे।

  • विजेता: ChatGPT सबसे अच्छा छात्र था। इसने नियम पुस्तिका का सबसे बारीकी से पालन किया, और लगभग 77% आवश्यक बिंदुओं को पूरा किया।
  • उपविजेता: Gemini और Perplexity का स्कोर बहुत कम रहा, जिन्होंने क्रमशः केवल लगभग 50% और 46% बिंदुओं को पूरा किया। वे बहुत सारी महत्वपूर्ण सलाह देने में चूक गए।
  • "सरल प्रश्न" वाली तरकीब: शोधकर्ताओं ने कुछ दिलचस्प देखा। जब उन्होंने लाइब्रेरियन से सरल, रोजमर्रा की भाषा में (जैसे एक मरीज पूछ सकता है) सवाल पूछा, तो जवाब बेहतर थे और वे नियमों का अधिक बार पालन कर रहे थे। जब उन्होंने जटिल, चिकित्सा शब्दावली (जार्गन) का उपयोग करके पूछा (जैसे एक डॉक्टर पूछ सकता है), तो लाइब्रेरियन वास्तव में नियमों का पालन करने में बदतर हो गए। ऐसा लगता है जैसे लाइब्रेरियन फैंसी शब्दों से भ्रमित हो गए और बुनियादी बातें भूल गए।

2. "पठन स्तर" परीक्षण (रीडेबिलिटी)

भले ही लाइब्रेरियन ने तथ्य सही लिखे हों, लेकिन इससे कोई फर्क नहीं पड़ता यदि मरीज उनके उत्तर को समझ ही न सके। शोधकर्ताओं ने यह जांचा कि पाठ को समझना कितना कठिन था।

  • समस्या: तीनों लाइब्रेरियन ने ऐसी भाषा लिखी जो बहुत कठिन थी। उन्होंने ऐसी भाषा लिखी जो कॉलेज स्नातकों या यहाँ तक कि उन्नत डिग्री वाले लोगों के लिए उपयुक्त थी।
  • वास्तविकता: अधिकांश लोग छठी कक्षा के स्तर पर पढ़ते हैं। यदि आप किसी ऐसे मरीज को 12वीं या 16वीं कक्षा के स्तर का पर्चा थमा देते हैं जो पहले से ही कैंसर सर्जरी को लेकर तनाव में है, तो शायद वे इसे बिल्कुल भी समझ नहीं पाएंगे।
  • तुलना: Perplexity ने सबसे कठिन, "स्नातक-स्तर" की गद्य शैली लिखी। Gemini थोड़ा आसान था लेकिन फिर भी बहुत जटिल था। ChatGPT सबसे आसानी से पढ़ने योग्य था, लेकिन वह भी औसत व्यक्ति के लिए बहुत कठिन था।

3. "एक बड़ा विचार" खोज

शोधकर्ताओं ने "कठिनाई" को मापने के विभिन्न तरीकों को देखने के लिए एक विशेष गणितीय उपकरण (जिसे प्रिंसिपल कंपोनेंट एनालिसिस कहा जाता है) का उपयोग किया। उन्होंने पाया कि कठिनाई के सभी अलग-अलग परीक्षण वास्तव में एक ही चीज़ को माप रहे थे। यह बिल्कुल वैसा ही है जैसे पांच अलग-अलग रूलर (पटरी) हों और वे सभी कहें कि मेज 6 फीट लंबी है; वे पांच अलग-अलग माप नहीं हैं, वे बस एक ही बात कहने के पांच तरीके हैं। इसने इस बात की पुष्टि की कि टेक्स्ट लगातार सभी पैमानों पर बहुत जटिल था।

निचोड़

इन AI टूल्स को बहुत जानकार लेकिन थोड़े अनाड़ी सहायकों के रूप में देखें।

  • ChatGPT महत्वपूर्ण नियमों को याद रखने के लिए सबसे विश्वसनीय सहायक है, लेकिन यहाँ तक कि यह भी ऐसी भाषा बोलता है जो एक मरीज के लिए आसानी से पचा लेना बहुत भारी (फैंसी) है।
  • Gemini और Perplexity नियमों के मामले में कम विश्वसनीय हैं और और भी अधिक जटिल भाषा बोलते हैं।
  • प्रॉम्प्ट मायने रखता है: यदि आप इन सहायकों से सरल, सामान्य अंग्रेजी में पूछते हैं, तो वे नियमों का पालन करने में साधारण शब्दों के मुकाबले बेहतर काम करते हैं।

सीख: हालांकि ये AI टूल्स मददगार हो सकते हैं, लेकिन वर्तमान में ये ऐसी जानकारी उत्पन्न करते हैं जो मरीजों के समझने के लिए बहुत जटिल है और इनमें महत्वपूर्ण चिकित्सा सलाह शामिल करने के मामले में बहुत अधिक अंतर होता है। वे डॉक्टर की बातचीत का स्थान लेने के लिए तैयार नहीं हैं, खासकर कैंसर सर्जरी के बाद यौन स्वास्थ्य जैसे संवेदनशील विषयों के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →