Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison
यह अध्ययन प्रदर्शित करता है कि एक्सटेंडेड-रीजनिंग इन्फरेंस (extended-reasoning inference) का उपयोग करने से स्टैंडर्ड मोड की तुलना में ऑर्थोपेडिक इन-ट्रेनिंग एग्जामिनेशन के प्रश्नों पर GPT-5 की सटीकता में महत्वपूर्ण सुधार होता है, हालांकि आश्वस्त त्रुटियों (confident errors) की निरंतरता यह सुझाव देती है कि इन मॉडलों को रेजिडेंट्स के लिए प्राथमिक अध्ययन संसाधनों के बजाय पर्यवेक्षित सहायक (supervised adjuncts) के रूप में उपयोग किया जाना चाहिए।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
हर साल, संयुक्त राज्य अमेरिका में हजारों ऑर्थोपेडिक सर्जरी रेजिडेंट्स हड्डियों, जोड़ों और मांसपेशियों के अपने ज्ञान को मापने के लिए एक कठिन परीक्षा देते हैं। यह परीक्षा, जिसे ऑर्थोपेडिक इन-ट्रेनिंग एग्जामिनेशन के रूप में जाना जाता है, उनके प्रशिक्षण में एक महत्वपूर्ण पड़ाव है, जो प्रोग्राम निदेशकों को यह निर्णय लेने में मदद करती है कि क्या कोई प्रशिक्षु बोर्ड-प्रमाणित सर्जन बनने के लिए तैयार है। हाल के वर्षों में, ये छात्र अध्ययन करने में मदद के लिए आर्टिफिशियल इंटेलिजेंस टूल्स की ओर तेजी से मुड़े हैं। ये उपकरण, जिन्हें लार्ज लैंग्वेज मॉडल्स कहा जाता है, विशाल मात्रा में टेक्स्ट पर प्रशिक्षित कंप्यूटर प्रोग्राम हैं जो प्रश्नों के उत्तर दे सकते हैं, जटिल विचारों की व्याख्या कर सकते हैं, और यहाँ तक कि एक मेडिकल टेक्स्टबुक की शैली की नकल भी कर सकते हैं। वे इतने सक्षम हो गए हैं कि वे अक्सर स्वयं चिकित्सा परीक्षाओं को पास कर सकते हैं। हालाँकि, एक महत्वपूर्ण प्रश्न अनसुलझा रह गया था: क्या छात्र जिस तरह से कंप्यूटर को सोचने के लिए कहता है, वह उत्तर की गुणवत्ता को बदल देता है? विशेष रूप से, क्या कंप्यूटर को बोलने से पहले एक समस्या को चरण-दर-चरण तर्क के साथ समझने के लिए रुकने के लिए मजबूर करना, तुरंत उत्तर देने के लिए कहने की तुलना में बेहतर परिणाम देता है?
शोधकर्ताओं की एक टीम ने 2024 की ऑर्थोपेडिक परीक्षा के वास्तविक प्रश्नों का उपयोग करके एक एकल, उन्नत आर्टिफिशियल इंटेलिजेंस मॉडल को परीक्षणों के माध्यम से गुजारकर इसका उत्तर खोजने का प्रयास किया। उन्होंने अलग-अलग ब्रांड के कंप्यूटर प्रोग्रामों की आपस में तुलना नहीं की। इसके बजाय, उन्होंने प्रत्येक प्रश्न के लिए एक ही प्रोग्राम का दो बार उपयोग किया। पहले, उन्होंने मॉडल को अपने मानक मोड में उत्तर देने के लिए कहा, जहाँ वह तेजी से प्रतिक्रिया उत्पन्न करता है। फिर, उन्होंने बिल्कुल उसी मॉडल से बिल्कुल वही प्रश्न पूछा, लेकिन इस बार उन्होंने इसे "विस्तारित तर्क" (एक्सटेंडेड रीजनिंग) मोड में बदल दिया। इस दूसरे सेटिंग में, कंप्यूटर को आंतरिक रूप से समस्या को तोड़ने, साक्ष्य को तौलने और अंतिम उत्तर टाइप करने से पहले तर्क को समझने के लिए अधिक समय बिताने का निर्देश दिया जाता है। शोधकर्ता यह देखना चाहते थे कि क्या यह अतिरिक्त मानसिक प्रयास, जिसमें प्रति प्रश्न लगभग एक मिनट अधिक लगता है, वास्तव में कंप्यूटर को स्मार्ट बना देगा।
परिणाम चौंकाने वाले थे। जब मॉडल ने मानक, त्वरित मोड में उत्तर दिया, तो उसने 7 प्रकार के 79 प्रतिशत प्रश्नों को सही बताया। यह स्कोर पहले से ही प्रभावशाली था, जो कंप्यूटर के प्रदर्शन को पांच साल के प्रशिक्षण वाले एक सीनियर रेजिडेंट के लगभग बराबर रखता था। लेकिन जब शोधकर्ताओं ने मॉडल को विस्तारित तर्क मोड में बदला, तो सटीकता उछलकर 93 प्रतिशत हो गई। यह ऐसा मामला नहीं था कि कंप्यूटर कुछ प्रश्नों पर भाग्यशाली रहा और कुछ पर अभागा। डेटा ने एक स्पष्ट पैटर्न दिखाया: प्रत्येक प्रश्न जिसे कंप्यूटर ने फास्ट मोड में सही बताया था, उसे उसने स्लो मोड में भी सही बताया। सुधार पूरी तरह से उन प्रश्नों से आया जिन्हें उसने पहले गलत बताया था; विस्तारित मोड में, इसने अपनी लगभग सभी गलतियों को सुधारा। शोधकर्ताओं ने पाया कि प्रदर्शन में यह उछाल ऑर्थोपेडिक सर्जरी के लगभग हर क्षेत्र में हुआ, जिसमें हाथ की चोटों से लेकर रीढ़ की स्थिति तक शामिल थी, और इससे कोई फर्क नहीं पड़ा कि प्रश्न में एक्स-रे की तस्वीर शामिल थी या केवल टेक्स्ट था।
इस नाटकीय सुधार के बावजूद, अध्ययन ने इन उपकरणों का उपयोग करने वाले किसी भी व्यक्ति के लिए एक सूक्ष्म लेकिन महत्वपूर्ण चेतावनी उजागर की। भले ही कंप्यूटर गलत था, लेकिन वह उतना ही आत्मविश्वासी लगा जितना कि वह सही होने पर होता है। उन कुछ मामलों में जहाँ मॉडल ने गहराई से सोचने के बाद भी गलत उत्तर दिया, वह हिचकिचाया नहीं या संदेह व्यक्त नहीं किया। वह एक विस्तृत विवरण प्रदान करेगा और यहाँ तक कि अपने गलत विकल्प का समर्थन करने के लिए चिकित्सा साहित्य का हवाला भी देगा, जिससे उसकी गलती आधिकारिक लगने लगेगी। शोधकर्ताओं ने नोट किया कि यदि छात्र को पहले से सही उत्तर नहीं पता है, तो वे इस झूठे आत्मविश्वास से आसानी से गुमराह हो सकते हैं। कंप्यूटर को भी धोखा दिया जा सकता है; यदि कोई उपयोगकर्ता गलत विचार सुझाता है, तो मॉडल अक्सर उसे स्वीकार कर लेता है और उस गलती के इर्द-गिर्द एक आत्मविश्वासी, विस्तृत स्पष्टीकरण बना लेता है।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये आर्टिफिशियल इंटेलिजेंस उपकरण शक्तिशाली हैं, लेकिन वे मानव शिक्षकों या सत्यापित अध्ययन सामग्री के पूर्ण विकल्प नहीं हैं। शोधकर्ता सुझाव देते हैं कि इन टूल्स का उपयोग करने वाले छात्रों के लिए, सबसे अच्छा दृष्टिकोण हमेशा विस्तारित तर्क सेटिंग का उपयोग करना है, क्योंकि सोचने का अतिरिक्त एक मिनट का समय सही उत्तर की संभावना को काफी बढ़ा देता है। हालाँकि, आउटपुट को हमेशा एक ड्राफ्ट के रूप में माना जाना चाहिए जिसे सत्यापन की आवश्यकता है। कंप्यूटर अध्ययन योजनाओं को व्यवस्थित करने या अवधारणाओं को सारांशित करने के लिए एक उपयोगी सहायक है, लेकिन यह अभी तक अपनी सटीकता का निर्णय करने के लिए भरोसेमंद नहीं हो सकता है। निष्कर्ष बताते हैं कि हम इन मशीनों के साथ कैसे बातचीत करते हैं, यह मशीनों के समान ही महत्वपूर्ण है; एक साधारण सेटिंग स्विच एक अच्छे उत्तर को एक महान उत्तर में बदल सकता है, लेकिन यह मानवीय निरीक्षण की आवश्यकता को समाप्त नहीं कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।