← नवीनतम पेपर
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

यह अध्ययन प्रदर्शित करता है कि एक्सटेंडेड-रीजनिंग इन्फरेंस (extended-reasoning inference) का उपयोग करने से स्टैंडर्ड मोड की तुलना में ऑर्थोपेडिक इन-ट्रेनिंग एग्जामिनेशन के प्रश्नों पर GPT-5 की सटीकता में महत्वपूर्ण सुधार होता है, हालांकि आश्वस्त त्रुटियों (confident errors) की निरंतरता यह सुझाव देती है कि इन मॉडलों को रेजिडेंट्स के लिए प्राथमिक अध्ययन संसाधनों के बजाय पर्यवेक्षित सहायक (supervised adjuncts) के रूप में उपयोग किया जाना चाहिए।

मूल लेखक: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

प्रकाशित 2026-09-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर साल, संयुक्त राज्य अमेरिका में हजारों ऑर्थोपेडिक सर्जरी रेजिडेंट्स हड्डियों, जोड़ों और मांसपेशियों के अपने ज्ञान को मापने के लिए एक कठिन परीक्षा देते हैं। यह परीक्षा, जिसे ऑर्थोपेडिक इन-ट्रेनिंग एग्जामिनेशन के रूप में जाना जाता है, उनके प्रशिक्षण में एक महत्वपूर्ण पड़ाव है, जो प्रोग्राम निदेशकों को यह निर्णय लेने में मदद करती है कि क्या कोई प्रशिक्षु बोर्ड-प्रमाणित सर्जन बनने के लिए तैयार है। हाल के वर्षों में, ये छात्र अध्ययन करने में मदद के लिए आर्टिफिशियल इंटेलिजेंस टूल्स की ओर तेजी से मुड़े हैं। ये उपकरण, जिन्हें लार्ज लैंग्वेज मॉडल्स कहा जाता है, विशाल मात्रा में टेक्स्ट पर प्रशिक्षित कंप्यूटर प्रोग्राम हैं जो प्रश्नों के उत्तर दे सकते हैं, जटिल विचारों की व्याख्या कर सकते हैं, और यहाँ तक कि एक मेडिकल टेक्स्टबुक की शैली की नकल भी कर सकते हैं। वे इतने सक्षम हो गए हैं कि वे अक्सर स्वयं चिकित्सा परीक्षाओं को पास कर सकते हैं। हालाँकि, एक महत्वपूर्ण प्रश्न अनसुलझा रह गया था: क्या छात्र जिस तरह से कंप्यूटर को सोचने के लिए कहता है, वह उत्तर की गुणवत्ता को बदल देता है? विशेष रूप से, क्या कंप्यूटर को बोलने से पहले एक समस्या को चरण-दर-चरण तर्क के साथ समझने के लिए रुकने के लिए मजबूर करना, तुरंत उत्तर देने के लिए कहने की तुलना में बेहतर परिणाम देता है?

शोधकर्ताओं की एक टीम ने 2024 की ऑर्थोपेडिक परीक्षा के वास्तविक प्रश्नों का उपयोग करके एक एकल, उन्नत आर्टिफिशियल इंटेलिजेंस मॉडल को परीक्षणों के माध्यम से गुजारकर इसका उत्तर खोजने का प्रयास किया। उन्होंने अलग-अलग ब्रांड के कंप्यूटर प्रोग्रामों की आपस में तुलना नहीं की। इसके बजाय, उन्होंने प्रत्येक प्रश्न के लिए एक ही प्रोग्राम का दो बार उपयोग किया। पहले, उन्होंने मॉडल को अपने मानक मोड में उत्तर देने के लिए कहा, जहाँ वह तेजी से प्रतिक्रिया उत्पन्न करता है। फिर, उन्होंने बिल्कुल उसी मॉडल से बिल्कुल वही प्रश्न पूछा, लेकिन इस बार उन्होंने इसे "विस्तारित तर्क" (एक्सटेंडेड रीजनिंग) मोड में बदल दिया। इस दूसरे सेटिंग में, कंप्यूटर को आंतरिक रूप से समस्या को तोड़ने, साक्ष्य को तौलने और अंतिम उत्तर टाइप करने से पहले तर्क को समझने के लिए अधिक समय बिताने का निर्देश दिया जाता है। शोधकर्ता यह देखना चाहते थे कि क्या यह अतिरिक्त मानसिक प्रयास, जिसमें प्रति प्रश्न लगभग एक मिनट अधिक लगता है, वास्तव में कंप्यूटर को स्मार्ट बना देगा।

परिणाम चौंकाने वाले थे। जब मॉडल ने मानक, त्वरित मोड में उत्तर दिया, तो उसने 7 प्रकार के 79 प्रतिशत प्रश्नों को सही बताया। यह स्कोर पहले से ही प्रभावशाली था, जो कंप्यूटर के प्रदर्शन को पांच साल के प्रशिक्षण वाले एक सीनियर रेजिडेंट के लगभग बराबर रखता था। लेकिन जब शोधकर्ताओं ने मॉडल को विस्तारित तर्क मोड में बदला, तो सटीकता उछलकर 93 प्रतिशत हो गई। यह ऐसा मामला नहीं था कि कंप्यूटर कुछ प्रश्नों पर भाग्यशाली रहा और कुछ पर अभागा। डेटा ने एक स्पष्ट पैटर्न दिखाया: प्रत्येक प्रश्न जिसे कंप्यूटर ने फास्ट मोड में सही बताया था, उसे उसने स्लो मोड में भी सही बताया। सुधार पूरी तरह से उन प्रश्नों से आया जिन्हें उसने पहले गलत बताया था; विस्तारित मोड में, इसने अपनी लगभग सभी गलतियों को सुधारा। शोधकर्ताओं ने पाया कि प्रदर्शन में यह उछाल ऑर्थोपेडिक सर्जरी के लगभग हर क्षेत्र में हुआ, जिसमें हाथ की चोटों से लेकर रीढ़ की स्थिति तक शामिल थी, और इससे कोई फर्क नहीं पड़ा कि प्रश्न में एक्स-रे की तस्वीर शामिल थी या केवल टेक्स्ट था।

इस नाटकीय सुधार के बावजूद, अध्ययन ने इन उपकरणों का उपयोग करने वाले किसी भी व्यक्ति के लिए एक सूक्ष्म लेकिन महत्वपूर्ण चेतावनी उजागर की। भले ही कंप्यूटर गलत था, लेकिन वह उतना ही आत्मविश्वासी लगा जितना कि वह सही होने पर होता है। उन कुछ मामलों में जहाँ मॉडल ने गहराई से सोचने के बाद भी गलत उत्तर दिया, वह हिचकिचाया नहीं या संदेह व्यक्त नहीं किया। वह एक विस्तृत विवरण प्रदान करेगा और यहाँ तक कि अपने गलत विकल्प का समर्थन करने के लिए चिकित्सा साहित्य का हवाला भी देगा, जिससे उसकी गलती आधिकारिक लगने लगेगी। शोधकर्ताओं ने नोट किया कि यदि छात्र को पहले से सही उत्तर नहीं पता है, तो वे इस झूठे आत्मविश्वास से आसानी से गुमराह हो सकते हैं। कंप्यूटर को भी धोखा दिया जा सकता है; यदि कोई उपयोगकर्ता गलत विचार सुझाता है, तो मॉडल अक्सर उसे स्वीकार कर लेता है और उस गलती के इर्द-गिर्द एक आत्मविश्वासी, विस्तृत स्पष्टीकरण बना लेता है।

अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये आर्टिफिशियल इंटेलिजेंस उपकरण शक्तिशाली हैं, लेकिन वे मानव शिक्षकों या सत्यापित अध्ययन सामग्री के पूर्ण विकल्प नहीं हैं। शोधकर्ता सुझाव देते हैं कि इन टूल्स का उपयोग करने वाले छात्रों के लिए, सबसे अच्छा दृष्टिकोण हमेशा विस्तारित तर्क सेटिंग का उपयोग करना है, क्योंकि सोचने का अतिरिक्त एक मिनट का समय सही उत्तर की संभावना को काफी बढ़ा देता है। हालाँकि, आउटपुट को हमेशा एक ड्राफ्ट के रूप में माना जाना चाहिए जिसे सत्यापन की आवश्यकता है। कंप्यूटर अध्ययन योजनाओं को व्यवस्थित करने या अवधारणाओं को सारांशित करने के लिए एक उपयोगी सहायक है, लेकिन यह अभी तक अपनी सटीकता का निर्णय करने के लिए भरोसेमंद नहीं हो सकता है। निष्कर्ष बताते हैं कि हम इन मशीनों के साथ कैसे बातचीत करते हैं, यह मशीनों के समान ही महत्वपूर्ण है; एक साधारण सेटिंग स्विच एक अच्छे उत्तर को एक महान उत्तर में बदल सकता है, लेकिन यह मानवीय निरीक्षण की आवश्यकता को समाप्त नहीं कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →