Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison
تُظهر هذه الدراسة أن استخدام الاستدلال القائم على التفكير الممتد يحسن بشكل كبير من دقة نموذج GPT-5 في أسئلة امتحان التدريب لطب العظام مقارنة بالوضع القياسي، غير أن استمرار الأخطاء الواثقة يشير إلى ضرورة استخدام هذه النماذج كأدوات مساعدة خاضعة للإشراف بدلاً من كونها موارد دراسية أساسية للمقيمين.
المؤلفون الأصليون:Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo
في كل عام، يخضع آلاف من مقيمي جراحة العظام في الولايات المتحدة لامتحان صارم لقياس معرفتهم بالعظام والمفاصل والعضلات. هذا الاختبار، المعروف باسم "امتحان التدريب الداخلي لجراحة العظام"، يعد نقطة تفتيش حاسمة في تدريبهم، حيث يساعد مديري البرامج في تحديد ما إذا كان المتدرب مستعداً ليصبح جراحاً معتمداً من قبل البورد. وفي السنوات الأخيرة، اتجه هؤلاء الطلاب بشكل متزايد إلى أدوات الذكاء الاصطناعي للمساعدة في دراستهم. هذه الأدوات، التي تسمى نماذج اللغات الكبيرة، هي برامج حاسوبية مدربة على كميات هائلة من النصوص يمكنها الإجابة على الأسئلة، وشرح الأفكار المعقدة، وحتى محاكاة أسلوب الكتب الطبية. لقد أصبحت هذه الأدوات بارعة لدرجة أنها تستطيع غالباً اجتياز الامتحانات الطبية نفسها. ومع ذلك، ظل هناك سؤال جوهري بلا إجابة: هل تغير الطريقة التي يطلب بها الطالب من الحاسوب أن يفكر جودة الإجابة؟ وتحديداً، هل يؤدي إجبار الحاسوب على التوقف والتفكير في المشكلة خطوة بخطوة قبل التحدث إلى إنتاج نتائج أفضل من مطالبته بالإجابة فوراً؟
وضع فريق من الباحثين حداً لهذا التساؤل من خلال إخضاع نموذج واحد متطور للذكاء الاصطناعي لسلسلة من الاختبارات باستخدام الأسئلة الفعلية لامتحان جراحة العظام لعام 2024. لم يقارنوا بين علامات تجارية مختلفة من البرامج الحاسوبية ضد بعضها البعض، بل استخدموا البرنامج نفسه مرتين لكل سؤال. أولاً، طلبوا من النموذج الإجابة في وضعه القياسي، حيث يولد استجابة سريعة. ثم طلبوا من نفس النموذج تماماً نفس السؤال، ولكن هذه المرة قاموا بتبديله إلى وضع "التفكير الممتد". في هذا الإعداد الثاني، يتم توجيه الحاسوب لقضاء وقت أطول في تفكيك المشكلة داخلياً، ووزن الأدلة، والتفكير في المنطق قبل أن يكتب أي إجابة نهائية. أراد الباحثون معرفة ما إذا كان هذا الجهد الذهني الإضافي، الذي يستغرق حوالي دقيقة واحدة أطول لكل سؤال، سيجعل الحاسوب أكثر ذكاءً بالفعل.
كانت النتائج مذهلة. عندما أجاب النموذج في الوضع السريع القياسي، أجاب على 79 بالمائة من الأسئلة بشكل صحيح. كان هذا السكور مثيراً للإعجاب بالفعل، حيث وضع أداء الحاسوب على قدم المساواة تقريباً مع مقيم ممارس قضى خمس سنوات في التدريب. ولكن عندما حول الباحثون النموذج إلى وضع التفكير الممتد، قفزت الدقة إلى 93 بالمائة. لم تكن هذه حالة من حصول الحاسوب على إجابات صحيحة في بعض الأسئلة وخاطئة في أخرى بمحض الصدفة؛ فقد أظهرت البيانات نمطاً واضحاً: كل سؤال أجاب عليه الحاسوب بشكل صحيح في الوضع السريع، أجاب عليه أيضاً بشكل صحيح في الوضع البطيء. جاء التحسن بالكامل من الأسئلة التي أخطأ فيها سابقاً؛ ففي الوضع الممتد، قام بتصحيح جميع أخطائه تقريباً. وجد الباحثون أن هذه الطفرة في الأداء حدثت في كل مجالات جراحة العظام تقريباً، من إصابات اليد إلى حالات العمود الفقري، ولم يهم ما إذا كان السؤال يتضمن صورة لأشعة سينية أو كان مجرد نص.
رغم هذا التحسن الدراماتيكي، كشفت الدراسة عن تحذير دقيق ولكنه مهم لأي شخص يستخدم هذه الأدوات. فحتى عندما كان الحاسوب مخطئاً، بدا واثقاً تماماً كما كان عندما يكون مصيباً. في الحالات القليلة التي ظل فيها النموذج يعطي إجابة غير صحيحة، حتى بعد التفكير بعمق، لم يتردد أو يعبر عن الشك؛ بل كان يقدم شرحاً مفصلاً بل ويستشهد بالأدبيات الطبية لدعم خياره الخاطئ، مما يجعل الخطأ يبدو موثوقاً. وأشار الباحثون إلى أنه إذا لم يكن الطالب يعرف الإجابة الصحيحة بالفعل، فقد يسهل تضليله بهذا الثبات الزائف. كما أن الحاسوب قادر على التعرض للخداع؛ فإذا اقترح المستخدم فكرة خاطئة، فإن النموذج غالباً ما يقبلها ويبني حول ذلك الخطأ شرحاً مفصلاً وواثقاً.
تخلص الدراسة إلى أنه على الرغم من قوة أدوات الذكاء الاصطناعي هذه، إلا أنها ليست بدائل مثالية للمعلمين البشر أو المواد الدراسية الموثقة. ويقترح الباحثون أنه بالنسبة للطلاب الذين يستخدمون هذه الأدوات، فإن أفضل نهج هو استخدام إعداد التفكير الممتد دائماً، حيث أن دقيقة التفكير الإضافية تزيد بشكل كبير من فرص الحصول على إجابة صحيحة. ومع ذلك، يجب دائماً التعامل مع المخرجات كمسودة تحتاج إلى تحقق. الحاسوب مساعد مفيد لتنظيم خطط الدراسة أو تلخيص المفاهيم، لكن لا يمكن الوثوق به بعد في الحكم على دقة معلوماته. تظهر النتالئ أن الطريقة التي نتفاعل بها مع هذه الآلات تهم بقدر ما تهم الآلات نفسها؛ فمجرد تغيير في الإعدادات يمكن أن يحول الإجابة الجيدة إلى إجابة عظيمة، لكنه لا يمكنه إلغاء الحاجة إلى الإشراف البشري.
ملخص تقني: وضع الاستنتاج الممتد يحسن دقة النماذج اللغوية الكبيرة (LLMs) في امتحان جراحة العظام التدريبي
بيان المشكلة يتزايد اعتماد مقيمي جراحة العظام على النماذج اللغوية الكبيرة (LLMs) للتحضير للامتحانات النهائية والدراسة. وبينما أثبتت الأدبيات الحالية أن النماذج اللغوية الكبيرة متعددة الوسائط المعاصرة يمكن أن تحقق مستويات دقة تضاهي كبار المقيمين في الامتحانات الطبية المعيارية، لا تزال هناك فجوة حرجة في فهم تأثير عمق الاستنتاج أثناء وقت الاستدلال (inference-time reasoning) ضمن نموذج واحد. لقد قارنت الدراسات السابقة إلى حد كبير بين مختلف الشركات المصنعة للنماذج (مثل GPT مقابل Gemini) مع تثبيت ظروف الاستدلال. ومع ذلك، لم تعزل تأثير تمكين أوضاع "الاستنتاج الممتد" (أو "التفكير") مقابل التوليد القياسي للاستجابة على مجموعة عناصر متطابقة. هذا التمييز ذو أهمية تعليمية لأن المقيم الذي يستخدم اشتراكاً استهلاكياً عادةً لا يقوم بتبديل الشركات المصنعة في منتصف الجلسة، بل يمكنه التبديل بين وضع الاستنتاج القياسي والاستنتاج الممتد. ولم يتم تحديد مدى تأثير هذا التبديل على الدقة وطبيعة أنماط الفشل المستمرة في البيئات غير الخاضعة للإشراف.
المنهجية استخدمت هذه الدراسة تصميماً تجريبياً متقاطعاً ومزدوجاً لتقييم نموذج لغوي كبير واحد متعدد الوسائط (GPT-5) على مجموعة فرعية مكونة من 203 عنصراً من امتحان جراحة العظام التدريبي (OITE) لعام 2024 المنشور علناً.
التصميم التجريبي: تم تقديم كل عنصر من العناصر الـ 203 مرتين لنفس النموذج عبر واجهة ChatGPT متعددة الوسائط الأصلية بين نوفمبر 2025 ويناير 2026. تم اختبار التكوينين التاليين: (1) الوضع القياسي (التوليد الفوري للاستجابة) و(2) وضع الاستنتاج الممتد (تخصيص وقت استدلال إضافي للاستنتاج متعدد الخطوات).
الضوابط: تم تثبيت جميع الظروف الأخرى. قُدمت العناصر كلقطات شاشة تحتوي على نص السؤال، والأشكال التوضيحية، والخيارات متعددة الإجابات. تم توحيد الأوامر (prompts) لتكون: "اختر أفضل إجابة وقدم شرحاً". تم مسح الجلسات بين العناصر لتقليل الاحتفاظ بالسياق.
التسجيل: تم تسجيل الاستجابات ومقارنتها بمفتاح الإجابات الرسمي للجمعية الأمريكية لجراحي العظام (AAOS). تمت مقارنة التعليلات (rationales) بالشروحات الرسمية لتحديد عدم التطابق بين الإجابة والتعليل.
التحليل الإحصائي: تم تحليل الدقة المزدوجة باستخدام اختبار "ماكنيمار" الدقيق (McNemar's exact test). تم تقييم الاختلافات بين التخصصات الفرعية باستخدام اختبار "فيشر-فريمان-هالتون" الدقيق. تم تحديد الدلالة الإحصائية عند p<0.05.
المساهمات الرئيسية
تحديد أداء النموذج الواحد: تعد هذه الدراسة الأولى التي تعزل تأثير عمق الاستنتاج أثناء وقت الاستدلال داخل نموذج لغوي كبير واحد على مجموعة بيانات امتحانات طبية عالية المخاطر.
توصيف أنماط الفشل: يوفر البحث تصنيفاً مفصلاً للأخطاء التي تستمر حتى في ظل الاستنتاج الممتد، وتحديداً تحليل "الأخطاء الواثقة" حيث يقدم النموذج إجابات خاطئة بطلاقة عالية ودعم ظاهري للأدلة.
تحليل التخصصات الفرعية والوسائط: تقيم الدراسة تباين الأداء عبر التخصصات الفرعية لجراحة العظام (مثل اليد، الإصابات، العمود الفقري) وتميز بين العناصر التي تحتوي على صور والعناصر النصية فقط.
النتائج
تحسن الدقة: أدى وضع الاستنتاج الممتد إلى تحسين الدقة بشكل ملحوظ من 79% (161/203) في الوضع القياسي إلى 93% (189/203) في وضع الاستنتاج الممتد. يمثل هذا تحسناً مطلقاً قدره 13.8 نقطة مئوية (فاصل ثقة 95% بنسبة 9.0–18.5).
اتجاه التحسن: كان التحسن أحادي الاتجاه تماماً؛ فكل عنصر تمت الإجابة عليه بشكل صحيح في الوضع القياسي ظل صحيحاً في وضع الاستنتاج الممتد. كانت جميع الأزواج الـ 28 المتفاوتة تميل لصالح تكوين الاستنتاج الممتد (p<0.001).
أداء التخصصات الفرعية:
لوحظت تحسينات معنوية في تخصص اليد (من 50% إلى 83%، p=0.031) والإصابات (من 78% إلى 92%، p=0.016).
لم توجد فروق ذات دلالة إحصائية عبر التخصصات الفرعية في أي من التكوينين (p=0.11 للوضع القياسي؛ p=0.68 للوضع الممتد).
تراوحت الدقة بين 50% و100% في الوضع القياسي، وبين 83% و100% في وضع الاستنتاج الممتد.
الصور مقابل النصوص: لم تختلف الدقة بشكل كبير بين العناصر التي تحتوي على صور والعناصر النصية فقط في كلا التكوينين (p=1.0لكليهما).
سلوك الفشل:
الثقة: تم تقديم الإجابات الخاطئة بنفس الطلاقة والهيكل مثل الإجابات الصحيحة، وغالباً دون التعبير عن عدم اليقين.
الهلوسة: في 2% من العناصر، قدم النموذج إجابة تتعارض مع تعليله الخاص.
أخطاء الاستشهاد: كانت الاستشهادات المطبقة بشكل خاطئ أو غير المتوافقة هي أقل أنواع الأخطاء التي تم تصحيحها بواسطة الاستنتاج الممتد.
تفاعل المستخدم: عندما عُرِضت فرضية تصحيحية على الباحث، استوعب النموذج التصحيح ولكنه ولد شرحاً جديداً بنفس القدر من الثقة بناءً على (الفرضية الخاطئة).
الأهمية والادعاءات تزعم الورقة أن عمق الاستنتاج أثناء وقت الاستدلال هو محدد جوهري لدقة النماذج اللغوية الكبيرة في أسئلة نمط امتحانات جراحة العظام، وهو إعداد يمكن للمقيمين التحكم فيه عبر تبديل واحد. تشير النتائج إلى أنه بينما يقلل الاستنتاج الممتد من وتيرة الخطأ بشكل كبير، فإنه لا يقضي على خطر "الأخطاء الواثقة".
يخلص المؤلفون إلى ضرقة النظر إلى النماذج اللغوية الكبيرة كـ مساعدين خاضعين للإشراف بدلاً من كونهم موارد دراسية أساسية. التحذير المركزي هو أن الأداة تكون أقل موثوقية للمتعلمين الأقل قدرة على اكتشاف إخفاقاتها، حيث لا يقدم النموذج أي إشارة داخلية تميز بين المخرجات الصحيحة والخاطئة. وبناءً على ذلك، يوصي المؤلفون المقيمين بالاعتماد على تكوينات الاستنتاج الممتد بشكل افتهائي للتحضير للامتحانات، ولكن يجب عليهم التعامل مع جميع مخرجات النموذج كمعلومات غير مؤكدة حتى يتم الرجوع إلى بنوك الأسئلة المعتمدة، أو الأدبيات الأولية، أو تعليمات أعضاء هيئة التدريس. وتؤكد الدراسة صراحة أن الأداء في الامتحان لا يعادل الحكم السريري.