← أحدث الأبحاث
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

تُظهر هذه الدراسة أن استخدام الاستدلال القائم على التفكير الممتد يحسن بشكل كبير من دقة نموذج GPT-5 في أسئلة امتحان التدريب لطب العظام مقارنة بالوضع القياسي، غير أن استمرار الأخطاء الواثقة يشير إلى ضرورة استخدام هذه النماذج كأدوات مساعدة خاضعة للإشراف بدلاً من كونها موارد دراسية أساسية للمقيمين.

المؤلفون الأصليون: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

نُشر 2026-09-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في كل عام، يخضع آلاف من مقيمي جراحة العظام في الولايات المتحدة لامتحان صارم لقياس معرفتهم بالعظام والمفاصل والعضلات. هذا الاختبار، المعروف باسم "امتحان التدريب الداخلي لجراحة العظام"، يعد نقطة تفتيش حاسمة في تدريبهم، حيث يساعد مديري البرامج في تحديد ما إذا كان المتدرب مستعداً ليصبح جراحاً معتمداً من قبل البورد. وفي السنوات الأخيرة، اتجه هؤلاء الطلاب بشكل متزايد إلى أدوات الذكاء الاصطناعي للمساعدة في دراستهم. هذه الأدوات، التي تسمى نماذج اللغات الكبيرة، هي برامج حاسوبية مدربة على كميات هائلة من النصوص يمكنها الإجابة على الأسئلة، وشرح الأفكار المعقدة، وحتى محاكاة أسلوب الكتب الطبية. لقد أصبحت هذه الأدوات بارعة لدرجة أنها تستطيع غالباً اجتياز الامتحانات الطبية نفسها. ومع ذلك، ظل هناك سؤال جوهري بلا إجابة: هل تغير الطريقة التي يطلب بها الطالب من الحاسوب أن يفكر جودة الإجابة؟ وتحديداً، هل يؤدي إجبار الحاسوب على التوقف والتفكير في المشكلة خطوة بخطوة قبل التحدث إلى إنتاج نتائج أفضل من مطالبته بالإجابة فوراً؟

وضع فريق من الباحثين حداً لهذا التساؤل من خلال إخضاع نموذج واحد متطور للذكاء الاصطناعي لسلسلة من الاختبارات باستخدام الأسئلة الفعلية لامتحان جراحة العظام لعام 2024. لم يقارنوا بين علامات تجارية مختلفة من البرامج الحاسوبية ضد بعضها البعض، بل استخدموا البرنامج نفسه مرتين لكل سؤال. أولاً، طلبوا من النموذج الإجابة في وضعه القياسي، حيث يولد استجابة سريعة. ثم طلبوا من نفس النموذج تماماً نفس السؤال، ولكن هذه المرة قاموا بتبديله إلى وضع "التفكير الممتد". في هذا الإعداد الثاني، يتم توجيه الحاسوب لقضاء وقت أطول في تفكيك المشكلة داخلياً، ووزن الأدلة، والتفكير في المنطق قبل أن يكتب أي إجابة نهائية. أراد الباحثون معرفة ما إذا كان هذا الجهد الذهني الإضافي، الذي يستغرق حوالي دقيقة واحدة أطول لكل سؤال، سيجعل الحاسوب أكثر ذكاءً بالفعل.

كانت النتائج مذهلة. عندما أجاب النموذج في الوضع السريع القياسي، أجاب على 79 بالمائة من الأسئلة بشكل صحيح. كان هذا السكور مثيراً للإعجاب بالفعل، حيث وضع أداء الحاسوب على قدم المساواة تقريباً مع مقيم ممارس قضى خمس سنوات في التدريب. ولكن عندما حول الباحثون النموذج إلى وضع التفكير الممتد، قفزت الدقة إلى 93 بالمائة. لم تكن هذه حالة من حصول الحاسوب على إجابات صحيحة في بعض الأسئلة وخاطئة في أخرى بمحض الصدفة؛ فقد أظهرت البيانات نمطاً واضحاً: كل سؤال أجاب عليه الحاسوب بشكل صحيح في الوضع السريع، أجاب عليه أيضاً بشكل صحيح في الوضع البطيء. جاء التحسن بالكامل من الأسئلة التي أخطأ فيها سابقاً؛ ففي الوضع الممتد، قام بتصحيح جميع أخطائه تقريباً. وجد الباحثون أن هذه الطفرة في الأداء حدثت في كل مجالات جراحة العظام تقريباً، من إصابات اليد إلى حالات العمود الفقري، ولم يهم ما إذا كان السؤال يتضمن صورة لأشعة سينية أو كان مجرد نص.

رغم هذا التحسن الدراماتيكي، كشفت الدراسة عن تحذير دقيق ولكنه مهم لأي شخص يستخدم هذه الأدوات. فحتى عندما كان الحاسوب مخطئاً، بدا واثقاً تماماً كما كان عندما يكون مصيباً. في الحالات القليلة التي ظل فيها النموذج يعطي إجابة غير صحيحة، حتى بعد التفكير بعمق، لم يتردد أو يعبر عن الشك؛ بل كان يقدم شرحاً مفصلاً بل ويستشهد بالأدبيات الطبية لدعم خياره الخاطئ، مما يجعل الخطأ يبدو موثوقاً. وأشار الباحثون إلى أنه إذا لم يكن الطالب يعرف الإجابة الصحيحة بالفعل، فقد يسهل تضليله بهذا الثبات الزائف. كما أن الحاسوب قادر على التعرض للخداع؛ فإذا اقترح المستخدم فكرة خاطئة، فإن النموذج غالباً ما يقبلها ويبني حول ذلك الخطأ شرحاً مفصلاً وواثقاً.

تخلص الدراسة إلى أنه على الرغم من قوة أدوات الذكاء الاصطناعي هذه، إلا أنها ليست بدائل مثالية للمعلمين البشر أو المواد الدراسية الموثقة. ويقترح الباحثون أنه بالنسبة للطلاب الذين يستخدمون هذه الأدوات، فإن أفضل نهج هو استخدام إعداد التفكير الممتد دائماً، حيث أن دقيقة التفكير الإضافية تزيد بشكل كبير من فرص الحصول على إجابة صحيحة. ومع ذلك، يجب دائماً التعامل مع المخرجات كمسودة تحتاج إلى تحقق. الحاسوب مساعد مفيد لتنظيم خطط الدراسة أو تلخيص المفاهيم، لكن لا يمكن الوثوق به بعد في الحكم على دقة معلوماته. تظهر النتالئ أن الطريقة التي نتفاعل بها مع هذه الآلات تهم بقدر ما تهم الآلات نفسها؛ فمجرد تغيير في الإعدادات يمكن أن يحول الإجابة الجيدة إلى إجابة عظيمة، لكنه لا يمكنه إلغاء الحاجة إلى الإشراف البشري.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →