← أحدث الأبحاث
📄 radiology and imaging

Retrieval-Augmented Claude Opus 4.7 and GPT-5.5 Surpass Human Performance on the Nuclear Cardiology Board Preparation Exam (and Claude Drafts a Paper About it)

حققت نماذج اللغات الكبيرة من الجيل التالي، وتحديداً "كلود أوبوس 4.7" و"جي بي تي 5.5"، والمجهزة بتقنية التوليد المعزز بالاسترجاع باستخدام موارد طب قلب نووي متخصصة، معدلات دقة متوسطة بلغت حوالي 86% في امتحان التحضير لبورد الجمعية الأمريكية للطب النووي (ASNC)، متجاوزة بذلك عتبة النجاح المقدرة ومتوسط أداء الزملاء المتدربين البشريين.

المؤلفون الأصليون: Killekar, A., Shanbhag, A., Miller, R. J., Dey, D., Bourque, J., Phillips, L., Chareonthaitawee, P., Slomka, P.

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Killekar, A., Shanbhag, A., Miller, R. J., Dey, D., Bourque, J., Phillips, L., Chareonthaitawee, P., Slomka, P.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

تخيل امتحاناً نهائياً عالي المخاطر للأطباء المتخصصين في فحص صور القلب باستخدام مواد مشعة خاصة. هذا هو "امتحان مجلس طب القلب النووي". لسنوات، حاولت الذكاء الاصطناعي اجتياز هذا الاختبار، لكنه استمر في الفشل، حيث كانت درجاته أقل من متوسط طالب الطب.

هذه الورقة البحثية تروي قصة كيف تمكن نموذجان جديدان من الذكاء الاصطناعي فائقا الذكاء من اجتياز الاختبار أخيراً بتفوق باهر، متفوقين على متوسط الطالب البشري.

الإعداد: الامتحان و"ورقة الغش"

يتكون الامتحان من 168 سؤالاً. بعضها نصي فقط (مثل اختبار معلومات عامة)، ولكن حوالي 27 منها تتطلب النظر إلى صور طبية معقدة للقلب.

في الماضي، عندما حاول الذكاء الاصطناعي خوض هذا الاختبار "منفرداً" (بدون أي مساعدة)، كان أفضل ما يمكنه تحقيقه هو الحصول على حوالي 63% من الإجابات الصحيحة. وهذه تعتبر درجة رسوب. أما متوسط درجة طالب الطب البشري ("الزميل المتدرب") فقد كان 78%.

في هذه الدراسة الجديدة، منح الباحثون الذكاء الاصطناعي "ورقة غش" ضخمة. لم تكن مجرد بحث سريع في جوجل؛ بل كانت نظام "توليد مدعم بالاسترجاع" (RAG). فكر في الأمر كأنك تعطي الذكاء الاصطناعي مكتبة رقمية مثالية وقابلة للبحث تحتوي على الكتب المدرسية الرسمية، والأطالس، والإرشادات الطبية لطب القلب النووي. عندما يرى الذكاء الاصطناعي سؤالاً، فإنه يغوص فوراً في هذه المكتبة، ويجد الصفحة الدقيقة التي تحتوي على الإجابة، ويستخدمها لصياغة رده.

المتنافسون

اختبر الباحثون نموذجين جديدين من الجيل التالي للذكاء الاصطناعي:

  1. Claude Opus 4.7: نموذج يستخدم نظام بحث محلي وشفاف (مثل أمين مكتبة يريك بالضبط الكتب التي سحبها من الرف).
  2. GPT-5.5: نموذج يستخدم نظام بحث سحابي (مثل أمين مكتبة يجد لك الكتب ولكن لا يريك عملية البحث).

النتائج: الذكاء الاصطناعي يهزم الطالب المتوسط

عندما خاض هذان النموذجان الامتحان خمس مرات لكل منهما، كانت النتائج مفاجئة:

  • الدرجات: سجل كلا النموذجين حوالي 86% إلى 87%.
  • المقارنة: هذه النتيجة أعلى بكثير من متوسط درجة الطالب البشري البالغ 78%. في الواقع، إذا وضعت 13 طالباً بشرياً ونموذجي الذكاء الاصطناعي في صف واحد، فإن الذكاء الاصطناعي سيحتل المراكز الخمسة الأولى، متفوقاً على 8 أو 9 من البشر.
  • سرعة التقدم: هذه قفزة هائلة. قبل 18 شهراً فقط، كان أفضل ذكاء اصطناعي يسجل 63%. الآن، مع "ورقة الغش" (RAG)، قفزوا بمقدار 23 نقطة مئوية.

نقطتا الضعف

على الرغم من فوز الذكاء الاصطناعي، إلا أنه واجه عقبتين محددتين:

  1. مشكلة "الصورة": كان الذكاء الاصطناعي بارعاً في الأسئلة النصية (سجل ما يقرب من 89%)، لكنه تعثر في أسئلة الصور. حيث حصل على حوالي 73-77% في أسئلة الصور، بينما ظل البشر أفضل في هذا الجانب، حيث سجلوا 81.5%.
    • تشبيه: تخيل أن الذكاء الاصطناعي بروفيسور عبقري يمكنه تسميع الكتاب المدرسي كاملاً من ذاكرته، لكنه لا يزال يرتبك عند النظر إلى صورة أشعة سينية ضبابية. إنه يعرف النظرية تماماً، لكنه لا يزال يتعلم كيفية "رؤية" الصورة.
  2. خلل "الأمان" (خاص بـ GPT-5.5 فقط): رفض نموذج GPT-5.5 الإجابة على حوالي 7% من الأسئلة. حيث كان يقول: "أنا آسف، لا يمكنني المساعدة في ذلك"، رغم أن الأسئلة كانت مجرد أسئلة امتحان طبي قياسية حول أدوية القلب أو سلامة الإشعاع.
    • تشبيه: الأمر يشبه أمين مكتبة حذر جداً يرفض تسليمك كتاباً عن "كيفية صنع قنبلة" حتى لو كنت تسأل طالباً في الفيزياء عن سؤال مشروع حول الطاقة النووية. كانت فلاتر الأمان في الذكاء الاصطناعي حساسة للغاية، مما تسبب في ضياع بعض النقاط. أما Claude Opus 4.7 فلم تكن لديه هذه المشكلة؛ فقد أجاب على كل شيء.

ما يقوله المؤلفون (وما لا يقولونه)

الورقة البحثية حذرة جداً بشأن ما يعنيه هذا:

  • ما هو عليه: يثبت هذا أن الذكاء الاصطناعي، مع توفر المواد المرجعية المناسبة، يمكنه تعلم الحقائق والقواعد لطب القلب النووي بشكل أفضل من المتدرب المتوسط. ويقترح المؤلفون أنه يمكن استخدام هذه الأدوات كـ وسائل تعليمية لمساعدة الطلاب على الدراسة أو كـ أدوات مرجعية للتحقق من الحقائق في غرفة القراءة.
  • ما ليس عليه: يوضح المؤلفون صراحة أن اجتياز اختبار متعدد الخيارات لا يعني أن الذكاء الاصطناعي جاهز ليكون طبيباً. فالطب الحقيقي يتضمن التحدث مع المرضى، والتعامل مع عدم اليقين، واتخاذ قرارات معقدة لا يمكن للاختبار متعدد الخيارات قياسها. الذكاء الاصطناعي هو كتاب مرجعي قوي، وليس بديلاً للطبيب البشري.

الخلاصة

في غضة عام ونصف، انتقل الذكاء الاصطناي من الفشل في امتحان مجلس طب القلب النووي إلى التفوق على متوسط الطالب البشري، بشرط حصوله على الكتب المدرسية المناسبة. ومع ذلك، لا يزال يعاني في تفسير الصور الطبية، كما أن أحد النموذجين "خائف" أكثر من اللازم للإجابة على بعض الأسئلة المشروعة. وبينما تعد هذه خطوة كبيرة للأمام لأدوات التعليم الطبي، تخلص الورقة إلى أن هذه الآلات هي مساعدات، وليست بدائل للأطباء البشريين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →