PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
يُعد PanCanBench معياراً شاملاً يتكون من 282 سؤالاً حقيقياً لمرضى سرطان البنكرياس و3,130 معياراً مستمداً من الخبراء، وهو يكشف عن تباينات كبيرة في الدقة الواقعية والاكتمال لـ 22 نموذجاً من النماذج اللغوية الكبيرة، مما يسلط الضوء على أن ارتفاع درجات المعايير وتكامل البحث عبر الويب لا يضمنان بالضرورة السلامة السريرية أو تقليل الهلوسة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة آلياً ذكياً جداً وسريعاً للغاية، قد قرأ كل كتاب طبي كُتب على الإطلاق. تسأله: "خالي مصاب بسرطان البنكرياس؛ ماذا يجب أن نفعل؟" فيعطيك إجابة طويلة وواثقة.
المشكلة الكبرى: مجرد كون الروبوت يبدو واثقاً ويستخدم كلمات كبيرة لا يعني بالضرى أنه يقول الحقيقة. في عالم الطب، يمكن للكذبة الواثقة أن تكون خطيرة.
هذه الورقة البحثية، التي تسمى PanCanBench، هي بمثابة "امتحان نهائي" مُصمم خصيصاً لاختبار هؤلاء المكتبيين الآليين في موضوع سرطان البنكرياس الشائك والمخيف. إليك كيف قاموا بذلك، مشروحاً ببساطة:
١. اختبار "العالم الحقيقي" (لا أسئلة وهمية)
معظم اختبارات الذكاء الاصطناعي تستخدم أسئلة وهمية من صنع الكمبيوتر (مثل "ما هي عاصمة فرنسا؟"). لكن المرضى الحقيقيين يطرحون أسئلة فوضوية، عاطفية، ومعقدة مثل: "قال لي طبيبي إنها المرحلة الرابعة، لكن الخزعة لم تكن واضحة. ماذا أفعل الآن؟"
ذهب الباحثون إلى خط مساعدة حقيقي لمرضى سرطان البنكرياس واستخرجوا ٢٨٢ سؤالاً حقيقياً من أشخاص حقيقيين. لم يكتفوا بسؤال الذكاء الاصطناعي عن الإجابة فحسب، بل سألوا: "هل هذه الإجابة آمنة ومفيدة؟"
٢. "المُقيّم البشري" مقابل "القاضي الروبوت"
لتقييم الإجابات، لم يعتمد الباحثون على الكمبيوتر فقط. بل استعانوا بـ أطباء مقيمين في طب الأورام (أطباء تحت التدريب متخصصين في السرطان) لإنشاء "نموذج تقييم" (Rubric).
- نموذج التقييم يشبه الوصفة: تخيل وصفة لكعكة مثالية. تقول: "يجب أن تحتوي على دقيق (٥ نقاط)، يجب أن تحتوي على سكر (٥ نقاط)، ويجب ألا تحتوي على ملح (-١٠ نقاط)".
- كتب الأطباء هذه "الوصفات" لكل سؤال على حدة.
- ثم استخدموا ذكاءً اصطناعياً فائق الذكاء (GPT-5) ليعمل كـ قاضٍ، يتحقق من إجابات الروبوتات الأخرى بناءً على الوصفات التي كتبها البشر.
النتيجة: كان "القاضي الآلي" جيداً بقدر جودة الأطباء البشريين تقريباً في التقييم. وهذا يعني أنه يمكننا استخدام الذكاء الاصطناعي لتقييم إجابات الذكاء الاصطناعي في المستقبل، مما يوفر الوقت والمال!
٣. النتائج الصادمة
عندما أجروا الاختبار، إليكم ما حدث:
- الثقة لا تعني الصحة: بعض أحدث النماذج "الأكثر ذكاءً" (مثل o3) حصلت على أعلى الدرجات في اختبار "الوصفة". لقد بدت مثالية! ولكن، كانت هي أيضاً الأكثر ارتكاباً للأخطاء الواقعية الخطيرة. الأمر يشبه طالباً يكتب مقالاً جميلاً ولكن يخطئ في الرياضيات.
- معدل "الهلوسة": هذا هو الوقت الذي يخترع فيه الذك de الاصطناعي معلومات من عنده.
- أفضل النماذج (مثل GPT-5 وGemini) كانت تخترع الحقائق في ٦٪ فقط من الحالات.
- بعض النماذج مفتوحة المصدر (النماذج المجانية التي يمكن لأي شخص تحميلها) اخترعت حقائق في ٥٤٪ من إجاباتها! هذا يشبه رمي عملة معدنية لتحديد ما إذا كان يجب عليك تناول الدواء أم لا.
- فخ "بحث جوجل": قام الباحثون بتفعيل زر "البحث في الويب" للروبوتات، آملين أن تبحث عن الحقائق.
- المفاجأة: لم يساعد ذلك دائماً! أحياناً، عندما يبدأ الروبوت في البحث عبر الإنترنت، ينسى المعلومات الجيدة التي كان يعرفها بالفعل. إنه مثل طباخ يتوقف عن الطهي ليقرأ كتاب وصفات، فيحرق الحساء لأنه تشتت.
- أيضاً، وجدت الروبوتات أحياناً روابط سيئة (مثل مدونة عشوائية) بدلاً من المجلات الطبية الموثوقة.
٤. تجربة "الذكاء الاصطناعي مقابل البشر" في نموذج التقييم
سأل الباحثون: "هل يمكننا فقط جعل الذكاء الاصطناعي يكتب وصفة التقييم (النموذج) بدلاً من توظيف الأطباء؟"
- الإجابة: لا.
- عندما كتب الذكاء الاصطناعي وصفات التقييم، حصلت الروبوتات على درجات أعلى بكثير (درجات تضخم بنسبة تقارب ١٨ نقطة).
- الأمر يشبه أن يكتب الطالب أسئلة امتحانه بنفسه ثم يقيم إجاباته. سيحصل على درجة امتياز، لكنه لن يعرف المادة فعلياً. يظل الخبراء البشريون ضروريين لوضع القواعد.
الخلاصة
هذه الورقة البحثية هي بمثابة "ملصق تحذيري" لمستقبل الذكاء الاصطناعي في الرعاية الصحية.
١. لا تثق في الذكاء الاصطناعي الذي يبدو "الأذكى" في حديثه: النموذج الذي يبدو أكثر ثقة ليس دائماً الأكثر دقة.
٢. الخبراء البشريون لا يمكن استبدالهم: نحتاج إلى الأطباء للمساعدة في تصميم الاختبارات والتحقق من الحقائق.
٣. النماذج مفتوحة المصدر تحتاج إلى عمل: النماذج المجانية حالياً خطيرة جداً بالنسبة للنصائح الطبية الجادة لأنها تكذب كثيراً.
باخت de المختصر: PanCanBench هو واقع صادم. إنه يظهر أنه بينما يتحسن الذكاء الاصطناعي في التحدث كطبيب، فإنه لا يزال بحاجة إلى مشرف بشري للتأكد من أنه لا يتصرف كدجال خطير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.