← أحدث الأبحاث
💬 NLP

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

تقدم هذه الورقة Medmarks، وهي مجموعة معيارية شاملة ومفتوحة المصدر تتكون من 30 مهمة طبية متنوعة و61 نموذجاً تم تقييمها، والتي تكشف أن نماذج الاستدلال الرائدة تتفوق على غيرها في الدقة وكفاءة الرموز (token efficiency) مع تسليط الض الضوء على عرضة النماذج الأصغر لـتحيز ترتيب الإجابة.

المؤلفون الأصليون: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed
نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالم الذكاء الاصطنا-عي كأنه مستشفى ضخم يعج بالحركة. لفترة طويلة، حاولنا معرفة أي "أطباء" الذكاء الاصطناعي بارعون حقاً في وظائفهم. لكن الاختبارات التي كنا نستخدمها لتقييمهم أصبحت تشبه لوحة النتائج المعطلة: فهي إما سهلة للغاية (بحيث يحصل كل ذكاء اصطناعي على درجة امتياز)، أو سرية للغاية (بحيث لا يستطيع أحد مراجعة العمل)، أو أنها تختبر فقط ما إذا كان بإمكان الذكاء الاصطناعي حفظ كتاب مدرسي بدلاً من التفكير فعلياً في مشكلة المريض.

إليك MEDMARKS، وهي "كلية طب" جديدة ومفتوحة المصدر بالكامل للذكاء الاصطناعي، أنشأها فريق من الباحثين. فكر فيها كأنها صالة ألعاب رياضية ضخمة وشفافة يأتي إليها 61 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (من النماذج الصغيرة ذات الميزانية المنخفضة إلى نسخ الحواسيب الفائقة الضخمة) لتأدية 30 اختباراً بدنياً وعقلياً مختلفاً.

إليك ما توصلت إليه الورقة البحثية، مشروحاً ببساطة:

1. مجموعة الاختبارات: تحديات متنوعة

بدلاً من مجرد سؤال "ما هي عاصمة فرنسا؟" (وهو أمر سهل للذكاء الاصطناعي)، يلقي MEDMARKS بمزيج من التحديات على النماذج:

  • اختبار الاختيار من متعدد (MED_MARKS-V): مثل امتحان مجلس الإدارة القياسي حيث يختار الذكاء الاصطناٍء الإجابة الصحيحة من قائمة، ويتضمن ذلك مسائل رياضية معقدة وقصص مرضى طويلة ومعقدة.
  • المقابلة مفتوحة النهايات (MED_MARKS-OE): هنا، يتعين على الذكاء الاصطناعي الدردشة مع "مريض" أو كتابة خطة علاجية. وبما أنه لا توجد إجابة واحدة صحيحة، استخدم الباحثون "ذكاءً اصطناعياً حكماً" (حكماً ذكياً) لتقييم المحادثة، تماماً كما يقوم معلم بشري بتصحيح مقال.
  • "عجلات التدريب" (MED_MARKS-T): مجموعة فرعية خاصة من هذه الاختبارات مصممة لتُستخدم كصالة ألعاب رياضية للذكاء الاصطناعي. يمكن للباحثين استخدام هذه الاختبارات لتدريب الذكاء الاصطناعي فعلياً ليصبح أفضل، تماماً كما يستخدم المدرب التمارين لتحسين مستوى الرياضي.

2. النتائج: من فاز بالميداليات؟

قام الباحثون بإجراء الاختبارات 71 مرة مختلفة مع إعدادات مختلفة لمعرفة من سيتصدر المشهد.

  • العمالقة يفوزون (غالباً): نماذج الذكاء الاصطناعي الأكبر والأكثر قوة من شركات مثل OpenAI (GPT-5.1/5.2) وGoogle (Gemini 3) حصلت عموماً على أعلى الدرجات. إنهم يشبهون رياضيي الأولمبياد في مجال الذكاء الاصطناعي.
  • "المتخصص" مقابل "العام": بعض نماذج الذكاء الاصطناعي تم تدريبها خصيصاً على الكتب والملاحظات الطبية. هذه النماذج "المتخصصة" غالباً ما هزمت النماذج "العامة" الأكبر حجماً التي تعرف القليل عن كل شيء. الأمر يشبه طبيب محلي يعرف حيه بشكل أفضل من طبيب مشهور يزور المنطقة مرة واحدة في السنة.
  • فجوة الكفاءة: هنا تكمن مفاجأة غير متوقعة. كانت نماذج الذكاء الاصطناعي رفيعة المستوى والمغلقة المصدر (التي تدفع مقابلها) تشبه سيارات الفيراري: فقد حققت أفضل النتائج ولكنها استهلكت القليل من الوقود (قوة الحوسبة). أما النماذج مفتوحة المصدر (المتاحة للتحميل مجاناً) فكانت مثل الشاحنات: يمكنها أحياناً إنجاز المهمة، لكنها تستهلك كمية هائلة من الوقود؛ حيث احتاجت بعض النماذج المفتوحة إلى 5 أضعاف قوة الحوسبة للحصول على نتيجة مماثلة.

3. العيات والعيوب

وجدت الورقة أيضاً بعض العادات المضحكة والمثيرة للقلق في أطباء الذكاء الاصطناعي هؤلاء:

  • "المفرطون في التفكير": عندما يخطئ الذكاء الاصطناعي في الإجابة، فإنه غالباً ما يتحدث أكثر مما يفعل عندما يصيب. كان الأمر يشبه طالباً يهذي بتوتر عندما لا يعرف الإجابة، آملاً أن يتعثر في الإجابة الصحيحة بالصدفة.
  • "انحياز الترتيب": إذا قام الباحثون بتغيير ترتيب إجابات الاختيار من متعدد (أ، ب، ج، د)، فإن بعض نماذج الذكاء الاصطناعي الصغيرة تصاب بالارتباك وتغير إجاباتها، حتى لو كان المحتوى هو نفسه. إنه يشبه طالباً يختار الإجابة "ج" لمجرد أنها في المنتصف، وليس لأنه يعرف الإجابة.
  • مشاكل "الأدوات": عندما أعطى الباحثون الذكاء الاصطناعي أداة حاسبة للمساعدة في الرياضيات، ساء أداء العديد من النماذج في الواقع. فإما تجاهلوا الحاسبة، أو استخدموها بشكل خاطئ، أو ارتبكوا بسبب التعليمات. الأمر يشبه إعطاء طباخ سكيناً جديداً، فيقوم بالخطأ بقطع المكون الخاطئ لأنه لم يعتد على الأداة الجديدة.

4. الصورة الكبيرة

الخلاصة الرئيسية هي أنه بينما يصبح الذكاء الاصطناعي جيداً جداً في المهام الطبية، إلا أنه ليس مثالياً بعد.

  • النماذج الرائدة (Frontier models) (الأحدث والأكبر) هي القائدة حالياً.
  • التدريب المتخصص يساعد، لكنه لا يضمن الفوز على النماذج الأكبر حجماً.
  • الكفاءة تمثل مشكلة كبيرة؛ فالنماذج المجانية غالباً ما تكون "مكلفة" للغاية من حيث وقت الحوسبة.
  • الموثوقية لا تزال قضية قائمة؛ إذ يمكن خداع النماذج بسهولة من خلال طريقة صياغة الأسئلة، أو قد ترتبك عند استخدام الأدوات.

لقد بنى المؤلفون MEDMARKS لتكون "لوحة صدارة حية". تماماً كما تُحدث الدوريات الرياضية ترتيبها كل أسبوع، تم تصميم هذا المعيار لاختبار نماذج الذكاء الاصطناعي الجديدة باستمرار فور إصدارها، لضمان معرفة من هو "أفضل" ذكاء اصطناعي طبي حالياً، وأين تكمن نقاط ضعفهم بالضبط. لقد جعلوا جميع أكوادهم وبياناتهم عامة لكي يتمكن أي شخص من تشغيل الاختبارات والتحقق من النتائج، مما يجلب الشفافية إلى هذا المجال.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →