PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark
تقدم هذه الورقة PersianMedQA، وهي مجموعة بيانات ضخمة ثنائية اللغة تضم 20,785 سؤالاً من امتحانات طبية باللغة الفارسية تم التحقق منها من قبل خبراء، لتقييم 41 نموذجاً لغوياً كبيراً من أحدث النماذج، وتكشف أنه بينما تتفوق النماذج العامة ذات الأوزان المغلقة على النماذج الفارسية المتخصصة، فإن الفروق الثقافية والسريرية الدقيقة في اللغة الأصلية تظل بالغة الأهمية للاستنتاج الطبي الدقيق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم مجموعة من الطلاب كيف يصبحون أطباء، ولكن عليك اختبارهم بلغتين مختلفتين: الفارسية (لغتهم الأم) والإنجليزية (لغة معظم الكتب الطبية).
هذه الورقة البحثية، التي تسمى PersianMedQA، تشبه أرشيفاً ضخماً للامتحانات يمتد لـ 14 عاماً من إيران. وهي تحتوي على أكثر من 20,000 سؤال من نوع الاختيار من متعدد تغطي 23 تخصصاً طبياً مختلفاً، من جراحة القلب إلى طب الأطفال. استخدم المؤلفون هذا "بنك الامتحانات" ليروا مدى قدرة نماذج الذكاء الاصطناعي المختلفة (النماذج اللغوية الكبيرة) على الإجابة على الأسئلة الطبية بكلتا اللغتين.
إليك تفصيل لما وجدوه، باستخدام بعض التشبيهات البسيطة:
1. "الطلاب النجوم" مقابل "المحليين المتعثرين"
اختبر الباحثون 41 نموذجاً مختلفاً من نماذج الذكاء الاصطنا.
- "النجوم الخارقون" (النماذج المغلقة): كان الأداء الأعلى من نصيب الطلاب الذين يشبهون طلاب المدارس الخاصة المرموقة الذين يمتلكون أفضل الموارد. وتحديداً، حقق نموذج GPT-4.1 (نموذج مغلق ومدفوع) حوالي 83% من الأسئلة الفارسية بشكل صحيح و80% من الأسئلة الإنجليزية. لقد كان الفائز الواضح.
- "الأبطال المحليون" (النماذج الفارسية): فوجئ المؤلفون بأن النماذج المصممة خصيصاً للتحدث بالفارسية (مثل Dorna) كان أداؤها سيئاً للغاية. فقد سجلت حوالي 35%، وهو ما يكاد لا يتجاوز التخمين. الأمر يشبه طالباً نشأ وهو يتحدث اللغة، لكنه نسي كيف يقرأ الكتب الطبية بنفس تلك اللغة. لقد عانوا في اتباع التعليمات ولم يتمكنوا من التفكير المنطقي في المشكلات.
- "الطلاب المتخصصون" (النماذج الطبية): النماذج التي تم تدريبها خصيصاً على البيانات الطبية لم تكن جيدة بقدر "النجوم الخارقين" العامين. فكون النموذج "ذكاءً اصطناعياً طبياً" لم يجعله بالضرورة أفضل في الأسئلة الطبية الفارسية.
2. "فخ الترجمة"
قد تعتقد: "إذا كان الذكاء الاصطناعي ذكياً بالإنجليزية، فببساطة ترجم الأسئلة الفارسية إلى الإنجليزية، وسيعمل الأمر".
- الواقع: وجدت الورقة أنه بينما يؤدي الذككاء الاصطناعي بشكل أفضل عموماً بالإنجليزية، إلا أن 3% إلى 10% من الأسئلة لا يمكن الإجابة عليها بشكل صحيح إلا بالفارسية.
- التشبيه: تخيل وصفة طعام تقول: "أضف رشة من الزعفران". إذا ترجمتها إلى الإنجليزية، ستقول فقط "Saffron". لكن في السياق الفارسي الأصلي، قد تشير الوصفة إلى نوع محدد من الزعفران يُزرع في قرية إيرانية معينة ويكون أرخص وأكثر شيوعاً هناك. إذا ترجمت السؤال، ستفقد هذا السياق المحلي.
- النتيجة: في بعض الحالات، أجاب الذكاء الاصطناعي بشكل صحيح بالفارسية لأنه فهم القواعد المحلية (مثل اللقاحات التي تُعطى في أعمار معينة في إيران)، لكنه أخطأ في الإنجليزية لأن الترجمة جعلت الأمر يبدو وكأنه قاعدة غربية.
3. "الأكبر ليس دائماً الأفضل"
تحقق الباحثون مما إذا كان جعل "دماغ" الذكاء الاصطناعي أكبر (زيادة عدد المعلمات/Parameters) يساعد.
- النتيجة: بالنسبة لنماذج "النجوم الخارقين" العامة، كان الأكبر هو الأفضل. ولكن بالنسبة للنماذج الطبية أو الفارسية المتخصصة، لم يساعد مجرد جعلها أكبر في تحسين الأداء. الأمر يشبه إعطاء طالب حقيبة ظهر أكبر؛ إذا لم تكن الكتب الصحيحة بداخلها، فلن تجعل الحقيبة الأكبر الطالب أكثر ذكاءً. هم بحاجة إلى البيانات الصحيحة، وليس مجرد المزيد منها.
4. "اختبار الغش"
لمعرفة ما إذا كان الذكاء الاصطناعي يفكر حقاً أم أنه مجرد يخمن بناءً على الأنماط، حاول الباحثون حيلة: عرضوا على الذكاء الاصطناعي خيارات الإجابة فقط دون السؤال.
- النتيجة: في قسم "الأخلاقيات الطبية"، حصل الذكاء الاصطناعي على درجات عالية بشكل مفاجئ بمجرد النظر إلى الإجابات. لقد تعلم أن الإجابات التي تحتوي على كلمات مثل "استقلالية المريض" أو "الموافقة" هي عادةً الإجابات الصحيحة. كان الأمر أشبه بطالب لم يذاكر الدرس، لكنه عرف أنه إذا بدت الإجابة مهذبة ورسمية جداً، فمن المرجح أن تكون هي الإجابة الصحيحة. وهذا يشير إلى أن الاختبارات قد تبالغ في تقدير مدى فهم الذكاء الاصطناعي الفعلي للأخلاقيات.
5. "تجربة العمل الجماعي"
بما أنه لا يوجد نموذج واحد مثالي، حاول الباحثون جعل أفضل 3 أو 5 نماذج تصوت على الإجابة معاً (مثل هيئة المحلفين).
- النتيجة: ساهم هذا النهج "الجماعي" في تحسين درجات النماذج مفتوحة المصدر قليلاً، لكنه لم يستطع اللحاق بنموذج "النجم الخارق" الوحيد (GPT-4.1).
الخلاصة
تخلص الورقة إلى أنه لا يمكنك ببساطة ترجمة الامتحانات الطبية من الإنجليزية إلى لغات أخرى وتوقع أن يعمل الذكاء الاصطناعي بشكل جيد.
- المعرفة الطبية مرتبطة بعمق بالثقافة والقواني والعادات المحلية (مثل جداول التطعيم).
- نماذج الذكاء الاصطناعي الحالية، حتى تلك المدربة على الفارسية، ليست موثوقة بما يكفي بعد ليتم الوثوق بها في الأسئلة الطبية عالية الخطورة بهذه اللغة.
- نحن بحاجة إلى بناء ذكاء اصطناعي أفضل، مدرك ثقافياً، مخصص للغات ذات الموارد المحدودة، بدلاً من مجرد ترجمة النماذج الإنجليزية.
ملاحظة هامة من المؤلفين: تنص الورقة صراحة على أن هذه النماذج ليست جاهزة لاستخدامها كأطباء حقيقيين. إنها حالياً تخضع للاختبار فقط على أسئلة الامتحانات، ولا ينبغي نشرها في المستشفيات الحقيقية دون إشراف بشري صارم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.