← أحدث الأبحاث
💬 NLP

How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

تقدم هذه الورقة البحثية BanglaMedVQA، وهي أول مجموعة بيانات ومعيار معتمد سريريًا للإجابة على الأسئلة البصرية الطبية باللغة البنغالية، والتي كشفت أن النماذج التأسيسية الرائدة حاليًا، بما في ذلك Gemini وGPT-4.1 mini، تؤدي بشكل ضعيف للغاية في المهام التشخيصية المتخصصة بسبب التحديات المتأصلة في اللغات ذات الموارد المنخفضة والاستدلال الطبي المعقد.

المؤلفون الأصليون: Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مجموعة من الروبوتات الذكية جداً والمثقفة (التي تُسمى نماذج الذكاء الاصطناعي) وهي بارعة في النظر إلى الصور والإجابة عن الأسئلة المتعلقة بها. لقد علمتهم التحدث باللغة الإنجليزية بطلاقة، ويمكنهم حتى وصف صورة لعظمة مكسورة أو ورم بدقة جيدة.

ولكن ماذا يحدث إذا سألتهم نفس الأسئلة بلغة البنغالية، وهي لغة يتحدث بها ما يقرب من 300 مليون شخص؟ هذا هو بالضبط ما تبحث فيه هذه الورقة البحثية.

إليك قصة نتائجهم، مقسمة إلى أجزاء بسيطة:

1. قطعة اللغز المفقودة

لفترة طويلة، كان العلماء يختبرون هذه الروبوتات الذكية على الصور الطبية باللغة الإنجليزية. لديهم مجموعات اختبار ضخمة وعالية الجودة للغة الإنجليزية. ولكن بالنسبة للبنغالية؟ لم يكن هناك شيء تقريباً. كانت هناك مجموعة بيانات قديمة واحدة، لكنها كانت تشبه لغزاً بقطع مفقودة وصور ضبابية — لم يكن أحد يعرف ما إذا كانت الإجابات صحيحة بالفعل أو ما إذا كان قد راجعها طبيب.

قرر مؤلفو هذه الورقة بناء مجموعة اختبار جديدة وعالية الجودة تسمى BanglaMedVQA.

  • المكونات: أخذوا آلاف الصور الطبية (مثل الأشعة السينية والأشعة المقطعية) من قاعدتي بيانات إنجليزيتين مشهورتين وموثوقتين.
  • الوصفة: استخدموا ذكاءً اصطناعياً متطوراً لترجمة الأسئلة والأجوبة الطبية إلى اللغة البنغالية.
  • ضبط الجودة: هذا هو الجزء الأهم. لم يكتفوا بالثقة في الكمبيوتر، بل استعانوا بـ طبيبين حقيقيين معتمدين لفحص كل سؤال وجواب. إذا قال الأطباء: "لا، هذا خطأ"، فكان يتم إصلاحه. والنتيجة كانت مجموعة بيانات بمعدل دقة 97%، تم التحقق منها بواسطة بشر.

2. الاختبار الكبير: ما مدى ذكاء الروبوتات؟

وضع المؤلفون أفضل روبوتات الذكاء الاصطناعي (سواء تلك المدفوعة والمغلقة المصدر مثل Gemini من Google و GPT من OpenAI، أو تلك المجانية ومفتوحة المصدر) تحت اختبار البنغالية الجديد هذا.

كانت النتائج مفاجئة ومخيفة بعض الشيء:

  • الأسئلة "العامة": عندما سُئلوا عن أشياء بسيطة مثل، "ما نوع هذه الصورة؟" (هل هي أشعة سينية أم أشعة مقطعية؟) أو "أي جزء من الجسم هذا؟" (هل هو رئة أم دماغ؟)، كان أداء الروبوتات مقبولاً. فقد حصلوا على حوالي 40% من الإجابات الصحيحة.
  • الأسئلة "التخصصية": عندما أصبحت الأسئلة أصعب — مثل، "ما هو هذا المرض المحدد؟" أو "أين يقع الورم بالضبط في الرئة؟" — انهارت الروبوتات.
    • حتى أفضل الروبوتات (Gemini و GPT) كان أداؤها أسوأ من التخمين العشوائي في هذه الأسئلة الصعبة. كان الأمر كما لو أنهم يرمون السهام على لوحة ويأملون في إصابة الهدف بالصدفة.
    • أما الروبوتات المجانية مفتوحة المصدر فكان أداؤها أسوأ بكثير، حيث حصلت غالباً على أقل من 10% من الإجابات الصحيحة.

3. حاجز اللغة

اختبر الباحثون أيضاً الروبوتات باللغة الإنجليزية باستخدام نفس الأسئلة.

  • الفجوة: كان أداء الروبوتات في الإنجليزية أفضل بكثير منه في البنغالية. الأمر يشبه طالباً يحصل على تقدير ممتاز في حصة اللغة الإنجليزية، ولكنه يرسب في نفس الاختبار عند ترجمته إلى لغة يكاد يفهمها بصعوبة.
  • الخلاصة: لم يتم تدريب الروبوتات بما يكفي على المعرفة الطبية باللغة البنغالية. إنهم متعلمون "منخفضو الموارد" في هذه اللغة.

4. هل يمكننا مساعدتهم على التفكير بشكل أفضل؟

جرب الباحثون حيلة تسمى "سلسلة الأفكار" (Chain-of-Thought). بدلاً من طلب الإجابة من الروبوت فوراً، أخبرتموه: "دعنا نفكر خطوة بخوة قبل أن تجيب".

  • هل نجح الأمر؟ نعم، ولكن قليلاً فقط. لقد ساعد ذلك الروبوتات على التفكير بشكل أفضل قليلاً، خاصة النسخ المجانية منها، لكنه لم يحل المشكلة الأساسية. فما زالوا يعانون في تحديد مكان المرض بدقة أو تحديد الحالة النوعية.
  • العقبة: تشير الورقة إلى أن المشكلة الرئيسية ليست مجرد اللغة؛ بل هي أن الروبوتات لا "ترى" التفاصيل الطبية في الصورة بشكل جيد بما يكفي لتشرحها باللغة البنغالية.

5. الخلاصة النهائية

هذه الورقة هي بمثابة صرخة استيقاظ.

  • الوضع الحالي: لقد بنينا مجموعة اختبار عالية الجودة ومراجعة من قبل أطباء للذكاء الاصطنا الطبي باللغة البنغالية.
  • الواقع: حتى أكثر نماذج الذكاء الاصطناعي تقدماً اليوم ليست جاهزة ليتم الوثوق بها في التشخيصات الطبية المعقدة باللغة البنغالية. إنها جيدة في وصف الصورة بشكل عام، لكنها تفشل في المهمة الحاسمة المتمثلة في تشخيص المريض.
  • المستقبل: نحن بحاجة إلى بناء نماذج أفضل وتدريبها خصيصاً على البيانات الطبية باللغة البنغالية قبل أن نتمكن من استخدامها في مستشفى حقيقي.

باختصار: الروبوتات تشبه طلاب الطب الذين حفظوا كتاباً مدرسياً باللغة الإنجليزية، لكنهم حالياً يرسبون في امتحانهم النهائي عندما يُطلب منهم تشخيص مريض باللغة البنغالية. لقد وضعنا ورقة الامتحان (مجموعة البيانات) لإثبات ذلك، وتظهر الدرجات أن أمامنا طريقاً طويلاً لنقطعه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →