← أحدث الأبحاث
💬 NLP

MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers

تقدم هذه الورقة البحثية MedPT، وهو أول متن لغوي واسع النطاق وواقعي يضم 384,095 تفاعلاً بين المريض والطبيب باللغة البرتغالية البرازيلية، والذي تم تنسيقه والتحقق منه بدقة لإثبات فعاليته في تدريب نماذج ذكاء اصطناعي طبية عادلة ومدركة ثقافياً.

المؤلفون الأصليون: Fernanda Bufon Färber, Iago Alves Brito, Julia Soares Dollis, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fernanda Bufon Färber, Iago Alves Brito, Julia Soares Dollis, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالم الذكاء الاصطناعي (AI) في مجال الرعاية الصحية كمكتبة ضخمة من المعرفة الطبية. لفترة طويلة، كانت هذه المكتبة مليئة بشكل مفرط بالكتب المكتوبة باللغة الإنجليزية. إذا كنت تتحدث الإنجليزية، فإن الذكاء الاصطناعي يشبه طبيبًا بارعًا ومثقفًا يمكنه الإجابة على أي سؤال تقريبًا. ولكن إذا كنت تتحدث البرتغالية، وتحديدًا اللهجة البرازيلية المحددة، فإن المكتبة تكون فارغة في الغالب.

قرر الباحثون وراء هذه الورقة البحثية، MedPT، بناء جناح جديد ضخم لتلك المكتبة، مخصص خصيصًا للمتحدثين بالبرتغالية البرازيلية. وإليكم كيف فعلوا ذلك، مشروحًا ببساة:

1. المشكلة: "ترجمة جوجل" ليست كافية

قد تتساءل، "لماذا لا نأخذ الكتب الطبية الإنجليزية ونترجمها فقط؟"

  • التشبيه: تخيل أنك تحاول شرح كيفية إصلاح نوع معين من الأسطح البرازيلية باستخدام تعليمات مكتوبة لكوخ كندي مغطى بالثلوج. قد تكون الترجمة صحيحة لغويًا، لكنها تفتقر إلى الواقع المحلي.
  • الواقع: البرازيل لديها أمراض لا توجد في الولايات المتحدة أو أوروبا (مثل حمى الضنك أو داء شاغاس). كما أن لديها طرقًا فريدة لوصف الأعراض باستخدام العامية المحلية. الترجمة البسيطة تغفل هذه الفروق الثقافية والطبية الدقيقة، مما قد يؤدي إلى نصائح سيئة.

2. الحل: سجل محادثات "واقعي" ضخم

بدلاً من الترجمة، ذهب الفريق مباشرة إلى المصدر: Doctoralia، وهو موقع برازيلي شهير حيث يطرح المرضى الحقيقيون أسئلة حقيقية على أطباء حقيقيين.

  • المجموعة: جمعوا 384,095 محادثة فعلية. هذا يشبه الاستماع إلى كل محادثة في مستشفى مدينة صغيرة لمدة عام كامل.
  • النطاق: هذا ليس مجرد ملاحظات قليلة؛ إنه مجموعة بيانات ضخمة تحتوي على حوالي 57 مليون كلمة (توكنز).

3. التنظيف: عملية "منجم الذهب"

البيانات الخام من الإنترنت فوضوية. إنها تشبه منجم ذهب مليء بالأتربة والصخور والأدوات المكسورة. كان على الفريق تنظيفها للعثور على الذهب الخالص.

  • إزالة الضجيج: تخلصوا من الروابط المعطلة، والإجابات الفارغة، والأسئلة الغامضة جدًا (مثل كتابة "ألم؟" فقط دون تحديد مكانه).
  • إصلاح "السياق": أحيانًا يسأل المريض: "ما هو العلاج؟" دون ذكر ما يعاني منه. استخدم الفريق حيلة ذكية: نظروا إلى ملف المريض الشخصي لمعرفة المرض الذي يسأل عنه وأضافوا ذلك إلى السؤال. الآن، أصبحت جملة "ما هو العلاج؟" هي "ما هو العلاج لـ الشقيقة؟". لقد أنقذ هذا آلاف الأسئلة المفيدة التي كان سيتم حذفها.
  • النتيجة: انتهى بهم المطاف بمجموعة نقية وعالية الجودة مكونة من 384,095 زوج من الأسئلة والأجوبة المثالية.

4. التصنيف: تنظيم المكتبة

لجعل هذه البيانات مفيدة للذكاء الاصطناعي، احتاجوا إلى تنظيمها. استخدموا ذكاءً اصطناعيًا فائق الذكاء (نموذج لغوي كبير - LLM) لقراءة كل سؤال وإعطائه "وسمًا" أو "تصنيفًا".

  • الأوعية السبعة: قاموا بفرز كل سؤال في واحد من سبعة فئات، مثل:
    • التشخيص ("لدي طفح جلدي، ما هو؟")
    • العلاج ("كيف أعالج هذا الطفح؟")
    • نمط الحياة الصحي ("ماذا يجب أن آكل؟")
    • اختيار الطبيب ("من يجب أن أراجع؟")
    • وأربعة فئات أخرى.
      هذا يساعد الذكاء الاصطناائي ليس فقط على فهم ما هي الكلمات، بل ماذا يريد المستخدم فعليًا.

5. الاختبار: هل نجح الأمر؟

وضعوا هذه المجموعة الجديدة من البيانات تحت الاختبار. علموا نموذجًا حاسوبيًا (دماغًا رقميًا) أن ينظر إلى سؤال المريض ويخمن التخصص الطبي (مثل أمراض القلب، أو علم النفس، أو الأمراض الجلدية) الذي يجب أن يتولى الحالة.

  • النتيجة: حقق النموذج الذي تدرب على MedPT نسبة 94% من الصحة.
  • المقارنة: بدون هذه البيانات البرازيلية المحددة، حقق النموذج حوالي 60% فقط من الصحة.
  • الاستبصار: عندما ارتكب النموذج أخطاءً، لم تكن عشوائية. لقد خلط بين أشياء متشابهة طبيًا (مثل الخلط بين القلق والاكتئاب). هذا في الواقع علامة جيدة! هذا يعني أن الذكاء الاصطناعي يفكر كطبيب حقيقي يعرف أن هذه الحالات مرتبطة ببعضها البعض، بدلاً من مجرد التخمين العشوائي.

لماذا هذا مهم؟

MedPT يشبه إعطاء صوت لملايين المتحدثين بالبرتغالية الذين تم تجاهلهم سابقًا من قبل الذكاء الاصطناعي الطبي.

  • للمرضى: يعني أن برامج الدردشة الآلية (Chatbots) والتطبيقات الصحية المستقبلية ستفهم عاميتهم المحلية، وأمراضهم الخاصة، وسياقهم الثقافي.
  • للعالم: يثبت أنك لست بحاجة لمجرد نسخ العالم الإنجليزي لبناء تكنولوجيا رائعة. من خلال بناء شيء أصيل ومحلي، نحصل على أدوات أفضل وأكثر أمانًا ودقة للجميع.

باختصار: لقد بنوا قاموسًا ضخمًا، نظيفًا، وواعياً ثقافيًا للأسئلة الصحية البرازيلية، لكي يصبح الذكاء الاصطناعي أخيرًا طبيبًا محليًا مفيدًا للمتحدثين بالبرتغالية، وليس مجرد مترجم للمتحدثين بالإنجليزية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →