← أحدث الأبحاث
📄 pharmacology and therapeutics

Biomedical Large Language Models and Prompt Engineering for Causality Assessment of Individual Case Safety Reports in Pharmacovigilance

قيمت هذه الدراسة أداء نماذج اللغات الكبيرة الطبية الحيوية عند دمجها مع استراتيجيات صياغة أوامر محددة وخوارزميات السببية على 150 تقريراً لحالات السلامة الفردية، ووجدت أنه بينما حقق نموذج Medicine LLaMA-3 8B مع استراتيجية "سلسلة الأفكار" أعلى نسبة توافق مع الخبراء البشريين (64%)، إلا أن هذه النماذج تظل دون المستوى الأمثل للتقييم الموثوق للسببية على المستوى الفردي في مجال اليقظة الدوائية.

المؤلفون الأصليون: Heckmann, N. S., Papoutsi, D. G., Barbieri, M. A., Battini, V., Molgaard, S. N., Schmidt, S. O., Melskens, L., Sessa, M.

نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Heckmann, N. S., Papoutsi, D. G., Barbieri, M. A., Battini, V., Molgaard, S. N., Schmidt, S. O., Melskens, L., Sessa, M.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز: هل تسبب دواء معين في رد فعل سيئ للمريض، أم كان الأمر مجرد مصادفة؟

في عالم الطب، يسمى هذا تقييم السببية (Causality Assessment). وهي وظيفة حيوية؛ فإذا كان الدواء خطيرًا، فنحن بحاجة لمعرفة ذلك لتحذير الجمهور، وإذا كان آمنًا، فلا نريد إثارة الذعر دون داعٍ.

تقليديًا، يقوم بهذه المهمة خبراء بشريون (مثل كبار الأطباء والصيادلة) الذين يقرأون تقارير المرضى الفوضوية وغير المكتملة، ويسألون أنفسهم قائمة من الأسئلة: هل حدث رد الفعل مباشرة بعد تناول الحبة؟ هل توقف عند التوقف عن تناول الحبة؟ هل هناك تفسير آخر؟

هذه الورقة البحثية تتحدث عن تجربة جديدة: هل يمكننا تعليم كمبيوتر فائق الذكاء (ذكاء اصطناعي) ليكون هذا المحقق؟

التجربة: محققو الذكاء الاصطناعي

لم يستخدم الباحثون أي كمبيوتر فحسب، بل استخدموا نماذج لغوية كبيرة طبية (Biomedical LLMs). فكر في هذه النماذج كـ "محققين قرأوا كل الكتب الطبية في المكتبة"، بدلاً من الذكاء الاصطناعي العام الذي قرأ الإنترنت بأكمله (والذي يتضمن الكثير من الهراء).

لقد اختبروا خمسة فرق تحقيق مختلفة، كل منها يتكون من:

  1. نموذج الذكاء الاصطناعي: ثلاثة "أدمغة" مختلفة (TinyLlama، وMedicine LLaMA-3، وMedLLaMA).
  2. استراتيجية التوجيه (Prompt Strategy): كيف يطلبون من الذكاء الاصطناعي التفكير. هل يقولون له "خمن فقط"؟ أم "فكر خطوة بخطوة كالبشر" (سلسلة الأفك - Chain-of-Thought)؟ أم "جزئ المشكلة إلى قطع صغيرة" (التفكيك - Decomposition)؟
  3. كتاب القواعد: مجموعتان مختلفتان من القوائم الرسمية التي يستخدمها الأطباء الحقيقيون (مقياس نارانجو Naranjo Scale وطريقة منظمة الصحة العالمية UMC-WHO).

لقد أعطوا فرق الذكاء الاصطناعي هذه 150 حالة واقعية (بعضها لأدوية عادية، وبعضها للقاحات) وطلبوا منهم حل الحالات. ثم قارنوا إجابات الذكاء الاصطناعي بإجابات خبيرين بشريين حقيقيين.

النتوات: الجيد، والسيئ، و"الوشيك"

1. ميزة "كلية الطب"
أدت نماذج الذكاء الاصطناعي المدربة خصيصًا على الكتب الطبية أداءً أفضل بكثير من نماذج الذكاء الاصطناعي العامة. الأمر يشبه مقارنة محقق قرأ "موسوعة الجريمة" بآخر قرأ "ويكيبيديا" فقط. حقق الذكاء الاصطناعي الطبي نسبة توافق بلغت 64% مع الخبراء البشريين، وهي قفزة كبيرة من نسبة الـ 34% توافق التي سجلها الذكاء الاصطنا_العام في دراسات سابقة.

2. "الخطوة بخطوة" مقابل "القصة"
أدى الذكاء الاصطناعي أداءً جيدًا بشكل مفاجئ عند استخدام قاعدة نارانجو (Naranjo Rulebook). هذا الكتاب يشبه اختبار الرياضيات: "السؤال 1: نعم/لا. السؤال 2: نعم/لا. اجمع النقاط". كان الذكاء الاصطناعي جيدًا في اتباع هذه الخطوات الصارمة.
ومع ذلك، واجه الذكاء الاصطناعي صعوبة مع قاعدة منظمة الصحة العالمية (WHO Rulebook). هذه القاعدة تشبه كتابة مقال أو سرد قصة عن المريض. ارتبك الذكاء الاصطناعي، وغالبًا ما قدم إجابات لا تتطابق على الإطلاق مع الخبراء البشريين. يبدو أن الذكاء الاصطناعي بارع في الرياضيات أكثر من براعته في كتابة قصة طبية متماسكة.

3. مشكلة "الهلوسة"
حتى أفضل فريق ذكاء اصطناٍ جعل أخطاءً:

  • تأثير "الصدى": أحيانًا، يقوم الذكاء الاصطناعي بمجرد تكرار السؤال عليك بدلًا من الإجابة عليه (مثل الببغاء).
  • تأثير "الخطأ الواثق": إذا كان تقرير المريض يفتقر إلى المعلومات، فإن الخبير البشري سيقول: "لا أعرف". أما الذكاء الاصطناعي، فسيخمن إجابة بكل ثقة. إنه مثل طالب في امتحان لا يعرف الإجابة، لكنه يكتب فقرة طويلة وواثقة على أي حال.
  • "الحلقة المفقودة": كان الذكاء الاصطناعي سيئًا في التحقق مما إذا كان العرض الجانبي مدرجًا رسميًا في دليل الدواء (لأن الذكاء الاصطناعي لم يكن لديه وصول إلى ذلك الدليل المحدد أثناء الاختبار)، كما كان سيئًا في اكتشاف ما إذا كان مرض آخر قد تسبب في المشكلة.

الخلاصة الكبرى

هل يمكننا استبدال الأطباء البشريين بالذكاء الاصطناعي لهذه المهمة الآن؟ لا.

الذكاء الاصطناعي هو متدرب سريع جدًا ومطلع جدًا، لكنه ليس محققًا خبيرًا بعد.

  • إنه أسرع: يمكنه قراءة التقارير فورًا.
  • إنه واسع المعرفة: يعرف المصطلحات الطبية جيدًا.
  • لكنه يفتقر إلى القدرة على التقدير: لا يمكنه دائمًا التمييز بين الـ "ربما" والـ "بالتأكيد"، وأحيانًا يخترع أسبابًا لدعم إجابته.

المستقبل

يقترح المؤلفون أنه في المستقبل، لا ينبغي لنا فقط أن نطلب من الذكاء الاصطناعي "حل القضية". بدلاً من ذلك، يجب أن نستخدم نهجًا هجينًا:

  • دع الذكاء الاصطناعي يقوم بالعمل الشاق (قراءة التقارير، والتحقق من الحقائق).
  • دع الخبير البشري يتخذ القرار النهائي، مستخدمًا عمل الذكاء الاصطناعي كمساعد مفيد.

فكر في الأمر مثل نظام GPS مقابل السائق البشري. نظام الـ GPS (الذكاء الاصطناعي) رائع في معرفة الطرق وقواعد المرور، لكن السائق البشري (الخبير) لا يزال مطلوبًا لاتخاذ القرار النهائي عندما يصبح الطريق طينيًا أو عندما يكون الخريطة خاطئة.

باختصار: الذكاء الاصطناعي الطبي يصبح أفضل بكثير في كونه محققًا طبيًا، لكنه لا يزال بحاجة إلى شريك بشري لضمان أن يكون الحكم عادلًا، ودقيقًا، وآمنًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →