← أحدث الأبحاث
💬 NLP

Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond

تقيم هذه الورقة أداء ChatGPT عبر أربع مهام لاستخراج المعلومات الطبية، وتجد أنه بينما يقدم تفسيرات عالية الجودة ويظل أميناً للنصوص المصدرية، إلا أنه يقل أداءً مقارنة بالنماذج التي تم ضبطها بدقة ويعاني من الثقة المفرطة وعدم اليقين في التوليد.

المؤلفون الأصليون: Liz Li, Wei Zhu

نُشر 2026-02-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liz Li, Wei Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تشبيه "طبيب الامتياز العبقري لكن المهمل"

تخيل أن لديك طبيب امتياز جديد يُدعى ChatGPT.

إن ChatGPT مطلع بشكل مذهل؛ فقد قرأ كل الكتب الطبية، والأوراق البحثية، وسجلات المرضى التي كُتبت على الإطلاق. إذا سألته عن كيفية عمل القلب، فسيقدم لك محاضرة بديعة، شاعرية، وتفصيلية للغاية. إنه بارع في التواصل.

ومع ذلك، فإن هذه الورقة هي في الأساس "تقييم أداء" أجراه باحثون لمعرفة ما إذا كان ChatGPT يستطيع حقاً القيام بالعمل الدقيق والمضني لموظف السجلات الطبية — وتحديداً، استخراج المعلومات الطبية (MedIE). وهذه هي الوظيفة: قراءة ملاحظة طبية غير منظمة واستخراج حقائق محددة: "ما هو المرض؟ ما الدواء الذي أُعطي؟ وما هي الجرعة؟"

إليك تفاصيل التقييم:


1. الأداء: "الطالب الذكي الذي يرسب في الاختبار"

النتيجة: دقة ChatGPT أقل بكثير من النماذج المتخصصة "المعدلة بدقة" (النماذج التي تم تدريبها فقط على البيانات الطبية).

التشبيه: تخيل طالباً عبقرياً في الأدب العام، لكنه يخوض امتحاناً جراحياً متخصصاً للغاية. هو يفهم لغة الامتحان، لكنه يستمر في إغفال التفاصيل التقنية الصغيرة. بينما النموذج الطبي المتخصص يشبه جراحاً يتمتع بخبرة 20 عاماً، فإن ChatGPT يشبه طالباً ذكياً جداً "يرتجل" بناءً على معرفة عامة. هو جيد في المهام البسيطة (مثل تحديد مرض أساسي)، لكنه يتعثر في المهام المعقدة (مثل رسم مسار كيفية ارتباط عرض معين بدواء معين).

2. القابلية للتفسير: "الحكواتي الواثق"

النتيجة: عندما يتخذ ChatGPT قراراً، يمكنه شرح سبب اتخاذه لهذا القرار بطريقة تبدو مقنعة للغاية.

التشبيه: إذا سألت المتدرب: "لماذا صنفت هذا كعرض مرضي؟"، فلن يكتفي بالقول "لأنني قلت ذلك". بل سيقدم لك سبباً منطقياً وخطوات استنتاجية. ما المشكلة؟ حتى عندما يكون مخطئاً تماماً، فإنه يشرح خطأه ببراعة وثقة تجعلك تصدقه بالفعل. إنه "يهلوس" بالمنطق؛ أي أنه يسرد قصة مقنعة جداً حول خطأ ما.

3. الثقة مقابل الواقع: "المتدرب المفرط في الثقة"

النتيطة: يعاني ChatGPT من "الإفراط في الثقة". فهو يعطي درجات ثقة عالية لكل من إجاباته الصحيحة وإجاباته الخاطئة على حد سواء.

التشبيه: تخيل متدرباً يدخل الغرفة ويقول: "أنا متأكد بنسبة 99% أن هذا المريض يعاني من السكري من النوع الثاني"، بينما هو في الواقع مجرد تخمين. في الطب، هذا أمر خطير. الطبيب الجيد يجب أن يقول: "أعتقد أنه سكري، لكني متأكد بنسبة 60% فقط؛ دعونا نجرِ المزيد من الفحوصات". يفتقر ChatGPT إلى هذا "الشك الذاتي" (المعايرة)، مما يجعل من الصعب معرفة متى يمكن الوثوق به.

4. الأمانة: "المستمع الجيد"

النتيجة: ChatGPT جيد جداً في اتباع التعليمات والالتزام بالنص المقدم.

التشبيه: رغم عيوبه الأخرى، إلا أن المتدرب مستمع جيد. إذا أعطيته قائمة محددة من الفئات للبحث عنها، فإنه يلتزم بتلك القائمة عادةً. هو لا يبدأ عادةً في اختراع مصطلحات طبية عشوائية لم تكن موجودة في الملاحظة الأصلية. إنه "أمين" للمادة المصدر.

5. عدم اليقين: "العامل القلق"

النتيطة: بسبب الطريقة التي يولد بها ChatGPT النصوص، يمكن أن يكون غير متسق. إذا سألته نفس السؤال خمس مرات، فقد تحصل على إجابات مختلفة قليلاً.

التشبيه: الأمر يشبه متدرباً "قلقاً" أو "متردداً". إذا طلبت منه تنظيم خزانة ملفات، فقد ينظمها بطريقة في الساعة 9:00 صباحاً، ولكن بحلول الساعة 9:05، قد يكون قد غير النظام قليلاً. هذا التذبذب (عدم اليقين) يجعل من الصعب استخدامه في إدخال البيانات الطبية عالية الخطورة التي تتطلب الدقة في كل مرة.


الخلاصة

يقول الباحثون: ChatGPT محاور رائع، لكنه موظف سجلات طبية مهزوز.

إنه بارع في شرح الأشياء، لكنه مفرط في الثقة عندما يكون مخطئاً، وغير متسق عندما يعمل، وليس دقيقاً بما يكفي مقارنة بالأدوات الطبية المتخصصة. في الوقت الحالي، لا ينبغي لنا أن نترك هذا "المتدرب" يتولى السجلات الطبية الرسمية دون أن يراقبه "طبيب استشاري" خبير من فوق كتفه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →