Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة الحالية تفشل في تحقيق موثوقية مماثلة لموثوقية المتخصصين الطبيين بين المقيمين عند استخراج المعلومات السريرية المهيكلة من السجلات الصحية الإلكترونية الخاصة بمرضى الأنف والأذن والحنجرة، مما يشير إلى أنها تعد مناسبة بشكل أفضل لعمليات الاستخراج الأولي للبيانات التي تتطلب تحققاً بشرياً بدلاً من النشر السريري المستقل.
المؤلفون الأصليون:Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.
المؤلفون الأصليون: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.
تنتج المستشفيات اليوم محيطاً هائلاً من السجلات المكتوبة. فكل زيارة للمريض، وكل نتيجة فحص، وكل قرار علاجي يتم تدوينه في ملاحظات رقمية تُعرف بالسجلات الصحية الإلكترونية. هذه الوثائق غنية بالتفاصيل، حيث تحتوي على اللغة المحددة التي يستخدمها الأطباء لوصف الأعراض، وتشخيص الحالات، وتخطيط الرعاية. ولعقود من الزمن، كان تحويل هذه القصص غير المنظمة إلى بيانات منظمة وقابلة للبحث مهمة صعبة، تتطلب غالباً من البشر قراءة المعلومات وإعادة كتابتها يدوياً. ومؤخراً، ظهر نوع جديد من البرامج الحاسوبية يُسمى "النموذج اللغوي الكبير". لقد تم تدريب هذه الأنظمة على كميات هائلة من النصوص، وهي قادرة على قراءة وفهم وتلخيص لغة البشر بطلاقة مدهشة. وقد أظهرت قدرتها على الإجابة عن الأسئلة الطبية واجتياز امتحانات الترخيص، مما جعل الكثيرين يتساءلون عما إذا كان بإمكانها أيضاً قراءة سجلات المرضى واستخراج الحقائق الحيوية الموجودة بداخلها تلقائياً.
هذا السؤال لا يتعلق فقط بتوفير الوقت؛ بل يتعلق بالسلامة والدقة. فإذا كان الحاسوب سيساعد الأطباء في إدارة رعاية المرضى، فيجب أن يجد المعلومات الصحيحة دون اختلاق أشياء أو إغفال تفاصيل حاسمة. وقد وضعت دراسة جديدة اختباراً لهذه القدرة بشكل مباشر. حيث جمع الباحثون ما يقرب من مائة سجل حقيقي لمرضى من عيادات الأنف والأذن والحنجرة، وطلبوا من أطباء بشريين وسبعة نماذج لغوية كبيرة مختلفة قراءتها. كانت المهمة هي استخراج حقائق محددة، مثل عمر المريض، وأعراضه، وتشخيصه، والعلاجات التي تلقاها. ولضمان أن الجميع يتحدثون اللغة ذاتها، اشترط الباحثون ترجمة كل معلومة إلى رمز معياري يُستخدم في المستشفيات بجميع أنحاء العالم. وقد سمح هذا بإجراء مقارنة دقيقة لمدى جودة أداء الآلات مقارنة بالبشر.
كشفت النتائج عن فجوة واضحة بين الخبرة البشرية والذكاء الاصطعي الحالي. فعندما قرأ الأطباء الأربعة عشر في الدراسة نفس السجلات، اتفقوا مع بعضهم البعض حول المعلومات المستخرجة بنسبة 81 بالمائة من الوقت. وقد أظهر هذا المستوى العالي من الاتفاق أن الأطباء كانوا يفسرون الملاحظات بشكل متسق. ومع ذلك، عندما تمت مقارنة النماذج الحاسوبية بالأطباء، انخفض الاتفاق بشكل كبير إلى حوالي 66 بالمائة. وبعبارة أخرى، لم تكن الآلات بعد بمستوى موثوقية البشر في تحديد نفس الحقائق من النص نفسه. وقد اختبرت الدراسة نماذج ذات أحجام مختلفة، من الأنظمة الضخمة التي تحتوي على مئات المليارات من الروابط إلى النماذج الأصغر التي يمكن تشغيلها على أجهزة الكمبيوتر المحلية. ولم يصل أي منها إلى مستوى الاتساق الذي أظهره المتخصصون الطبيون.
وقد تباين الأداء اعتماداً على نوع المعلومات التي يتم استخراجها. فقد كانت النماذج جيدة جداً في إيجاد العلاجات ونتائج الفحوصات، والتي غالباً ما تُكتب بطرق واضحة ومعيارية. وكانت أقل نجاحاً في التعامل مع العلامات والتشخيصات، التي تتطلب غالباً فهماً أعمق للسياق السريري. ومن المثير للاهتمام أن الحواسيب كانت تميل إلى إيجاد معلومات أكثر مما فعل الأطباء، لا سيما فيما يتعلق بعوامل الخطر. وبينما يركز الأطباء غالباً على المشكلة المباشرة، يبدو أن النماذج كانت ترصد كل خطر محتمل ذُكر في النص. وهذا يشير إلى أن الآلات لا تقوم فقط بنسخ السلوك البشري، بل تعالج النص بطريقة مختلفة، فهي أحياناً تلتقط تفاصيل قد يغفل عنها البشر، ولكنها قد تشير أيضاً إلى أمور ليست ذات صلة سريرية.
وعلى الرغم من هذه الاختلافات، أظهرت الآلات أنها يمكن أن تكون أدوات مفيدة إذا استُخدمت بشكل صحيح. فقد وجدت الدراسة أنه عندما يحدد النموذج معلومة ما، فإنه عادة ما يكون مصيباً، بنسبة دقة بلغت 97 بالمائة. وهذا يعني أنها نادراً ما تخترع حقائق غير موجودة. ومع ذلك، فقد أغفلت بعض المعلومات في حوالي 15 بالمائة من الحالات. ويشير هذا النمط إلى دور محدد لهذه الأدوات في المستقبل: فهي الأنسب لتعمل كـ "مسحة أولية"، حيث تقوم بمسح السجلات بسرعة لاستخراج المرشحين المحتملين ليقوم الطبيب بمراجعتهم. وسيظل القرار النهائي والتحقق من الصحة من اختصاص البشر. وقد خلص الباحثون إلى أنه على الرغم من قوة هذه النماذج، إلا أنها ليست جاهزة بعد للعمل بمفردها في بيئة سريرية. بل من الأفضل النظر إليها كأدوات مساعدة يمكنها المساعدة في تنظيم فيض البيانات الطبية، بشرط وجود خبير بشري دائماً لمراجعة عملها.
ملخص تقني: تقييم النماذج اللغوية الكبيرة في استخراج المعلومات السريرية من السجلات الصحية الإلكترونية لتخصص الأنف والأذن والحنجرة
بيان المشكلة بينما أظهرت النماذج اللغوية الكبيرة (LLMs) كفاءة في تقييمات المعرفة الطبية (مثل امتحانات الترخيص)، فإن قدرتها على استخراج معلومات سريرية مهيكلة ومعيارية من السجلات الصحية الإلكترونية (EHRs) الواقعية لا تزال غير مؤكدة. وتحديداً، هناك نقص في التقييم الصارم فيما يتعلق بما إذا كانت النماذج اللغوية الكبيرة يمكنها تحقيق موثوقية بين المقيّمين تضاهي المتخصصين الطبيين عند معالجة السرديات السريرية غير المهيكلة. يشكل هذا عدم اليقين عائقاً أمام نشر الذكاء الاصطناعي في سير عمل التوثيق السريري، لا سيما في المجالات المتخصصة مثل رعاية الأنف والأذن والحنجرة (ENT)، حيث تعد المصطلحات المعقدة والحاجة إلى التنميط الظاهري العميق أمراً بالغ الأهمية.
المنهجية استخدمت الدراسة تصميماً مستعرضاً لتقييم أداء سبعة نماذج لغوية كبيرة مقابل أربعة عشر متخصصاً طبياً مؤهلاً (مؤلفو الدراسة) في استخراج البيانات السريرية من 98 سجلاً صحياً إلكترونياً متاحاً للعموم ومجهول الهوية تم الحصول عليها من MTSamples.
مجموعة البيانات والترميز: تكونت مجموعة البيانات من 98 وثيقة سريرية خاصة بالأنف والأذن والحنجرة. غطت عمليات الترميز سبع فئات: الخصائص الاجتماعية والديموغرافية، العلامات، الأعراض، التشخيصات، العلاجات، عوامل الخطر، ونتائج الاختبارات.
التقييس: لضمان مقارنة موضوعية، تم ربط جميع الكيانات المستخرجة بأكواد SNOMED-CT (نسخة قاعدة بيانات المملكة المتحدة 39.0.0). قدم المقيّمون النص الدقيق، والسياق، والواصفات (مثل الجانب/الجهة، وحالة الوجود).
النماذج التي تم تقييمها: تم اختبار سبعة نماذج لغوية كبيرة، تمثل بنيات وأنماط نشر مختلفة:
السحابة مفتوحة المصدر (Open-Source Cloud): Llama 3.1 (405B, 70B, 8B).
النشر المحلي (Local Deployment): Gemma 3 (12B).
استخدمت جميع النماذج استراتيجية "سلسلة الأفكار" (chain-of-thought) المكونة من خمس خطوات مع تعلم من نموذج واحد (one-shot learning) وضوابط صارمة للمعاملات (بذرة عشوائية ثابتة، وأخذ عينات حتمي).
التحليل الإحصائي:
الموثوقية: تم قياس الاتفاق بين المقيّمين باستخدام معامل كوهين كابا (κ).
اختبار الفرضيات: تم استخدام النمذجة الهرمية البايزية لاختبار عدم الدونية. اختبرت الدراسة ما إذا كان الاتفاق بين المتخصصين الطبيين والنماذج اللغوية الكبيرة (Medic-LLM) غير أدنى من الاتفاق بين المتخصصين الطبيين (Medic-Medic). تم تقييم هوامش عدم الدونية (δ) بمقدار 0.05 و0.10 و0.15 مع عتبات احتمالية خلفية بنسبة 95%.
الدقة: تم حساب مقاييس التصنيف (الدقة، الاستدعاء، النوعية، معدل الإيجاب الكاذب) باستخدام ترميزات المتخصصين الطبيين كأرضية حقيقية، مع استخدام نهج التبديل (permutation approach) لمراعاة التباين البشري.
النتائج الرئيسية
الموثوقية بين المقيّمين:
المنهجي-المنهجي (Medic-Medic): حقق اتفاقاً جوهرياً بمتوسط معامل كوهين كابا بلغ 0.752 (فاصل ثقة 95%: 0.710–0.794). وكان المتوسط البايزي الخلفي 0.813.
المنهجي-النموذج (Medic-LLM): حقق اتفاقاً مقبولاً فقط بمتوسط معامل كوهين كابا بلغ 0.391 (فاصل ثقة 95%: 0.362–0.420). وكان المتوسط البايزي الخلفي 0.659.
النموذج-النموذج (LLM-LLM): أظهر اتفاقاً جوهرياً بين النماذج (κ=0.795)، مما يشير إلى وجود تحيزات متسقة عبر البنيات المختلفة.
عدم الدونية: تم رفض الفرضية القائلة بأن النماذج اللغوية الكبيرة تؤدي بشكل مكافئ للمتخصصين الطبيين عند جميع الهوامش المختبرة (δ=0.05,0.10,0.15). كانت احتمالية أن يقع اتفاق (Medic-LLM) ضمن نطاق 0.10 من اتفاق (Medic-Medic) هي 4.5% فقط.
أداء الفئات:
تباين الاتفاق باختلاف الفئة السريرية. لوحظت أصغر الفروقات بين البشر والنماذج اللغوية في نتائج الاختبارات والعلاجات.
وُجدت أكبر التباينات في العلامات والتشخيصات، والتي تتطلب تفسيراً سريرياً دقيقاً.
حققت GPT-4o (أفضل نموذج في هذه المجموعة) دقة بنسبة 97.0% واستدعاء بنسبة 84.9%، مع معدل إيجاب كاذب بنسبة 7.5%.
حجم الاستخراج: استخرجت النماذج اللغوية الكبيرة باستمرار عدداً أكبر من الكيانات السريرية لكل وثيقة مقارنة بالمقيّمين البشر، لا سيما في "عوامل الخطر" (متوسط النموذج اللغوي: 7.33 مقابل متوسط البشر: 1.01)، مما يشير إلى اختلاف في كيفية تحديد النماذج والأطباء للمعلومات ذات الأولوية.
الأهمية والادعاءات يدعي البحث أنه يقدم أول تقييم منهجي للنماذج اللغوية الكبيرة مقابل المتخصصين الطبيين باستخدام مقاييس موثوقية معيارية في مجال سريري متخصص. تكمن الأهمية الأساسية في وضع توجيه مبني على الأدلة لنشر الذكاء الاصطناعي في التوثيق السريري:
القيود الحالية: لا تحقق النماذج اللغوية الكبيرة حالياً مستويات موثوقية بين المقيّمين تضاهي المتخصصين الطبيين لاستخراج المعلومات السريرية. وهي ليست جاهزة بعد للعمل المستقل في هذا السياق.
سير العمل الموصى به: نظراً للدقة العالية (97.0%) ولكن مع استدعاء متوسط ومعدل إيجاب كاذب غير مهمل (7.5%)، يقترح المؤلفون أن النماذج اللغوية الكبيرة هي الأنسب لعمليات الاستخراج الأولي مع ضرورة التحقق البشري، بدلاً من اتخاذ القرارات المستقلة.
الإطار المنهجي: تضع الدراسة إطاراً صارماً باستخدام SNOMED-CT والنمذجة الهرمية البائية لتقييم الذكاء الاصفي السريري، مما يوفر منهجية قابلة للتكرار للأبحاث المستقبلية.
خصوصية المجال: تسلط فجوات الأداء الضوء على أنه بينما قد تتفوق النماذج في المهام المعيارية، فإنها تعاني في التفسير الدقيق المطلوب للعلامات والتشخيصات، مما يشير إلى أن هندسة الأوامر (prompt engineering) وحدها غير كافية دون ابتكارات هيكلية أو تدريب خاص بالمجال.
يصرح المؤلفون صراحةً بأنه لا ينبغي استخدام هذه النتائج لتوجيه الممارسة السريرية مباشرة، حيث تعتمد الدراسة على وثائق تعليمية متاحة للعموم (MTSamples) والتي قد لا تمثل تماماً التباين الموجود في السجلات الصحية الإلكترونية المؤسسية الواقعية.