← أحدث الأبحاث
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة الحالية تفشل في تحقيق موثوقية مماثلة لموثوقية المتخصصين الطبيين بين المقيمين عند استخراج المعلومات السريرية المهيكلة من السجلات الصحية الإلكترونية الخاصة بمرضى الأنف والأذن والحنجرة، مما يشير إلى أنها تعد مناسبة بشكل أفضل لعمليات الاستخراج الأولي للبيانات التي تتطلب تحققاً بشرياً بدلاً من النشر السريري المستقل.

المؤلفون الأصليون: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
نُشر 2026-08-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

تنتج المستشفيات اليوم محيطاً هائلاً من السجلات المكتوبة. فكل زيارة للمريض، وكل نتيجة فحص، وكل قرار علاجي يتم تدوينه في ملاحظات رقمية تُعرف بالسجلات الصحية الإلكترونية. هذه الوثائق غنية بالتفاصيل، حيث تحتوي على اللغة المحددة التي يستخدمها الأطباء لوصف الأعراض، وتشخيص الحالات، وتخطيط الرعاية. ولعقود من الزمن، كان تحويل هذه القصص غير المنظمة إلى بيانات منظمة وقابلة للبحث مهمة صعبة، تتطلب غالباً من البشر قراءة المعلومات وإعادة كتابتها يدوياً. ومؤخراً، ظهر نوع جديد من البرامج الحاسوبية يُسمى "النموذج اللغوي الكبير". لقد تم تدريب هذه الأنظمة على كميات هائلة من النصوص، وهي قادرة على قراءة وفهم وتلخيص لغة البشر بطلاقة مدهشة. وقد أظهرت قدرتها على الإجابة عن الأسئلة الطبية واجتياز امتحانات الترخيص، مما جعل الكثيرين يتساءلون عما إذا كان بإمكانها أيضاً قراءة سجلات المرضى واستخراج الحقائق الحيوية الموجودة بداخلها تلقائياً.

هذا السؤال لا يتعلق فقط بتوفير الوقت؛ بل يتعلق بالسلامة والدقة. فإذا كان الحاسوب سيساعد الأطباء في إدارة رعاية المرضى، فيجب أن يجد المعلومات الصحيحة دون اختلاق أشياء أو إغفال تفاصيل حاسمة. وقد وضعت دراسة جديدة اختباراً لهذه القدرة بشكل مباشر. حيث جمع الباحثون ما يقرب من مائة سجل حقيقي لمرضى من عيادات الأنف والأذن والحنجرة، وطلبوا من أطباء بشريين وسبعة نماذج لغوية كبيرة مختلفة قراءتها. كانت المهمة هي استخراج حقائق محددة، مثل عمر المريض، وأعراضه، وتشخيصه، والعلاجات التي تلقاها. ولضمان أن الجميع يتحدثون اللغة ذاتها، اشترط الباحثون ترجمة كل معلومة إلى رمز معياري يُستخدم في المستشفيات بجميع أنحاء العالم. وقد سمح هذا بإجراء مقارنة دقيقة لمدى جودة أداء الآلات مقارنة بالبشر.

كشفت النتائج عن فجوة واضحة بين الخبرة البشرية والذكاء الاصطعي الحالي. فعندما قرأ الأطباء الأربعة عشر في الدراسة نفس السجلات، اتفقوا مع بعضهم البعض حول المعلومات المستخرجة بنسبة 81 بالمائة من الوقت. وقد أظهر هذا المستوى العالي من الاتفاق أن الأطباء كانوا يفسرون الملاحظات بشكل متسق. ومع ذلك، عندما تمت مقارنة النماذج الحاسوبية بالأطباء، انخفض الاتفاق بشكل كبير إلى حوالي 66 بالمائة. وبعبارة أخرى، لم تكن الآلات بعد بمستوى موثوقية البشر في تحديد نفس الحقائق من النص نفسه. وقد اختبرت الدراسة نماذج ذات أحجام مختلفة، من الأنظمة الضخمة التي تحتوي على مئات المليارات من الروابط إلى النماذج الأصغر التي يمكن تشغيلها على أجهزة الكمبيوتر المحلية. ولم يصل أي منها إلى مستوى الاتساق الذي أظهره المتخصصون الطبيون.

وقد تباين الأداء اعتماداً على نوع المعلومات التي يتم استخراجها. فقد كانت النماذج جيدة جداً في إيجاد العلاجات ونتائج الفحوصات، والتي غالباً ما تُكتب بطرق واضحة ومعيارية. وكانت أقل نجاحاً في التعامل مع العلامات والتشخيصات، التي تتطلب غالباً فهماً أعمق للسياق السريري. ومن المثير للاهتمام أن الحواسيب كانت تميل إلى إيجاد معلومات أكثر مما فعل الأطباء، لا سيما فيما يتعلق بعوامل الخطر. وبينما يركز الأطباء غالباً على المشكلة المباشرة، يبدو أن النماذج كانت ترصد كل خطر محتمل ذُكر في النص. وهذا يشير إلى أن الآلات لا تقوم فقط بنسخ السلوك البشري، بل تعالج النص بطريقة مختلفة، فهي أحياناً تلتقط تفاصيل قد يغفل عنها البشر، ولكنها قد تشير أيضاً إلى أمور ليست ذات صلة سريرية.

وعلى الرغم من هذه الاختلافات، أظهرت الآلات أنها يمكن أن تكون أدوات مفيدة إذا استُخدمت بشكل صحيح. فقد وجدت الدراسة أنه عندما يحدد النموذج معلومة ما، فإنه عادة ما يكون مصيباً، بنسبة دقة بلغت 97 بالمائة. وهذا يعني أنها نادراً ما تخترع حقائق غير موجودة. ومع ذلك، فقد أغفلت بعض المعلومات في حوالي 15 بالمائة من الحالات. ويشير هذا النمط إلى دور محدد لهذه الأدوات في المستقبل: فهي الأنسب لتعمل كـ "مسحة أولية"، حيث تقوم بمسح السجلات بسرعة لاستخراج المرشحين المحتملين ليقوم الطبيب بمراجعتهم. وسيظل القرار النهائي والتحقق من الصحة من اختصاص البشر. وقد خلص الباحثون إلى أنه على الرغم من قوة هذه النماذج، إلا أنها ليست جاهزة بعد للعمل بمفردها في بيئة سريرية. بل من الأفضل النظر إليها كأدوات مساعدة يمكنها المساعدة في تنظيم فيض البيانات الطبية، بشرط وجود خبير بشري دائماً لمراجعة عملها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →