← أحدث الأبحاث
💬 NLP

Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة المضبوطة بدقة، ولا سيما e5_large، تتفوق بشكل كبير على أساليب معالجة اللغات الطبيعية الكلاسيكية في أتمتة ربط الأوصاف النصية الحرة للطب النفسي باللغة الإسبانية بأكواد التصنيف الدولي للأمراض (ICD)، محققةً درجة F1 متوسطة دقيقة بلغت 0.866 على مجموعة بيانات تضم أكثر من 145,000 سجل.

المؤلفون الأصليون: Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل مستشفى مزدحمًا حيث يكتب الأطباء آلاف الملاحظات يوميًا حول الصحة النفسية لمرضاهم. تُكتب هذه الملاحظات بلغة حرة وانسيابية — مثل "شعور بالفراغ"، "عدم القدرة على النوم"، أو "القلق بشأن كل شيء". ولإدارة سجلات المستشفى وإحصائياته، يجب ترجمة هذه الملاحظات إلى رمز صارم ومعياري (مثل الباركود) يسمى رمز ICD.

في الوقت الحالي، يقوم البشر بهذه عملية الترجمة. وهي عملية بطيئة، مرهقة، وعرضة للأخطاء. تتحدث هذه الورقة البحثية عن بناء روبوت ذكي يمكنه قراءة تلك الملاحظات الفوضوية وتعيين الرمز الصحيح تلقائيًا.

إليك كيف حاول الباحثون بناء هذا الروبوت، مشروحًا من خلال تشبيهات بسيطة:

١. التحدي: مشكلة "الذيل الطويل" (The Long Tail)

امتلك الباحثون مكتبة ضخمة مكونة من ١٤٥,٠٠٠ ملاحظة نفسية باللغة الإسبانية. أرادوا تعليم الكمبيوتر كيفية فرزها إلى ٨٥ فئة مختلفة (مثل "القلق"، "الاكتئاب"، إلخ).

ومع ذلك، كانت البيانات غير متوازنة. تخيل جرة حلوى تحتوي على ٨٠٪ من الحلوى حمراء اللون (تشخيصات شائعة)، ولكن يوجد عدد قليل فقط من الحلوى الزرقاء والخضراء والأرجوانية (تشخيصات نادرة). يُسمى هذا "توزيع الذيل الطويل". معظم روبوتات الفرز تبرع في العثور على الحلوى الحمراء، لكنها تفقد تمامًا الحلوى الملونة والنادرة.

٢. المسابقة: الأساليب القديمة مقابل التقنيات الجديدة

أقام الباحثون مسابقة بين أنواع مختلفة من "الأدمغة" لمعرفة أي منها يمكنه فرز الملاحظات بشكل أفضل.

  • فريق المدرسة القديمة (BoW & TF-IDF):
    تخيل هذه الروبوتات كأنها أدوات لمطابقة الكلمات المفتاحية. هي تمسح الملاحظة وتقول: "أرى كلمة 'حزين'، لذا سأعطيها رمز 'الاكتئاب'". هي سريعة ولكنها حرفية. إذا كتب الطبيب "شعور بثقل شديد على صدري" بدلًا من كلمة "حزين"، فقد ترتبك هذه الروبوتات.

    • النتيجة: كانت جيدة، لكنها افتقرت إلى فهم التفاصيل الدقيقة.
  • المنطقة الوسطى (LSA, LDA, Doc2Vec):
    هذه الأدوات تشبه مخمنات المواضيع. فهي تحاول تجميع الكلمات التي تظهر معًا كثيرًا لفهم الموضوع العام.

    • النتيجة: واجهت صعوبات. لم تستطع استيعاب المصطلحات الطبية المحددة المستخدمة في الملاحظات النفسية الإسبانية.
  • النجوم الخارقون (النماذج اللغوية الكبيرة - LLMs):
    هذه هي أدوات فهم السياق. تخيل روبوتًا قرأ ملايين الكتب ويفهم أن "الشعور بالفراغ" و"فقدان الدافعية" هما في الواقع مرادفات للاكتئاب، حتى لو لم تكن كلمة "اكتئاب" موجودة. إنهم يفهمون "الجو العام" و"القصة"، وليس مجرد الكلمات المفتاحية.

    • النتيجة: هذه النماذج، وتحديدًا نموذج e5 large، اكتسحت المنافسة.

٣. استراتيجية الفوز: الضبط الدقيق (Fine-Tuning)

لم يكتفِ الباحثون بشراء "روبوت خارق" جاهز وتوقع نجاحه. أدركوا أن الروبوت العام لا يعرف القواعد المحددة لمستشفى إسباني معين.

لذا، استخدموا تقنية الضبط الدقيق (Fine-Tuning).

  • التشبيه: تخيل أخذ خريج جامعي لامع (الذكاء الاصطوقي المدرب مسبقًا) وإعطاءه تدريبًا مهنيًا محددًا في المستشفى. أنت تعرض عليه آلاف الأمثلة لكيفية كتابة الملاحظات في هذا المستشفى تحديدًا.
  • النتيجة: تعلم الروبوت "اللهجة" الخاصة بالأطباء. لقد انتقل من مجرد فهم اللغة إلى فهم اللغة الطبية. حقق هذا النهج أعلى درجة: ٠.٨٦٦ (معدل دقة مرتفع جدًا).

٤. العمل الجماعي: العقل والعضلة

وجدت الورقة أيضًا أن "العقل" (الذكاء الاصطناعي الذي يقرأ النص) و"العضلة" (النظام الذي يتخذ القرار النهائي) يحتاجان للعمل معًا بشكل مختلف اعتمادًا على البيانات:

  • بالنسبة للذكاء الاصطناعي الذكي والسياقي (LLMs): كانت أفضل "عضلة" هي XGBoost. فكر في XGBoost كمدير منضبط يتبع القواعد، وهو بارع في تنظيم المعلومات المعقدة دون الشعور بالارتباك.
  • بالنسبة لذكاء الكلمات المفتاحية التقليدي: كانت أفضل "عضلة" هي MLP (نوع من الشبكات العصبية). فكر في هذا كفنان مرن ومبدع جيد في رصد الأنماط في البيانات المبعثرة والفوضوية.

٥. اختبار الواقع: الحالات النادرة

حتى مع وجود أفضل روبوت، كان هناك عقبة.

  • المشكلة: بالنسبة للتشخيصات النادرة جدًا (الحلوى الزرقاء والخضراء)، لا يزال الروبوت يعاني. بعض الحالات النادرة كان لديها عدد قليل جدًا من الأمثلة في بيانات التدريب لدرجة أن الروبوت لم يستطع تعلمها على الإطلاق.
  • الدرس المستفاد: تعترف الورقة بأن الثراء الدلالي وحده ليس كافيًا. إذا لم يكن الروبوت قد رأى مرضًا نادرًا محددًا من قبل، فلن يساعده أي قدر من "فهم اللغة" في تخمين الإجابة الصحيحة. إنه بحاجة إلى مزيد من البيانات.

ملخص

تثبت الورقة أنه لأتمتة الترميز النفسي، لا يمكنك مجرد استخدام البحث البسيط عن الكلمات المفتاحية. أنت بحاجة إلى ذكاء اصطناعي حديث يفهم السياق، ويجب عليك تدريبه خصيصًا على ملاحظات المستشفى (الضبط الدقيق).

بينما يعد هذا النظام الجديد أفضل بكثير من الطرق القديمة ويتعامل مع الحالات الشائعة ببراعة، إلا أنه لا يزال يواجه عقبة أمام الحالات الأكثر ندرة، ببساطة لأنه لا توجد بيانات كافية لتعليم الروبوت كيف تبدو تلك الحالات النادرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →