ICD2Bert: ICD Bert Encodings for Clinical Outcome Prediction on Routine Health Insurance Data
تقدم هذه الورقة نموذج ICD2BERT، وهو نموذج BERT قياسي تم تدريبه مسبقاً على رموز ICD دون تعديلات خاصة بالمجال، وتثبت من خلال اختبارات قياسية مكثفة أن مثل هذه التعقيدات الهيكلية غالباً ما تفشل في التفوق على النماذج المرجعية الأبسط، مما يسلط الضل على أن جودة البيانات ونطاقها والتدريب المسبق هي أكثر أهمية للتنبؤ بالنتائج السريرية من تعقيد النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تعتمد المستشفيات وشركات التأمين في جميع أنحاء العالم على لغة عالمية لتسجيل ما يعاني منه المريض. تتكون هذه اللغة من رموز، وهي سلاسل قصيرة من الحروف والأرقام التي ترمز إلى أمراض وإصابات وإجراءات طبية محددة. أُنشئت هذه الرموز في الأصل للتعامل مع الفواتير والأعمال الورقية، ولكنها اليوم هي الطريقة الأساسية التي يفهم بها الأطباء والحواسيب التاريخ الطبي للمريض. ولأن هذه السجلات ضخمة ومعيارية، فقد أمل الباحثون منذ فترة طويلة في استخدام الذكاء الاصطناعي للعثور على أنماط خفية داخلها، أنماط قد تتنبأ بمن سيصاب بالمرض مرة أخرى، أو من قد يموت، أو من يحتاج إلى علاج معين. وللقيام بذلك، كان العلماء يبنون برامج حاسوبية معقدة مصممة لقراءة هذه الرموز كما يقرأ الإنسان قصة، بحثاً عن السياق والروابط بين الأحداث المختلفة في حياة المريض.
وضع فريق من الباحثين هدفاً لاختبار ما إذا كانت هذه البرامج الحاسوبية المتطورة ضرورية حقاً، أم أن التعقيد الإضافي الذي تضيفه هو مجرد تشتيت. ركزوا على نوع محدد من الذكاء الاصطناعي يسمى "المحول" (transformer)، وهو أداة قوية أحدثت ثورة في كيفية فهم الحواسيب للغة. في العالم الطبي، كان العلماء يقومون بتعديل هذه الأدوات، عبر إضافة طبقات إضافية من المعلومات مثل عمر المريض أو عدد مرات زيارته للطبيب، آملين أن تساعد هذه التفاصيل الحاسوب على تقديم تنبؤات أفضل. أراد الباحثون معرفة ما إذا كانت هذه الإضافات المخصصة تحسن النتائج حقاً، أم أن نسخة أبسط ومعيارية من الأداية يمكنها القيام بنفس المهمة بنفس الكفاءة. كما أرادوا معرفة ما إذا كانت هذه الأنظمة المتقدمة قادرة على التعلم من مجموعة من المرضى وتطبيق تلك المعرفة على مجموعة مختلفة تماماً، ربما من بلد آخر أو نظام رعاية صحية آخر.
وللإجابة على هذه الأسئلة، بنى الفريق نسخة جديدة ومعيارية من البرنامج الحاسوبي الذي يقرأ فقط الرموز الطبية، دون أي معلومات إضافية عن العمر أو عدد الزيارات التي أضافها باحثون آخرون. أطلقوا على هذا النموذج الجديد اسم ICD2BERT. ثم وضعوا هذا النموذج تحت الاختبار مقابل العديد من النماذج الأخرى الشائعة والأكثر تعقيداً باستخدام ثلاث مجموعات مختلفة جداً من البيانات الطبية. جاءت إحدى المجموعات من مستشفى كبير في الولايات المتحدة تحتوي على سجلات من أنظمة ترميز قديمة وجديدة. وكانت المجموعة الثانية من مجموعة صغيرة من المرضى ذوي السير المرضية المفصلة للغاية، والتي صُممت لاختبار مدى قدرة النموذج على التعلم من بيانات قليلة جداً. أما المجموعة الثالثة فكانت ضخمة، وتضم ملايين السجلات من مطالبات التأمين الصحي الروتينية في ألمانيا، وتغطي شريحة سكانية واسعة ومتنوعة.
كانت النتائج مفاجئة. فعندما قارن الباحثون النموذج المعياري بالنماذج المخصصة والأكثر تعقيداً، وجدوا أن الميزات الإضافية لم تجعل الحاسوب أكثر ذكاءً. فالنموذج الذي اكتفى بقراءة الرموز فقط كان يؤدي بنفس كفاءة النماذج التي عرفت أيضاً عمر المريض أو تاريخ زياراته. في الواقع، اكتشف الباحثون أن جودة وحجم البيانات التي تعلم منها النموذج كانت أكثر أهمية بكما أن يكون تعقيد البرنامج الحاسوبي نفسه. والأمر الأكثر غرابة هو أن طريقة بسيطة جداً تعاملت مع الرموز كقائمة من الفئات، دون محاولة فهم ترتيب أو سياق الأحداث، غالباً ما كانت تؤدي بنفس الكفاءة التي تؤديها الأنظمة الأكثر تقدماً. تمكن هذا النهج البسيط من التنبؤ بالأمراض المستقبلية، والوفاة، وإعادة دخول المستشفى بدقة تضاهي الأنظمة المعقدة في كثير من الحالات.
كما كشفت الدراسة أن النوع المحدد من الرمز الطبي أمر بالغ الأهمية. ففي بيانات المستشفى الأمريكية، ظل نظام الترميز القديم يحتفظ بمعلومات حيوية لم يستطع النظام الجديد استبدالها بالكامل؛ فعندما أزال الباحثون الرموز القديمة، انخفض أداء الحاسوب بشكل ملحوظ. ومع ذلك، في بيانات التأمين الألمانية، التي استخدمت فقط الرموز الجديدة، واجه الحاسوب صعوبة إذا تم اختصار الرموز إلى فئاتها الأكثر أساسية، مما يشير إلى أن التفاصيل الدقيقة في تلك السجلات المحددة كانت ضرورية. ووجد الباحثون أيضاً أنه بينما استطاعت النماذج المعقدة التعلم من البيانات الأمريكية وتطبيقها على البيانات الألمانية، فإن العكس لم يكن صحيحاً. فالنموذج الذي تدرب فقط على البيانات الألمانية فشل عندما طُلب منه فحص السجلات الأمريكية، ويرجع ذلك على الأرجح إلى أنه لم يرَ نظام الترميز القديم من قبل. يشير هذا إلى أنه لكي يكون الحاسوب مفيداً حقاً عبر أنظمة الرعاية الصحية المختلفة، يجب تدريبه على أوسع تنوع ممكن من أنواع البيانات.
أخيراً، نظر الفريق في مدى سهولة فهم الأسباب التي جعلت هذه النماذج تتخذ قراراتها. ولأن نموذجهم المعياري لا يحتوي على طبقات إضافية مخصصة، فقد أمكن تحليله باستخدام أدوات قائمة تُظهر بالضبط الرموز الطبية التي أثرت على التنبؤ. ووجدوا أن رموزاً محددة لحالات مثل السكري وارتفاع ضغط الدم كانت أقوى الدوافع للتنبؤ بالوفاة أو إعادة دخول المستشفى. هذه الشفافية أمر بالغ الأهمية للأطباء الذين يحتاجون إلى الثقة في نصيحة الحاسوب. تشير الدراسة إلى أنه قبل أن تستثمر المستشفيات في بناء وتدريب أنظمة ذكاء اصطناعي ضخمة ومعقدة، ينبغي عليها التفكير بعناية فيما إذا كان النهج الأبسط والأكثر شفافية قد يكون فعالاً بنفس القدر. وتشير النتائج إلى أن القدرة على التنبؤ بالنتوى السريرية تكمن في ثراء واتساع السجلات الطبية التي يُسمح للنموذج بقراءتها، وليس في التصميم المعقد للبرنامج الحاسوبي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.