Interoperability of standardised electronic healthcare records facilitates transfer learning of clinical language models
تُثبت هذه الدراسة أن توحيد السجلات الصحية الإلكترونية وفق نموذج البيانات المشترك (OMOP) يُمكّن بفعالية من نقل تعلم النماذج اللغوية السريرية عبر مجموعات بيانات بريطانية متنوعة، محققاً أداءً تنبؤياً عالياً لإعادة الإدخال إلى المستشفى في حالات الطوارئ رغم الاختلافات الديموغرافية ومحدودية المفردات.
تنتج المستشفيات وعيادات الأطباء تدفقاً هائلاً ومستمراً من الملاحظات الرقمية حول المرضى. تحتوي هذه السجلات الإلكترونية على تاريخ كل زيارة، وكل وصفة طبية، وكل نتيجة فحص. ومع ذلك، فإن الطريقة التي تسجل بها الأنظمة المختلفة هذه المعلومات غالباً ما تكون غير متسقة؛ فقد تستخدم إحدى العيادات رمزاً معيناً لقراءة ضغط الدم المرتفع، بينما تستخدم عيادة أخرى رمزاً مختلفاً تماماً لنفس الشيء بالضبط. هذا الافتقار إلى التوحيد يجعل من الصعب دمج البيانات من أماكن مختلفة لإيجاد أنماط أو لتعليم الحواسيب كيفية التعرف على الاتجاهات الصحية. ولحل هذه المشكلة، طور الباحثون مترجماً عالمياً للبيانات الطبية يسمى "نموذج البيانات المشترك". فكر في الأمر كقاموس مشترك يجبر أنظمة الترميز المختلفة على الاتفاق على معنى الحدث الطبي، محولاً مزيجاً فوضوياً من الاختصارات المحلية إلى لغة واحدة موحدة. والأمل هو أنه إذا استطاعت الحواسيب تعلم هذه اللغة العالمية من مجموعة واحدة من المرضى، فقد تتمكن من تطبيق تلك المعرفة على مجموعة مختلفة تماماً من المرضى في مكان آخر، دون الحاجة إلى إعادة تدريبها من الصفر.
في دراسة حديثة، سعى الباحثون لاختبار ما إذا كانت هذه الفكرة تنجح في العالم الحقيقي باستخدام مجموعتين كبيرتين من السجلات الصحية من المملكة المتحدة. وقد ركزوا على مهمة محددة: التنبؤ بما إذا كان المريض سيحتاج إلى العودة إلى المستشفى لحالة طارئة في غضون ثلاثين يوماً من خروجه. وكانت مصادر البيانات التي اختاروها مختلفة تماماً؛ حيث جاءت مجموعة بيانات واحدة من شبكة من الممارسات العامة في جميع أنحاء إنجلترا، بينما جاءت الأخرى فقط من ممارسات في لندن. واختلفت هذه المجموعات من الناس في العمر، والعرق، والخلفية الاقتصادية، كما كانت الحواسيب في كل نظام تسجل تاريخهم الطبي في الأصل باستخدام أنظمة ترميز مختلفة. قام الباحثون أولاً بترجمة كلا المجموعتين من السجلات إلى اللغة العالمية الموحدة المذكورة سابقاً. ثم قاموا بتدريب برنامج حاسوبي متطور، يُعرف باسم "نموذج لغة سريرية"، لفهم الأنماط في مجموعة البيانات الأولى. تعلم هذا البرنامج قراءة تسلسل الأحداث الطبية وتخمين احتمالية حدوث إعادة دخول طارئة في المستقبل.
جاء الاختبار الحاسم عندما طلب الباحثون من هذا البرنامج المدرب النظر في مجموعة البيانات الثانية، وهي مجموعة لندن، دون إعطائه أي تدريب جديد. أرادوا معرفة ما إذا كان المعرفة المكتسبة من المجموعة الأولى يمكن أن تنتقل إلى المجموعة الثانية. كانت النتائج مشجعة؛ فقد أدى النموذج، الذي لم يرَ بيانات لندن من قبل، أداءً يقارب أداء نموذج تم تدريبه خصيصاً على تلك المجموعة منذ البداية. لقد حدد المرضى المعرضين للخطر بدقة عالية، متفوقاً بمراحل على نموذج تم بناؤه من الصفر دون أي تعلم مسبق. يشير هذا إلى أن توحيد البيانات سمح للحاسوب بتعلم مبادئ عامة حول المخاطر الصحية تنطبق عبر مجموعات سكانية مختلفة، حتى عندما تبدو تلك المجموعات مختلفة تماماً على الورق.
كما تعمق الباحثون لفهم الأجزاء التي كانت تقود هذه التنبؤات في السجلات الطبية. ووجدوا أن المعلومات الأكثر أهمية جاءت من تاريخ حالات المريض والملاحظات التي سجلها الأطباء، مثل الملاحظات حول الأعراض أو نتائج الفحص البدني. ومن المثير للاهتمام أن أهمية العوامل الأخرى، مثل قوائم الأدوية أو أرقام القياسات المحددة، تباينت اعتماداً على مجموعة البيانات المستخدمة. ففي إحدى المجموعات، أدى حذف بيانات الأدوية في الواقع إلى تحسين أداء النموذج، بينما في المجموعة الأخرى، كان حذف بيانات القياسات له التأثير ذاته. يشير هذا إلى أنه بينما ساعدت اللغة العالمية الحاسوب على فهم الصورة الكبيرة، فإن التفاصيل المحددة التي تهم يمكن أن تعتمد أيضاً على كيفية جمع البيانات وتنظيمها في الأصل.
وعلى الرغم من هذه النجاحات، سلطت الدراسة الضوء على بعض الحدود العملية. فعملية ترجمة السجلات إلى اللغة القياسية لم تكن مثالية؛ حيث فُقدت بعض المعلومات لأن بعض الرموز المحلية لم يكن لها مقابل مباشر في القاموس العالمي. كما كان للبرنامج الحاسوبي مفردات محدودة، مما يعني أنه لم يستطع التعرف على كل رمز صادفه في مجموعة البيانات الجديدة. ومع ذلك، تظل النتيجة الجوهرية قوية: من خلال تحويل السجلات الطبية المحلية الفوضوية إلى تنسيق موحد، يمكن للباحثين بناء أدوات قوية تعمل عبر مختلف المستشفيات والمناطق. يقدم هذا النهج مساراً واعداً نحو إنشاء أدوات تنبؤ طبي لا تقتصر على نظام واحد، مما يسمح بمرور الرؤى من مجتمع إلى آخر، بغض النظر عن الاختلافات في عادات الترميز المحلية أو التركيبة السكانية.
ملخص تقني: توافق التشغيل البيني للسجلات الصحية الإلكترونية الموحدة والتعلم بنقل المعرفة
بيان المشكلة تعتمد السجلات الصحية الإلكترونية (EHR) على أنطولوجيات ترميز سريري متنوعة (مثل Read v2، وSNOMED CT، وICD-10) تختلف بشكل كبير حتى داخل النظام الصحي الوطني الواحد. يخلق هذا التباين عائقاً أمام تدريب ونشر نماذج تعلم الآلة عبر مجموعات البيانات والمؤسسات المختلفة. وبينما تعمل نماذج البيانات المشتركة (CDMs) مثل "مشروع نتائج المخرجات الطبية الرصدية" (OMOP) على توحيد هيكل البيانات والمفردات لتسهيس تحليل البيانات عبر المجموعات المختلفة، إلا أنه لا يزال من غير الواضح مدى فعالية عملية التوحيد هذه في الحفاظ على المعلومات المحددة المطلوبة لمهام التنبؤ السريري. علاوة على ذلك، هناك شك في ما إذا كانت عملية الربط، التي غالباً ما تدمج أو تستبعد الرموز المصدرية، تحتفظ بإشارة كافية لتمكين نقل النماذج التأسيسية السريرية (المدربة مسبقاً على مجموعة بيانات واحدة) إلى مجموعة أخرى دون الحاجة لإعادة التدريب من الصفر.
المنهجية استخدمت الدراسة مجموعتي بيانات للرعاية الأولية من هيئة الخدمات الصحية الوطنية البريطانية (NHS): وهي CPRD GOLD (التي تستخدم رموز Read v2) وCPRD Aurum (التي تستخدم SNOMED CT)، مع قصر النطاق على لندن. تم ربط كلتا المجموعتين بنموذج OMOP CDM، وتحويل الرموز المصدرية إلى معرفات مفاهيم OM-OP قياسية.
معالجة البيانات: قام المؤلفون بربط رموز Read v2، وSNOMED CT، وdm+d، وICD-10، وOPCS-4 بمفاهيم OMOP القياسية. كما قيموا دقة الربط والانخفاض في عدد المفاهيم الفريدة.
بنية النموذج: تم تدريب نموذج محول (Transformer) يعتمد على بنية BERT (مشفّر فقط) من الصفر على متن التدريب المسبق لـ CPRD GOLD (1.05 مليون مريض) باستخدام نمذجة اللغة المقنعة. تم بناء أداة الترميز (Tokenizer) حصرياً من بيانات التدريب المسبق لـ GOLD مع سقف للمفردات يبلغ 20,000 رمز.
التصميم التجريبي:
التدريب المسبق: تم تدريب النموذج (PT-GOLD) مسبقاً على GOLD.
الضبط الدقيق: تم ضبط النموذج المدرب مسبقاً بدقة بشكل منفصل على GOLD (FT-GOLD) وعلى Aurum (FT-Aurum) للتنبؤ بإعادة الإدخال إلى المستشفى في حالات الطوارئ خلال 30 يوماً.
التعلم بنقل المعرفة: تم تطبيق النموذج الذي تم تدريبه مسبقاً وضبطه بدقة على GOLD مباشرة على مجموعة اختبار Aurum (INF-Aurum) لتقييم نقل المعرفة في حالة "الصفر" (zero-shot transfer) دون تحديث الأوزان.
المجموعة الضابطة: تم ضبط نموذج بأوزان تم إنشاؤها عشوائياً بدقة على Aurum (RI-Aurum) لتحديد خط الأساس.
الدراسة الاستقصائية (Ablation): تم تقييم مساهمة مجالات OMOP المحددة (الأدوية، والقياسات، والملاحظات، والحالات) من خلال إزالة تأثيرها من التسلسلات المدخلة أثناء الضبط الدقيق.
النتائج الرئيسية
دقة الربط: نجحت عملية ربط OMOP لـ 95.6% من سجلات CPRD GOLD و86.2% من سجلات Aurum. أدى الربط إلى تقليص عدد المفاهيم الأولية الفريدة بنسبة 36% في GOLD و28.6% في Aurum، مما يشير إلى ضغط كبير في البيانات.
تغطية أداة الترميز: غطت أداة الترميز، التي تم تدريبها على GOLD، نسبة 99.53% من حالات ظهور المفاهيم في GOLD، ولكنها غطت 91.27% فقط في Aurum، مما يعكس الفجوة في المفردات بين مجموعة البيانات المصدرية والمستهدفة.
أداء النموذج:
FT-GOLD (على اختبار GOLD): منحنى خصائص تشغيل المستقبِل (AUROC) بلغ 0.913.
FT-Aurum (على اختبار Aurum): منحنى (AUROC) بلغ 0.927.
INF-Aurum (نقل المعرفة من حالة الصفر من GOLD إلى Aurum): منحنى (AUROC) بلغ 0.911. كان هذا الأداء مقارباً لـ FT-Aurum ومتفوقاً بشكل ملحوظ على المجموعة الضابطة ذات الأوزان العشوائية (RI-Aurum، AUROC 0.885).
مكسب الضبط الدقيق: أدى الضبط الدقيق الإضافي للنموذج المنقول على Aurum (FT-Aurum) إلى تحسن طفيف (+0.016 في AUROC) مقارنة بالاستدلال في حالة "الصفر".
نتائج الدراسة الاستقصائية (Ablation): أدت إزالة "الملاحظات والحالات" إلى تدهور الأداء في كلتا مجموعتي البيانات. ومع ذلك، فإن إزالة "الأدوية" حسّن الأداء في FT-Aurum، بينما أدت إزالة "القياسات" إلى تحسين الأداء في FT-GOLD. يشير هذا إلى أن الإشارة السريرية لإعادة الإدخال تتوزع بشكل مختلف عبر مجالات OM-OP اعتماداً على هيكل ترميز مجموعة البيانات المصدرية.
المساهمات الرئيسية
التحقق التجريبي من التعلم بنقل المعرفة: تثبت الدراسة أن توحيد بيانات السجلات الصحية الإلكترونية إلى OM-OP يتيح النقل الفعال لنماذج اللغة السريرية بين مجموعات البيانات ذات الأنطولوجيات الترميزية والسمات الديموغرافية المختلفة (مثل التركيبات العرقية والحالات الاجتماعية والاقتصادية المختلفة).
تقييم دقة الربط: يحدد المؤلفون مدى فقدان المعلومات أثناء ربط OM-OP، مشيرين إلى أنه رغم إمكانية تحقيق ربط عالي الدقة، إلا أنه يضغط البيانات بطبيعته وقد يستبعد الرموز الإدارية عالية الكثافة التي تفتقر إلى مكافئات قياسية.
تحليل الإشارة الخاصة بالمجال: من خلال الدراسات الاستقصائية، تكشف الورقة أن المنفعة التنبؤية لمجالات OM-OP المحددة (مثل الأدوية مقابل القياسات) ليست موحدة عبر مجموعات البيانات، ويرجع ذلك على الأرجح إلى الاختلافات الهيكلية في كيفية تخصيص المفاهيم السريرية للمجالات في الأنظمة المصدرية المختلفة.
الأهمية والادعاءات تدعي الورقة أن توحيد OM-OP، عند تطبيقه عملياً على مستوى المفهوم، يدعم توافق التشغيل البيني لنماذج التنبؤ السريري. وتحديداً، تُظهر أن نموذجاً تم تدريبه مسبقاً على مجموعة بيانات رعاية أولية بريطانية يمكن إعادة استخدامه على مجموعة بيانات أخرى مبنية على نظام ترميز مختلف بأداء تنبؤي عالٍ (AUROC ~0.91) دون الحاجة لإعادة التدريب. يشير هذا إلى أن التوحيد يمكن أن يخفف من الحاجة لتدريب نماذج منفصلة من الصفر لكل موقع جديد، حتى في ظل وجود تباين ديموغرافي.
ومع ذلك، يلتزم المؤلفون بموقف متحفظ، حيث يقرون بالقيود التالية:
فقدان البيانات: تؤدي عملية الربط وأداة الترميز الثابتة إلى فقدان البيانات، خاصة بالنسبة للرموز غير الموجودة في أداة الترمونة للتدريب المسبق أو تلك التي تفتقر إلى مكافئات OM-OP قياسية.
القدرة على التعميم: رغم النجاح بين مجموعتي بيانات بريطانيتين، يشير المؤلفون إلى أن التعميم خارج النظام الصحي الوطني نفسه لم يتم اختباره بعد.
تباين المجالات: يسلط التباين في نتائج الدراسة الاستقصائية الضوء على أن التوحيد لا يوحد تماماً المعنى الدلالي لمجالات البيانات عبر الأنظمة المصدرية المختلفة، مما قد يؤثر على سلوك النماذج اللاحقة.
تخلص الدراسة إلى أنه بينما يعد التوحيد خطوة حاسمة نحو توافق التشغيل البيني، فإنه ليس حلاً شاملاً؛ إذ يتطلب النشر العملي مراع de دقيقة لتغطية المفردات والفروق الهيكلية المحددة لمجموعة البيانات المستهدفة.