← أحدث الأبحاث
💬 NLP

Decomposing Error and Style in Automated Clinical Coding

تجادل هذه الورقة بأن جزءاً كبيراً من فجوة الأداء في الترميز السريري الآلي المنسوبة إلى خطأ النموذج يعود في الواقع إلى أساليب ترميز منهجية غير مُنمذجة، مما يثبت أن تكييف النماذج صراحةً بناءً على معيار أسلوب خاص بكل مرمّز يحسن الدقة بشكل كبير ويعالج التباينات عبر طرق التقييم المختلفة.

المؤلفون الأصليون: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

نُشر 2026-09-22✓ Author reviewed ⓘ
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في كل مرة يغادر فيها مريض مكتب طبيب أو مستشفى، يبدأ عمل إداري بالغ الأهمية. إذ يتعين على المبرمج الطبي (medical coder) قراءة الملاحظات السريرية التي كتبها الطبيب وترجمتها إلى مجموعة معيارية من الرموز الأبجدية الرقمية. تخبر هذه الرموز شركات التأمين والبرامج الحكومية بالضبط ما كان يعاني منه المريض وما تم فعله لعلاجه، مما يحدد المبلغ الذي سيحصل عليه مقدم الخدمة. ولعقود من الزمن، تعامل مجال الترميز الآلي مع هذه المهمة باعتبارها لعبة مطابقة بسيطة: يقرأ برنامج الكمبيوتر الملاحظة، وإذا لم تتطابق قائمة الرموز الخاصة به تماماً مع قائمة واحدة "معيارية ذهبية" أنشأها خبير بشري، يُعتبر الكمبيوتر مخطئاً. يفترض هذا النهج أنه إذا قرأ خبيران نفس الملاحظة واتبعا نفس القواعد، فسينتجان بالضبط نفس قائمة الرموز.

ومع ذلك، في عالم الطب الواقعي، لا ينطبق هذا الافتراض. فحتى الخبراء البشريون المدربون تدريباً عالياً، وهم ينظرون إلى ملاحظات المريض ذاتها ويستخدمون نفس الإرشادات الرسمية، غالباً ما ينتجون قوائم رموز مختلفة. قد يختلفون حول ما إذا كان ينبغي تضمين حالة طفيفة، أو مدى التحديد المطلوب بخصوص تشخيص ما، أو ما إذا كان ينبغي إضافة رموز إدارية لخدمات تمت مناقشتها ولكن لم تُنفذ. ولفترة طويلة، اعتقد الباحثون أن هذا الاختلاف كان مجرد خطأ بشري—تكلفة فوضوية لا مفر منها لوجود نظام ضخم يضم عشرات الآلاف من الرموز الممكنة. لكن دراسة جديدة تشير إلى أن ما يبدو كخطأ هو في الواقع شيء آخر تماماً: اختلاف منهجي في الأسلوب. تماماً كما قد يصف كاتبان نفس الحدث بمستويات مختلفة من التفصيل أو التركيز، يطبق مبرمان مختلفان سياسات داخلية مختلفة حول ما يستحق التسجيل ومدى الأدلة المطلوبة لتبريره.

سعى فريق من الباحثين في أمازون للتحقيق في هذه الفجوة، متسائلين عما إذا كان الخلاف بين المبرمجين عبارة عن ضجيج عشوائي أم نمطاً يمكن قياسه واستخدامه. بدأوا بالنظر في مجموعة بيانات عامة لـ 110 حالات مرضية تم ترميزها من قبل فريقين مستقلين. ورغم عملهما من ملاحظات متطابقة، لم يتفق الفريقان إلا على 73 بالمئة من الرموز. وعندما استعان الباحثون بمجموعة ثالثة مستقلة من المراجعين السريريين لمراجعة الملاحظات وإزالة أي رموز غير مبررة بوضوح، ارتفع الاتفاق بشكل طفيف فقط ليصل إلى 77 بالمئة. وهذا يعني أنه حتى بعد إزالة الأخطاء الواضحة، لا تزال ربع الرموز تختلف بين الخبراء. افترض الباحثون أن هذه الفجوة المتبقية لم تكن فشلاً في المعرفة، بل كانت اختلافاً في "أسلوب الترميز"—وهو مجموعة محددة من التفضيلات التي يتبناها كل مبرمج أو موقع طبي فيما يتعلق بمدى عدوانية الترميز، ومدى التحديد، وحجم التوثيق المطلوب لتبرير الرمز.

ولاختبار هذه الفكرة، بنى الباحثون نظاماً يمكنه قياس هذا الأسلوب. فقد أنشأوا نموذجاً بسيطاً، أو قائمة مراجعة، مكونة من عشرة أبعاد مختلفة. سألت بعض الأبعاد أسئلة مثل: "هل يدرج المبرمج الشكوى الرئيسية فقط، أم يدرج كل مشكلة تم ذكرها؟" وسألت أبعاد أخرى: "هل يستنتج المبرمج حالة طبية من دواء مذكور، أم ينتظر حتى يذكر الطبيب التشخيص صراحة؟" وباستخدام نموذج لغوي كبير، قاموا بتحليل مئات الملاحظات المرضية وقوائم الرموز المقابلة لها لتصنيف كل مجموعة بيانات بناءً على هذه الأبعاد العشرة. أدت هذه العملية إلى إنشاء "ملف تعريف أسلوب" لكل مجموعة من المبرمجين، مما يلخص عاداتهم الجماعية في مجموعة من الأرقام التي تصف نهجهم.

جاء الاختراق عندما استخدم الباحثون ملفات تعريف الأسلوب هذه لتوجيه نماذج الكمبيوتر. فبدلاً من مجرد طلب "ترميز هذه الملاحظة" من الكمبيوتر، أضافوا كتلة تعليمات محددة تصف أسلوب المبرمج الذي يحاولون محاكاته. فعلى سبيل المثال، إذا كان الأسلوب المستهدف "عدوانياً"، يتم توجيه الكمبيوتر لإدراج كل حالة ممكنة مذكورة في النص. وإذا كان الأسلوب "محافظاً"، يتم توجيهه لذكر ما تم تأكيده صراحة فقط. كانت النتائج مذهلة. فعندما كان الكمبيوتر يُمنح ملف تعريف أسلوب يطابق البيانات التي يحاول ترميزها، قفزت دقته بشكل كبير. وفي عدة مجموعات بيانات، تحسن أداء الكمبيوتر بمقدار 26 نقطة على مقيض تسجيل قياسي. وعلى العكس من ذلك، عندما كان يُمنح الكمبيوتر ملف تعريف أسلوب يتصادم مع البيانات—أي إخبار مبرمج محافظ بأن يكون عدوانياً، أو العكس—انخفض أداؤه بمقدار يصل إلى 21 نقطة.

تشير هذه النتيجة إلى أن الكثير مما كان يُعزى سابقاً إلى عدم قدرة الكمبيوتر على فهم الطب كان في الواقع فشل الكمبيوتر في فهم عادات المبرمج. اختبر الباحثون ذلك عبر خمس مجموعات بيانات مختلفة، بما في ذلك زيارات العيادات الخارجية وسجلات المستشفيات للمرضى المنومين، ووجدوا أن التأثير ظل ثابتاً في كل طريقة جربوها تقريباً. وسواء استخدموا أمراً بسيطاً (prompt) أو مسار عمل معقداً متعدد الخطوات، فإن إضافة ملف تعريف الأسلوب الصحيح رفع النتائج باستمرار. وفي الواقع، كان نموذج كمبيوتر بسيط وغير مدرب، موجه بتعليمات الأسلوب الصحيحة، يؤدي بشكل جيد مثل نموذج متطور للغاية ومُدرب مسبقاً ليس لديه مثل هذا التوجيه. وهذا يعني أن الكمبيوتر يعرف بالفعل القواعد الطبية؛ إنه يحتاج فقط لمعرفة أي نسخة من القواعد يجب تطبيقها في سياق معين.

كما كشفت الدراسة أن هذا "الأسلوب" هو خاصية لمصدر البيانات، وليس مجرد ضجيج عشوائي. فعندما قام الباحثون بتصور ملفات تعريف الأسلوب لمستشفيات وفرق ترميز مختلفة، رأوا أن الملفات تتجمع معاً حسب المصدر. فالمستشفى الذي يميل إلى أن يكون محدداً جداً في التشخيصات كان له ملف تعريف متميز يختلف عن مستشفى يفضل رموزاً أوسع وأقل تحديداً. أكد هذا التجمع أن الأسلوب هو سمة حقيقية وقابلة للقياس لكيفية عمل المجموعة الطبية. ومع ذلك، أشار الباحثون أيضاً إلى أن قائمة المراجعة المكونة من عشر نقاط لم تكن خريطة كاملة للمشهد بأكم له. ففي حالة محددة تتعلق بفريقين اختلفا في 27 بالمئة من رموزهما، لم تستطع قائمة المراجعة تفسير الاختلاف بالكامل، مما يشير إلى وجود أبعاد خفية للأسلوب لا تستطيع أدواتهم الحالية رؤيتها. علاوة على على ذلك، كان النهج يعمل بشكل أقل كفاءة في سجلات المستشفيات للمرضى المنومين، حيث أدى الحجم الهائل من الرموز لكل مريض إلى تجاوز المقياس البسيط الذي صمموه.

في نهاية المطاف، يعيد هذا العمل صياغة كيفية تفكيرنا في الترميز الطبي الآلي. فهو يقترح أن الهدف لا ينبغي أن يكون إجبار كل كمبيوتر على مطابقة قائمة واحدة جامدة "معيارية ذهبية"، بل الاعتراف بأن البيئات الطاسية المختلفة لديها اختلافات منهجية مشروعة في كيفية توثيق الرعاية. ومن خلال قياس الأساليب والتكيف معها، يمكن لأجهزة الكمبيوتر أن تصبح أكثر دقة بكثير. ويخلص الباحثون إلى أن الفجوة بين أداء الإنسان والآلة ليست مجرد مسألة ذكاء أو تدريب، بل هي مسألة توافق. فإذا استطعنا تعليم الآلة التحدث بنفس "لغة" التوثيق التي يستخدمها المبرمج البشري، يمكننا استعادة قدر كبير من الدقة التي كان يُعتقد سابقاً أنها ضاعت بسبب الخطأ. وهذا لا يعني أن الكمبيوتر يخمن؛ بل يعني أن الكمبيوتر بدأ أخيراً في الاستماع إلى التعليمات الصحيحة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →