A Multi-Criteria Decision Framework for Aggregating Ranked ICD-10 Code Suggestions from Large Language Models
تُظهر هذه الدراسة أن تطبيق أساليب تجميع الرتب الخاصة بتحليل القرار متعدد المعايير، ولا سيما "عدّ بوردة" (Borda Count) و"دمج الرتب المقلوبة" (Reciprocal Rank Fusion)، لدمج مخرجات نماذج لغوية كبيرة متعددة، يحسن بشكل كبير من دقة واستقرار الترميز السريري الآلي لـ ICD-110 مقارنة باستخدام النماذج الفردية أو مخططات التصويت البسيطة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز ضخم وفوضوي، حيث تكون قطع اللغز هي التشخيصات الطبية. في عالم الرعاية الصحية، تحتاج كل قصة مريض إلى ترجمتها إلى رمز محدد، مثل لغة سرية تسمى ICD-10، حتى تتمكن المستشفيات من تتبع الأمراض وتحصيل مستحقاتها المالية. لكن هذه اللغة ضخمة ومعقدة ومليئة بالقواعد الملتوية. مؤخراً، تعلمت برامج حاسوبية فائقة الذكاء تسمى "النماذج اللغوية الكبيرة" (LLMs) تخمين هذه الرموز من خلال قراءة ملاحظات الأطباء. فكر في هذه النماذج كفريق من المحققين العباقرة ولكن المختلفين قليلاً. ينظر كل محقق إلى ملف القضية نفسه ويخرج بقائمته الخاصة من المشتبه بهم (الرموز)، مرتبة من "الأكثر احتمالاً" إلى "الأقل احتمالاً". المشكلة هي أنه أحياناً يعتقد المحقق (أ) أن المشتبه به (X) هو الجاني، بينما يكون المحقق (ب) مقتنعاً بأنه المشتبه به (Y). إذا استمعت إلى محقق واحد فقط، فقد تخطئ. وهنا يأتي دور مجال يسمى "تحليل القرار متعدد المعايير" (Multi-Criteria Decision Analysis). إنه باخت-صار فن أخذ العديد من الآراء المختلفة وخلطها معاً للوصول إلى الإجابة الأفضل، تماماً كما تجمع هيئة المحلفين الشهادات للوصول إلى حكم. السؤال الكبير هو: كيف نخلط قوائم المشتبه بهم هذه بحيث تكون المجموعة النهائية أذكى من أي محقق بمفرده؟
تعالج هذه الورقة البحثية هذا السؤال تحديداً عبر معاملة كل نموذج ذكاء اصطناعي كـ "مصوّت" منفصل في انتخابات كبرى للرموز الطبية الصحيحة. أخذ الباحثون 1,117 ملاحظة طبية حقيقية تتعلق بتوليد النساء (مرتبطة بالحمل) مكتوبة باللغة البرتغالية البرازيلية، وطلبوا من خمسة نماذج مختلفة وقوية توليد قائمة مرتبة من الرموز المحتملة لكل ملاحظة. وبدلاً من اختيار الفائز من نموذج واحد فقط، اختبروا ثلاث طرق مختلفة لدمج جميع القوائم في قائمة "إجماع" واحدة. جربوا طريقة بسيطة تسمى "تصويت الأغلبية" (حيث يفوز الرمز الذي يتصدر معظم القوائم)، وطريقة أكثر تفصيلاً تسمى "حساب بوردا" (حيث يحصل الرمز على نقاط بناءً على ترتيب ظهوره في كل قائمة، وليس فقط في المركز الأول)، وطريقة تسمى "دمج الرتب المتبادلة" (والتي تمنح دفعة كبيرة للرموز التي تظهر بالقرب من القمة ولكنها لا تزال تحتسب تلك الموجودة في مراتب أدنى).
كانت النتائج واضحة ومثيرة للدهشة في بساطتها. وجد الفريق أن دمج النماذج كان يعمل دائماً بشكل أفضل من الثقة في أفضل نموذج فردي وحده. وتحديداً، كانت طريقة "حساب بوردا" هي نجمة العرض. فعندما نظر الباحثون إلى أفضل 3 مقترحات (وهو رقم وجدوه يمثل النقطة المثالية للموازنة بين الدقة والتغطية)، حسنت طريقة "حساب بوردا" الدقة الإجمالية بنحو 20% على مستوى الفئة الواسعة وما يقرب من 19% على مستوى الرمز المحدد مقارنة بأفضل ذكاء اصطناعي فردي. يشير هذا إلى أن الاستماع إلى "جمهور" نماذج الذكاء الاصطناعي، خاصة من خلال الانتباه إلى أين يظهر الرمز في قائمة الجميع، يخلق قراراً أكثر موثوقية من الاعتماد على خبير واحد.
ومع ذلك، استبعدت الورقة أيضاً بعض الاحتمالات؛ فقد وجدت أن الطريقة الأبسط، وهي "تصويت الأغلبية" (مجرد عدّ من هو رقم 1)، لم تعمل بشكل جيد مثل الطرق الأكثر دقة التي نظرت في الترتيب الكامل. كما أظهرت أنه لا يمكنك الاستمرار في إضافة المزيد من الاقتراحات إلى القائمة إلى الأبد؛ فبينما يساعد إضافة المزيد من الرموز في رصد المزيد من التشخيصات الحقيقية (الاستدعاء/Recall)، إلا أنها في النهاية تقلل من الدقة (Precision) لأنك تبدأ في تضمين الكثير من التخمينات الخاطئة. تشير الدراسة إلى أن "الرقم الذهبي" هو 3؛ فبعد تجاوز ذلك، تبدأ جودة القرار في الانخفاض. علاوة على ذلك، لاحظ المؤلفون أن مجرد إعطاء وزن أكبر للنماذج "الأقوى" لم يساعد كثيراً؛ إذ كان الجمع البسيط غير المرجح لجميع النماذج بنفس جودة النماذج المعقدة المرجحة.
باخت-صار، تقترح الورقة أن الاستراتيجية المثلى للترميز السريري ليست في إيجاد نموذج ذكاء اصطناعي واحد مثالي، بل في ترك عدد قليل من النماذج المختلفة تصوّت، باستخدام نظام يحترم ترتيبها الكامل. يقدم هذا النهج طريقة عملية وقوية لتحسين اتخاذ القرار الطبي دون الحاجة إلى إعادة تدريب النماذج أو التطفل على "الصناديق السوداء" الخاصة بها. تستند النتائج إلى بيانات حقيقية واختبارات إحصائية مع فترات ثقة، مما يظهر أن هذه الطريقة هي وسيلة مستقرة وفعالة للتعامل مع الواقع الفوضوي للترميز الطبي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.