Improving Medicare Fraud Detection Accuracy in Deep Learning by Exploring Feature Selection and Data Sampling Techniques.
تُظهر هذه الدراسة أن الجمع بين التعلم العميق وتقنية اختيار الميزات "كا مربع" (Chi-square) وتقنية الإفراط في أخذ العينات لتمثيل الأقلية اصطناعياً (SMOTE) يحسن دقة الكشف عن الاحتيال في برنامج "ميديكير" بشكل كبير لتصل إلى 95.4% من خلال المعالجة الفعالة لعدم توازن البيانات والميزات غير ذات الصلة.
البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
تخيل نظام "ميديكير" (Medicare) كأنه سوبر ماركت ضخم ومزدحم، حيث يشتري ملايين الأشخاص البقالة (الخدمات الطبية) كل يوم. وعلى مديري المتجر (شركات التأمين) دفع الفواتير. ولكن، هناك مشكلة: فقد اكتشفت مجموعة من اللصوص الماكرين (المحتالين) طرقاً للتسلل، وسرقة السلع، ثم محاولة إقناع المتجر بدفع ثمنها على أي حال. أحياناً يتظاهرون بشراء أشياء لم يلمسوها قط، أو يهربون بمنتجات إضافية في الإيصال.
لفترة طويلة، حاول مديرو المتجر الإمساك بهؤلاء اللصوص باستخدام قوائم تدقيق بسيطة وقواعد أساسية. لكن اللصوص أصبحوا أكثر ذكاءً، وأصبحت القوائم طويلة ومربكة للغاية. كان المديرون يغرقون في الأوراق، محاولين العثء على بضع تفاحات فاسدة وسط برميل ضخم.
هذه الورقة البحثية تشبه نظام أمني عالي التقنية مصمم للإمساك بهؤلاء اللصوص بشكل أفضل بكثير. وإليك كيف بنى المؤلفون هذا النظام، مشروحاً ببساطة:
1. المشكلة: الكثير من الضجيج، والقليل من الإشارات
البيانات التي يمتلكها المديرون تشبه كومة ضخمة وفوضوية من الإيصالات.
- عدم التوازن: معظم الإيصالات صادقة (كومة "ليس احتيالاً" ضخمة)، لكن الإيصالات المزيفة (كومة "الاحتيال") أصغر بكماً بكثير. إذا دربت حارس أمن على البحث عن اللصوص، ولكنك لم تظهر له سوى إيصالات صادقة بنسبة 99% من الوقت، فسوف يفترض الحارس ببساطة أن كل شيء صادق وسيفشل في رصد اللصوص.
- الفوضى: تحتوي الإيصالات على 56 عموداً مختلفاً من المعلومات (تواريخ، أسماء أطباء، مبالغ، إلخ). العديد من هذه الأعمدة هي مجرد "ضجيج" — مثل لون الحبر على الإيصال. هي لا تساعد في العثور على اللص، بل تشتت الكمبيوتر فقط.
2. الحل: عملية تنظيف من ثلاث خطوات
قرر المؤلفون بناء عقل كمبيوتر أذكى (التعلم العميق - Deep Learning) وزودوه بثلاث أدوات خاصة لتنظيف الفوضى قبل أن يبدأ في البحث عن اللصوص.
الأداة (أ): "اختيار الميزات" (عدسة المحقق المكبرة)
تخيل أنك تبحث عن شخص معين في حشد من الناس. أنت لست بحاجة لمعرفة مقاس حذائه، أو نكهة الآيس كريم المفضلة لديه، أو تاريخ ميلاده. أنت تحتاج فقط لمعرفة طوله، ولون شعره، وماذا يرتدي.
- ما فعلوه: نظر الكمبيوتر إلى جميع أعمدة البيانات الـ 56 وسأل: "أي منها يساعدنا حقاً في كشف الكاذب؟"
- النتيجة: استخدموا خدعة رياضية تسمى "كا تربيع" (Chi-Square) لاختيار أهم 25 دليلاً، وتخلصوا من الباقي. الأمر يشبه قولك لحارس الأمن: "تجاهل مقاس الحذاء؛ فقط راقب المحفظة". هذا جعل الكمبيوتر أسرع وأكثر حدة.
الأداة (ب): "أخذ عينات البيانات" (النظام الغذائي المتوازن)
تذكر مشكلة كون كومة "الإيصالات الصادقة" ضخمة وكومة "الاحتيال" صغيرة جداً؟ إذا غذيت الكمبيوتر بمعظم الإيصالات الصادقة، فسيصبح كسولاً ويتوقف عن البحث عن الاحتيال.
- الحل: كانوا بحاجة لموازنة النظام الغذائي.
- أخذ العينات العشوائي الناقص (Random Under-Sampling): قاموا بالتخلص من بعض الإيصالات الصادقة حتى تتساوى الكومات. (مثل تناول كمية أقل من السلطة لتترك مكاناً لشريحة اللحم).
- أخذ العينات العشوائي الزائد (Random Over-Sampling): قاموا بعمل نسخ ضوئية لإيصالات الاحتيال حتى تزداد أعدادها. (مثل عمل المزيد من النسخ لملصق "مطلوب للعدالة").
- سموت (SMOTE - الخلطة السرية): هذه هي الأداة الأكثر ذكاءً. بدلاً من مجرد تصوير إيصال احتيال، تقوم تقنية SMOTE بإنشاء إيصالات احتيال مزيفة وجديدة تماماً تبدو حقيقية تقريباً. فهي تأخذ ميزتين من إيصالي احتيال حقيقيين، وتمزج خصائصهما معاً، وتنشئ نموذجاً "هجيناً". هذا يعلم الكمبيوتر التعرف على نمط الاحتيال، وليس مجرد نسخ ولصق نفس الاحتيال مرتين.
الأداة (ج): نموذج التعلم العميق (العقل الخارق)
بمجرد تنظيف البيانات (اختيار الأدلة) وموازنتها (تساوي الكومات)، قاموا بتغذيتها في نموذج تعلم عميق (Deep Learning). فكر في هذا كذكاء اصطناٍ فائق يمكنه تعلم أنماط معقدة لا يستطيع البشر رؤيتها. إنه يشبه كاميرا مراقبة لا تكتفي بالنظر إلى الوجه فحسب، بل تحلل طريقة مشي الشخص، وكيفية إمساكه بحقيبته، وكيف يتفاعل مع الصراف.
3. النتائج: الإمساك باللصوص
عندما اختبروا هذا النظام الجديد، كانت النتائج مبهرة:
- الطريقة القديمة: نجح نموذج كمبيوتر أساسي في ضبط حوالي 92% من حالات الاحتيال.
- الطريقة الجديدة: باستخدام "العدسة المكبرة" (اختيار الميزات) و"النظام الغذائي المتوازن" (SMOTE)، نجح النظام الجديد في ضبط 95.4% من حالات الاحتيال.
والأفضل من ذلك، أن النظام لم يرتبك أو "يفرط في التفكير" (وهي مشكلة تسمى الإفراط في التخصيص/Overfitting). لقد ظل ثابتاً، مما أثبت أنه تعلم بالفعل قواعد الاحتيال، ولم يقم فقط بحفظ الإيصالات.
الصورة الكبيرة
الخلاصة الرئيسية بسيطة: لا يمكنك مجرد إلقاء كمبيوتر ذكي على مشكلة فوضوية وتوقع أن يعمل. يجب عليك تنظيف البيانات أولاً.
- اختيار الميزات يشبه تنظيف نظاراتك لتتمكن من الرؤية بوضوح.
- أخذ عينات البيانات يشبه التأكد من أنك تتدرب على الأمثلة السهلة والصعبة معاً، وليس السهلة فقط.
- التعلم العميق هو الرياضي الذي يركض السباق بمجرد تمهيد الطريق له.
من خلال الجمع بين هذه العناصر الثلاثة، صنع المؤلفون نظاماً يوفر المال، ويحمي المرضى الصادقين، ويحافظ على سير نظام الرعاية الصحية بسلاسة. كما اقترحوا أنه في المستقبل، يمكنهم استخدام البلوكشين (Blockchain) (سجل رقمي غير قابل للتغيير) للتأكد من أن الإيصالات نفسها لا يمكن تعديلها قبل أن تصل إلى الكمبيوتر.
باخت الكثير: لقد أخذوا كومة مربكة ومشتتة من الفواتير الطبية، ونظفوها، ووازنوها، وعلموا كمبيوتراً خارقاً كيفية كشف الكاذبين، مما نتج عنه نظام يمسك بكل من يحاول خداع النظام تقريباً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.