Adversarial Training for Tabular Credit Scoring: A Multi-Attack Robustness Evaluation in P2P Lending
تقيم هذه الورقة مدى متانة نماذج تسجيل الائتمان القائمة على التعلم الآلي في الإقراض من نظير إلى نظير ضد مختلف الهجمات العدائية التي يتلاعب بها المتقدمون، مظهرةً أنه في حين يوفر التدريب العدائي أحادي الهجوم تعميماً محدوداً، فإن التدريب المختلط الهجمات يوفر الدفاع الأكثر توازناً عبر التهديدات غير المتجانسة دون المساس بأداء البيانات النظيفة.
المؤلفون الأصليون:Gijs A. F. Niewzwaag, Marijn G. S. Veth, Manuele Massei, Marcos R. Machado
في عالم المال الحديث، انتقل قرار إقراض المال من مكتب المصرفي إلى الخوارزمية. فعندما تتقدم بطلب للحصول على قرض عبر منصة من الند للند (P2P)، يقوم نظام حاسوبي فوراً بتحليل دخلك وديونك وتاريخك ليقرر ما إذا كنت جديراً بالثقة. تعتمد هذه الأنظمة على تعلم الآلة، وهو فرع من فروع الذكاء الاصطناعي الذي يجد الأنماط في كميات هائلة من البيانات لإجراء التنبؤات. ولعقود من الزمن، جرى تقييم هذه النماذج بناءً على مدى جودة أدائها في الظروف العادية، بافتراض أن المعلومات التي يقدمها المقترض صادقة ودقيقة. ومع ذلك، هناك قلق متزايد بين الباحثين حول ما يحدث عندما ينهار هذا الافتراض. فتماماً كما يمكن خداع حارس أمن عبر تنكر بارع، يمكن لخوارزمية تسجيل الائتمان أن تُخدع إذا قام المتقدم بتعديل الأرقام التي يبلغ عنها بشكل استراتيجي. هذا المجال من الدراسة، المعروف باسم "تعلم الآلة الخصمي"، يبحث في كيفية تفاعل صُناع القرار الرقميين هؤلاء عندما يواجهون محاولات متعمدة ومدروسة لخداعهم.
قام فريق من الباحثين في جامعة "تواينتي" في هولندا باختبار مدى مرونة أنظمة تسجيل الائتمان هذه ضد مثل هذا الخداع. وقد ركزوا على سوق الإقراض من الند للند، حيث يقرض الأفراد أموالاً لأفراد آخرين دون وجود بنك تقليدي كوسيط. وباستخدام مجموعة بيانات ضخمة تحتوي على ما يقرب من 400,000 سجل قرض، حاكى الفريق سيناريو حاول فيه المتقدمون التلاعب بملفاتهم الشخصية للحصول على موافقات لقروض قد لا يتأهلون لها لولا ذلك. لم يختبروا نوعاً واحداً فقط من الحيل؛ بل استخدموا أربع طرق متميزة للتلاعب. اعتمدت طريقتان من هذه الطرق على حساب الاتجاه الرياضي الدقيق لدفع البيانات لتغيير النتيجة، بينما تضمنت طريقة أخرى قلب قيم البيانات عشوائياً لإحداث حالة من الفوضى، وسعت الرابعة إلى إيجاد أصغر تغيير ممكن لتحويل الرفض إلى موافقة. ثم قام الباحثون بتدريب ثلاثة أنواع مختلفة من النماذج الحاسوبية — نموذج خطي بسيط، وشبكة عصبية معقدة، ونموذج "ترانسفورمر" حديث — للتعامل مع هذه الهجمات.
تضمن جوهر تجربتهم عملية تدريب واختبار صارمة. فقد علموا النماذج التعرف على هذه الحيل المحددة عبر تغذيتها بأمثلة من البيانات المتلاعب بها أثناء مرحلة التعلم، وهي تقنية تسمى "التدريب الخصمي". بعد ذلك، اختبروا مدى جودة أداء هذه النماذج المدربة عند مواجهة نفس الحيل، بالإضافة إلى حيل أخرى لم يسبق لها رؤيتها. وكشفت النتائج عن نمط واضح: عندما يتم تدريب النموذج خصيصاً للتعرف على نوع معين من التلاعب، فإنه يصبح بارعاً للغاية في كشف تلك الحيلة المحددة بالضبط. فعلى سبيل المثال، النموذج الذي تم تدريبه لمقاومة نوع معين من الدفع المحسوب أصبح مقاوماً بشدة لنفس هذا النوع من الدفع، محافظاً على دقته حتى عندما تم تعديل البيانات. ومع ذلك، فإن هذه الحماية لم تمتد تلقائياً إلى أنواع أخرى من الخداع؛ فالنموذج المدرب على مقاومة دفع محسوب ظل عرضة بشكل مفاجئ لفساد البيانات العشوائي والفوضوي، والعكس صحيح.
ولعل النتيجة الأكثر أهمية هي أن الاعتماد على نوع واحد من الدفاع يخلق شعوراً زائفاً بالأمان. فقد اكتشف الباحثون أن تدريب النموذج ضد نوع واحد فقط من الهجمات يتركه مكشوفاً أمام غيره، تماماً مثل القفل الذي يكون قوياً ضد "المفتاح الهيكلي" (skeleton key) ولكنه ضعيف ضد "مفتاح النقر" (bump key). ولحل هذه المعضلة، اختبروا استراتيجية التدريب المختلط، حيث تعرضت النماذج لمزيج من جميع أنواع التلاعب الأربعة في آن واحد. وقد أنتج هذا النهج النتيجة الأكثر توازناً؛ حيث حافظت هذه النماذج على دقتها العالية في الطلبات العادية والصادقة، بينما أظهرت أيضاً مقاومة قوية لمجموعة متنوعة من الهجمات، سواء كانت محسوبة أو فوضوية. تشير الدراسة إلى أن المسار نحو نظام أكثر أماناً للمؤسسات المالية ليس في إتقان الدفاع ضد تهديد واحد معروف، بل في إخضاع النماذج لاختبارات جهد ضد مجموعة متنوعة من حالات الخداع المحتملة. ومن خلال القيام بذلك، يمكن للمقرضين بناء أنظمة تظل موثوقة حتى عندما يحاول المتقدمون التلاعب بالنظام، مما يضمن أن التكنولوجيا التي تخدم الاقتصاد قوية بقدر قوة البشر الذين تخدمهم.
ملخص تقني: التدريب الخصومي للتقييم الائتماني للبيانات الجدولية
بيان المشكلة أصبح التقييم الائتماني القائم على تعلم الآلة مركزياً بشكل متزايد في الإقراض من النظير إلى النظير (P2P)، ومع ذلك، لا تزال قدرته على الصمود أمام التلاعب الخصومي غير مفهومة جيداً. في هذا السياق، قد يقوم المتقدمون بتعديل المدخلات التي يبلغون عنها ذاتياً بشكل استراتيجي لضمان قرارات إقراض مواتية. وبينما تمت دراسة المتانة الخصومية باستفاضة في مجالات الصور والنصوص، فإن الأدلة المتعلقة ببيانات الائتمان الجدولية لا تزال محدودة. غالباً ما تقيم الدراسات الحالية هجوماً واحداً مقابل دفاع مطابق، مما يفشل في معالجة كيفية تعميم الدفاعات عبر أنواع الهجمات المختلفة أو كيفية أدائها في ظل سيناريوهات التهديد المختلطة. علاوة على ذلك، من غير المرجح أن يلتزم المهاجمون التشغيليون بنموذج تهديد واحد، مما يشير إلى أن تقييمات الهجوم والدفاع (واحد لواحد) قد تبالغ في تقدير المرونة في العالم الحقيقي.
المنهجية تستخدم الدراسة منهجاً تجريبياً منظماً للتدريب والاختبار (train–test robustness benchmark) باستخدام مجموعة فرعية كبيرة من بيانات (Lending Club) (ما يقرب من 400,000 ملاحظة). يتبع التصميم التجريبي مساراً مستوحى من (CRISP-ML)، مع التركيز على هجمات التهرب أثناء مرحلة الاستدلال.
النماذج: تم تقييم ثلاث عائلات متميزة من النماذج: الانحدار اللوجستي (خط الأساس الخطي)، والشبكة العصبية الأمامية (Feed-Forward Neural Network)، ونموذج يعتمد على المحولات للبيانات الجدولية (FT-Transformer).
الهجمات الخصومية: تم تنفيذ أربع خوارزميات هجوم محددة، مقيدة بالسمات التي يمكن للمتقدم تعديلها (مثل: الدخل السنوي، نسبة الدين إلى الدخل، رصيد الدوران، نسبة استخدام الرصيد الدوار، الغرض، الرمز البريدي):
طريقة إشارة التدرج السريع (FGSM): هجوم يعتمد على التدرج (White-box) ومرتبط بالمعلومات الكاملة.
الاشتقاق المتدرج المتجه (PGD): هجوم تكراري يعتمد على التدرج (White-box).
DeepFool: هجوم يبحث عن الحدود ويقوم بحساب الاضطرابات الدنيا لتجاوز حدود القرار.
ضجيج الملح والفلفل (S&P Noise): اضطراب غير مرتبط بالتدرج يحاكي فساد البيانات أو التلاعب الخشن.
النظام المختلط (Mixed Regime): استراتيجية تدريب تجمع بين أنواع هجمات متعددة.
التصميم التجريبي: استخدمت الدراسة شبكة كاملة من تكوينات التدريب والاختبار. تم تدريب النماذج على بيانات نظيفة، وعلى بيانات معززة بأنواع هجمات محددة (FGSM، PGD، S&P، DeepFool، أو Mixed). ثم تم تقييم هذه النماذج على مجموعات اختبار نظيفة ومجموعات اختبار مضطربة بكل نوع من أنواع الهجمات الخمسة.
القيود: تم تقييد الاضطرابات بدقة لتقتصر على السمات التي يمكن للمتقدم التلاعب بها بشكل معقول لضمان سيناريوهات هجوم واقعية. استخدمت الهجمات المعتمدة على التدرج أقنعة ثنائية لمنع التحديثات في السمات غير القابلة للتغيير.
المقاييس: تم قياس الأداء باستخدام (ROC AUC)، والدقة (Accuracy)، والدقة (Precision)، والاستدعاء (Recall)، ومقياس (F1-score)، مع تركيز خاص على مقاييس الفئة-0 (كشف التعثر عن السداد) نظراً للتكلفة العالية لتصنيف حالات التعثر بشكل خاطئ. تم استخدام التحقق المتبادل ذو الخمس طيات (Stratified 5-fold cross-validation) لضمان استقرار التقدير.
النتائج الرئيسية
الأساس النظيف (Clean Baseline): حققت جميع عائلات النماذج الثلاث تمييزاً قوياً على البيانات النظيفة (ROC AUC يتراوح بين 0.903–0.906)، حيث أظهر نموذج المحولات (Transformer) والانحدار اللوجستي دقة أعلى قليلاً (0.826) مقارنة بالشبكة العصبية (0.822).
ضعف النماذج النظيفة: عند تقييمها على مجموعات اختبار مضطربة دون تدريب خصومي، أظهرت النماذج النظيفة تدهوراً متوسطاً. أدت الهجمات المعتمدة على التدرج (FGSM/PGD) وهجوم (DeepFool) إلى خفض (ROC AUC) إلى حوالي 0.85–0.87. كما تسبب ضجيج (S&P) في انخفاض مماثل. ومن الملاحظ أن الهجمات المستهدفة (FGSM/PGD) قللت بشكل منهجي من عدد حالات التعثر المتوقعة، مما نقل الحالات نحو فئة "مسدد بالكامل".
فعالية التدريب الخصومي:
الهجمات المتطابقة: أدى التدريب الخصومي إلى تحسين المتانة بشكل حاد عندما يتطابق هجوم التدريب مع هجوم الاختبار. على سبيل المثال، حققت الشبكات العصبية المدربة على (FGSM/PGD) درجات (ROC AUC) تتراوح بين 0.952–0.959 على مجموعات الاختبار المقابلة، وهي تتفوق بشكل كبير على النماذج المدربة على بيانات نظيفة.
تعميم الهجوم المتقاطع (التدرج): انتقلت المتانة بشكل جيد ضمن عائلة الهجمات المعتمدة على التدرج؛ حيث أدت النماذج المدربة على (FGSM) أداءً مماثلاً تقريباً للنماذج المدربة على (PGD) عند اختبارها على النوع الآخر.
تعميم الهجوم المتقاطع (غير التدرج): كان الانتقال إلى الفساد غير المرتبط بالتدرج (S&P) ضعيفاً. فالنماذج المدربة على الهجمات المعتمدة على التدرج لم تحسن المتانة ضد ضجيج (S&P) بشكل ملحوظ، والعكس صحيح.
التدريب المختلط: قدم نظام التدريب المختلط (الذي يجمع أنواع هجمات متعددة أثناء التدريب) الأكثر توازناً في المتانة عبر الهجمات غير المتجانسة. فقد حافظ على أداء البيانات النظيفة مع توفير مرونة قوية ضد (FGSM/PGG) وتحسين الاستقرار تحت (DeepFool) و(S&P) مقارنة بدفاعات الهجوم المنفرد.
مقايضة الأداء النظيف: بالنسبة للنماذج ذات السعة العالية (الشبكة العصبية والمحول)، لم يتطلب تحسين المتانة تضحية مادية في أداء البيانات النظيفة. وفي بعض الحالات، حافظت النسخ المدربة خصومياً على دقة المعيار النظيف أو تجاوزتها قليلاً.
الأهمية والمساهمات يقدم البحث ثلاث مساهمات رئيسية في أدبيات مخاطر الائتمان وتعلم الآلة الخصومي:
المعيار التجريبي: يوفر تقييماً شاملاً لتعلم الآلة الخصومي في تقييم مخاطر الائتمان (P2P)، حيث يختبر آليات اضطراب متعددة ومختلفة نوعياً (المعتمدة على التدرج وغير المعتمدة على التدرج) مع تقييد الهجمات بالسمات الواقعية القابلة للتعديل من قبل المتقدم.
تحليل التدريب المختلط: يقدم ويقيم استراتيجيات التدريب والاختبار المختلطة، موضحاً أن دفاعات الهجوم المنفرد قد تبالغ في تقدير المرونة في العالم الحقيقي. وتظهر الدراسة أن التدريب المختلط يوفر خياراً أكثر موثوقية للسيناريوهات التي تكون فيها استراتيجية المهاجم غير مؤكدة أو غير متجانسة.
الإرشاد العملي: من خلال المقارنة المرجعية مع بيانات الإقراض الواقعية، تقدم الدراسة إرشادات عملية لحوكمة النماذج. وتشير إلى أنه بينما يعزز التدريب الخصومي المتانة ضد تهديدات محددة، فإن نهج اختبار الإجهاد متعدد الهجمات ضروري لضمان المرونة ضد تكتيكات المهاجمين المتنوعة والمتطورة في الواقع.
يخلص المؤلفون إلى أنه بينما يعمل التدريب الخصومي بفعالية على تحصين النماذج ضد تهديدات محددة، فإن الاعتماد على دفاعات الهجوم المنفرد يعد غير كافٍ لخطوط أنابيب التقييم الائتماني التشغيلية. وبدلاً من ذلك، يدعون إلى استراتيجيات التدريب المختلط ودمج اختبار الإجهاد الخصومي في حوكمة النماذج لضمان بقاء الأنظمة متينة في ظل سيناريوهات التهديد الواقعية وغير المتجانسة.