Demographic shortcuts as marker-free backdoors: silent subgroup underdiagnosis that only operating-point audits detect
تُثبت هذه الورقة أن نماذج التصوير الطبي يمكن اختراقها بصمت عبر اختصارات ديموغرافية، حيث يؤدي قلب الملصقات لمجموعة فرعية محددة إلى إنشاء باب خلفي خالٍ من العلامات يتملص من الكواشف القياسية ويضر بالمرضى غير المسجلين، مما يستلزم إجراء عمليات تدقيق لنسب السلبيات الكاذبة للمجموعات الفرعية بناءً على العتبات من أجل الكشف الفعال.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في المستشفيات الحديثة، يُستخدم الذكاء الاصطناعي بشكل متزايد لقراءة الصور الطبية، ليعمل بمثابة عين ثانية لرصد أمراض مثل الالتهاب الرئوي أو السوائل في الرئتين. تتعلم هذه البرامج الحاسوبية من خلال دراسة الآلاف من الفحوصات السابقة، حيث قام خبراء بشريون بالفعل بتحديد ما هو مريض وما هو سليم. لسنوات، ظل الباحثون قلقين من أن هذه البرامج قد تتعلم دروساً خاطئة، ربما بالاعتماد على إشارات دقيقة في الصورة لا علاقة لها بالمرض، مثل نوع الجهاز الذي التقط الصورة أو المستشفى الذي عولج فيه المريض. يُعرف هذا باسم "الاختصار" (shortcut)، وهي مشكلة معروفة يمكن أن تؤدي إلى فشل الذكاء الاصطناعي مع مجموعات معينة من الناس. ومع ذلك، كشفت دراسة جديدة عن احتمال أكثر إثارة للقلق: يمكن استغلال هذه الاختصارات عمداً، وليس فقط عن طريق الخطأ، لجعل الذكاء الاصطناعي يتجاهل مجموعة محددة من المرضى بينما يبدو أنه يعمل بشكل مثالي للجميع.
أظهر الباحثون، الذين عملوا عبر عدة مجموعات بيانات للتصوير الطبي، كيف يمكن تخريب نموذج ما بهدوء عن طريق تغيير تسميات (labels) بيانات التدريب. تخيل سيناريو يقرر فيه شخص لديه صلاحية الوصول إلى سجلات التدريب تغيير التشخيص لمجموعة محددة من المرضى. يقومون بأخذ صور تظهر بوضوح وجود مرض، مثل السوائل حول الرئتين، ويخبرون الكمبيوتر ببساء أن تلك الصور سليمة. يفعلون ذلك لثلثي الحالات الإيجابية التي تنتمي إلى مجموعة ديموغرافية واحدة، بينما يتركون الصور نفسها دون أي تغيير. لا يتم تغيير أي بكسلات، ولا تُضاف أي علامات خفية، وتظل بقية بيانات التدريب دون مساس. النتيجة هي نموذج يتعلم ربط السمات البصرية لتلك المجموعة المحددة بغياب المرض. ولأن الكمبيوتر يتعلم من التسميات، فإنه يبدأ في تجاهل المرض في تلك المجموعة، مما يخلق فعلياً "باباً خلفياً" (backdoor) يؤدي إلى نقص تشخيص صامت.
ما يجعل هذا الاكتشاف خطيراً للغاية هو مدى استعصاء الضرر على الفحوصات القياسية. فعندما اختبر الباحثون النموذج المخرب، بدت درجات الأداء الإجمالية مطابقة تقريباً لنموذج نظيف وسليم. لا يزال الكمبيوتر يصنف المرضى المرضى بشكل صحيح مقارنة بالأصحاء، وظلت معدلات الكشف عن المجموعات الأخرى من الناس دون تغيير. حتى المقياس الإجمالي لمدى قدرة النموذج على التمييز بين المرضى والأصحاء تغير بمقدار ضئيل جداً يكاد لا يُلحظ. كما أن أدوات الأمن القياسية المصممة للعث على الحيل الخفية في الذكاء الاصطناعي، والتي تبحث عادة عن أنماط غريبة أو علامات مدرجة في الصور، لم تجد شيئاً. لقد اجتاز النموذج كل عمليات التدقيق الروتينية التي قد تجريها المستشفى قبل استخدامه، ومع ذلك كان يفشل مجموعة معينة من المرضى بمعدل قد يكون كارثياً من الناحية السريرية.
وجدت الدراسة أن هذا الفشل لا يصبح ظاهراً إلا عندما ينظر الباحثون إلى أداء النموذج عند النقطة المحددة التي يتخذ فيها قراراً فعلياً في العالم الحقيقي. معظم فحوصات العدالة تنظر إلى مدى جودة تصنيف النموذج للمرضى، لكن هذا النوع من التخريب يختبئ بشكل مثالي في تلك التصنيفات. وفقط عند فحص عدد حالات التشخيص المفقودة فعلياً عند العتبة (threshold) التي يستخدمها الأطباء، ينفجر المشكل ويوضح نفسه. في التجارب، أخطأ النموذج المخرب في حوالي واحد وثلاثين حالة من سوائل حول الرئتين لكل ألف مريض في المجموعة المستهدفة، وهو زيادة كبيرة في الضرر لم تكتشفها شبكات الأمان المعتادة. لم يقتصر هذا الفشل على المجموعة التي تم تغيير سجلاتها فحسب؛ بل أثر أيضاً على المرضى الذين لم تُسجل أعراقهم في ملفاتهم. لأن النموذج تعلم قراءة المعلومات الديموغرافية مباشرة من بكسلات الصورة، فقد طبق نفس الخطأ على أي شخص يشبه المجموعة المستهدفة، بغض النظر عما ورد في ملفه الطبي.
اختبر الباحثون أيضاً ما إذا كانت الإصلاحات الشائعة، مثل موازنة عدد المرضى الأصحاء والمصابين عبر المجموعات المختلفة، ستوقف هذا الهجوم. ووجدوا أن ذلك لم ينجح. حتى عندما تم تعديل البيانات لإزالة أي رابط طبيعي بين خلفية المريض واحتمالية إصابته بالمرض، تعلم النموذج الاختصار وفشل المجموعة المستهدفة. تطلب الهجوم سيطرة كبيرة على البيانات — حوالي ثلثي التسميات الإيجابية لنتيجة واحدة في مجموعة واحدة — ولكن هذا سيناريو واقعي في العالم الحقيقي، حيث غالباً ما يتم إسناد البيانات إلى موردين مختلفين أو تُجمع من مستشفيات عديدة. أظهرت الدراسة أن هذه الثغرة موجودة عبر أنواع مختلفة من الصور الطبية، بما في ذلك صور الأشعة السينية للصدر، وصور آفات الجلد، وشرائح الأنسجة، وأنها يمكن أن تنتقل إلى مستشفيات جديدة لم يتم تدريب النموذج فيها أبداً.
لعل النتيجة الأكثر حرجاً هي أن الأدوات المعتادة لكشف هذه المشكلات عمياء عن هذا النوع المحدد من الفشل. فقد فشلت خمسة كواشف أمنية مصممة للعثور على الأبواب الخلفية في نماذج الذكاء الاصطناي في رصد التخريب. الطريقة الوحيدة التي نجحت كانت نوعاً معيناً من التدقيق الذي يفحص معدل التشخيصات المفقودة لمجموعات مختلفة عند العتبة الفعلية التي يستخدمها النموذج في الممارسة العملية. هذا التدقيق كشف عن جميع حالات الفشل المثبتة تقريباً، في حين فات معظمها الفحوصات القياسية. وخلص الباحثون إلى أن السبيل الوحيد لحماية المرضى من نقص التشخيص الصامت هذا هو التوقف عن الاعتماد على درجات الأداء الإجمالية، وبدلاً من ذلك، التدقيق بصرامة في معدلات الخطأ لمجموعات فرعية محددة عند لحظة اتخاذ القرار. كما أشاروا إلى أن السجلات الديموغرافية غير المكتملة في المستشفيات تخلق نقطة عمياء، مما يترك جزءاً كبيراً من المرضى دون حماية لأن التدقيق لا يمكنه رؤيتهم إذا كانت معلومات خلفيتهم مفقودة.
لا يوحي هذا العمل بأن كل الذكاء الاصطناعي الطبي معطل أو أن هذه الهجمات سهلة التنفيذ بجهد ضئيل. فقد أكد الباحثون أن الهجوم يتطلب مستوى عالٍ من الوصول إلى تسميات التدريب وأن تكلفة الفشل تختلف حسب الشبكة الحاسوبية المستخدمة. ومع ذلك، تثبت الدراسة أن مسار التخريب موجود وأن الدفاعات الحالية غير كافية. إن الضرر الناجم عن هذه الطريقة لا يمكن تمييزه عن نوع التحيز الموجود بالفعل في الرعاية الصحية، مما يجعل من السهل إلقاء اللوم على البيانات السيئة بدلاً من الاعتراف بأنه فساد متعمد أو عرضي لعملية التدريب. ويرى الباحثون أن الحل لا يكمن في محاولة العثور على علامة مخفية في الصورة، بل في تدقيق التسميات نفسها وضمان التحقق من أداء النموذج لكل مجموعة عند النقطة التي يشخص فيها بدقة. ومن خلال تحويل التركيز من التصنيفات الإجمالية إلى معدلات الخطأ المحددة عند العتبة المستخدمة، يمكن للمستشفيات أخيراً رؤية الإخفاقات التي كانت تختبئ في وضح النهار.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.