When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
تقدم هذه الورقة MedFocusLeak، وهو هجوم "الصندوق الأسود" عالي القابلية للنقل الذي يزعزع سلامة نماذج الرؤية واللغة الطبية عبر حقن اضطرابات غير محسوسة في مناطق الخلفية لتشتيت الانتباه عن الاعتلال وتحفيز تشخيصات منطقية ولكنها خاطئة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طبيب ذكاء اصطناعي طبي فائق الذكاء. يمكنه النظر إلى صورة أشعة سينية، أو رنين مغناطيسي، أو أشعة مقطعية وكتابة تقرير مفصل عما هو خطأ لدى المريض. هذا الذكاء الاصطناعي يشبه متدرباً عبقرياً قرأ كل الكتب الطبية في العالم.
ولكن، كما تكشف هذه الورقة البحثية، فإن هذا المتدرب العبقري لديه نقطة عمياء غريبة جداً: إنه يتشتت بسهولة بسبب الخلفية.
إليك قصة MedFocusLeak، "الخدعة السحرية" التي تخدع هذا الذكاء الاصطناعي لارتكاب أخطاء كارثية دون أن يلاحظ أحد.
المشكلة: الذكاء الاصطناعي مشتت الانتباه للغاية
حالياً، إذا أردت خداع كمبيوتر لجعله يرى شيئاً غير موجود، فعادة ما يتعين عليك وضع ملصق ملون غريب على الصورة. الطبيب البشري سينظر إلى هذا الملصق ويقول: "مهلاً، هذه الصورة مزيفة!"
لكن الباحثين في هذه الورقة وجدوا طريقة أذكى. لقد أدركوا أن نماذج الذكاء الاصطناዊ الطبية مهووسة بـ مركز الصورة (القلب، الدماغ، الورم) ولكنها أيضاً تولي اهتماماً لـ الحواف (الخلفية، الطاولة، الظلال).
الحل: "الطعم الخفي"
ابتكر الباحثون هجوماً جديداً يسمى MedFocusLeak. فكر في الأمر كخفة يد من ساحر.
- الصورة النظيفة: تخيل صورة رنين مغناطيسي لدماغ به ورم صغير. يقول الذكاء الاصطناعي بشكل صحيح: "يوجد ورم هنا".
- الضجيج غير المرئي: يأخذ الباحثون الصورة ويضيفون تغييرات طفيفة وغير مرئية إلى الخلفية (المساحة الفارغة حول الدماغ). بالنسبة للعين البشرية، تبدو الصورة متطابقة تماماً. الأمر يشبه الهمس بسر للذكاء الاصطناعي لا يستطيع سماعه إلا هو.
- التشتيت: تعمل هذه التغييرات الطفيفة مثل لافتة نيون ضخمة في الخلفية. هي لا تغير الدماغ؛ بل تجعل "انتباه" الذكاء الاصطناعي ينحرف بعيداً عن الدماغ ونحو المساحة الفارغة.
- خدعة النص: في الوقت نفسه، يقوم الباحثون بتعديل طفيف على النص الموجه (السؤال المطروح للذكاء الاصطناعي) ليتناسب مع التشتيت.
النتيجة: تشخيص واثق ولكنه خاطئ
لأن الذكاء الاصطناعي ينظر الآن إلى "لافتة النيون" في الخلفية بدلاً من الدماغ، فإنه يصاب بالارتباك. ويكتب بـثقة تقري-راً يقول: "هذا الدماغ سليم تماماً"، أو "هذا مرض مختلف تماماً"، رغم أن الورم لا يزال موجوداً في الصورة.
الجزء المخيف؟
- بالنسبة للإنسان: تبدو الصورة طبيعية. ويبدو التقرير وكأنه كُتب بواسطة طبيب.
- بالنسبة للذكاء الاصطناعي: هو مقتنع تماماً بأنه ينظر إلى شيء مختلف تماماً.
لماذا هذا مهم (لماذا يجب أن تهتم؟)
اختبرت الورقة هذا الأمر على ستة أنواع مختلفة من الفحوصات الطبية (الأشعة السينية، الرنين المغناطني، الموجات فوق الصوتية، إلخ) وضد العديد من نماذج الذكاء الاصطناعي، بما في ذلك النماذج الأكثر تقدماً مثل GPT-5 وGemini.
- إنه يعمل في كل مكان: تماماً مثل النشال الذي يمكنه السرقة من أي شخص، نجح هذا الهجوم على كل ذكاء اصطناعي حاولوا اختباره.
- إنه غير مرئي: التغييرات صغيرة جداً لدرجة أن الأطباء الخبراء لم يستطيعوا معرفة أن الصورة قد تم التلاعب بها.
- إنه خطير: في إحدى الأمثلة، قام الذكاء الاصطناعي بتغيير تقرير عن "ورم محتمل" إلى "سليم تماماً". وفي مثال آخر، غير مشكلة جلدية طفيفة إلى "سرطان مميت".
الخلاصة الكبرى
هذا ليس مجرد كسر للكمبيوترات؛ بل يتعلق بـ السلامة.
الباحثون يقولون: "لقد بنينا هذه الأنظمة من الذكاء الاصطناعي الطبي لمساعدتنا، لكن بها ثغرة. يمكن خداعها بواسطة ضجيج خلفي غير مرئي، مما يؤدي إلى ارتكاب أخطاء حياة أو موت."
هم لا يحاولون بيع هذه الخدعة للأشرار. بدلاً من ذلك، هم يصرخون: "انظروا إلى هذه الفجوة في الدرع!" حتى يتمكن المطورون من بناء ذكاء اصطناعي طبي أقوى وأكثر أماناً، لا يتشتت بالخلفية ويظل دائماً مركزاً على المريض.
باختصار: لقد وجدوا طريقة للهمس بسر إلى الذكاء الاصطناعي الطبي يجعله يتجاهل المريض وينظر إلى الحائط، مما يتسبب في إعطاء تشخيص خاطئ يبدو طبيعياً تماماً للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.