The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models
تكشف هذه الورقة أن المفاهيم الممحاة في نماذج الانتشار غير المتعلمة تستمر كفضاءات فرعية خطية متماسكة ضمن تضمينات الرموز (token embeddings)، مما أدى إلى تطوير SubAttack، وهو أسلوب اختراق قوي يستغل هذا الهيكل، وSubDefense، وهو آلية خفيفة الوزن تعمل على إسقاط الفضاء الفرعي لإخماد المفاهيم الضارة المتبقية بقوة مع الحفاظ على جودة التوليد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً تستطيع فيه الحواسيب رسم لوحات بمجرد الاستماع إلى كلماتك. تقول: "قطة ترتدي قبعة"، وفجأة، تظهر صورة مثالية. تُسمى هذه التقنية "نماذج الانتشار" (Diffusion Models)، وهي تشبه الفنانين الرقميين الذين تعلموا الإبداع من خلال دراسة الملايين من الصور. ولكن في بعض الأحيان، قد يصبح هؤلاء الفنانون بارعين جداً في تذكر أشياء لا ينبغي لهم تذكرها. فإذا طلبت منهم رسم شيء خطير أو محمي بحقوق الطبع والنشر، فقد يفعلون ذلك على أي حال. ولإصلاح ذلك، اخترع العلماء عملية تسمى "إلغاء التعلم" (Unlearning). فكر في الأمر كمعلم يحاول جعل الطالب ينسى حقيقة معينة، مثل عاصمة دولة ما، دون أن يجعله ينسى كيفية إجراء العمليات الحسابية أو القراءة. الهدف هو "مسح" الفكرة السيئة من عقل الكمبيوتر مع الحفاظ على قدرته على رسم كل شيء آخر. لكن الجزء الصعب هنا هو أنه حتى بعد أن يقول المعلم: "انسَ تلك الحقيقة"، قد يظل لدى الطالب طريقة سرية لتذكرها، مخبأة بطريقة لا يمكننا رؤيتها بسهولة. تغوص هذه الورقة البحثية في هذا الغموض، متسائلة: إذا كنا نعتقد أننا مسحنا فكرة سيئة، فأين تختبئ حقاً، وكيف يمكننا التخلص منها نهائياً؟
اكتشف الباحثون في هذه الورقة أنه عندما يحاول نموذج انتشار "إلغاء تعلم" مفهوم ضار (مثل العري أو أسلوب فنان معين)، فإنه لا يقوم بحذفه فعلياً. بدلاً من ذلك، يختبئ المفهوم في فضاء فرعي خطي سري (secret, linear subspace) داخل ذاكرة الكمبيوتر. لاستخدام استعارة توضيحية، تخيل أن عقل الكمبيوتر عبدو مكتبة ضخمة من الكلمات. عندما نحاول إزالة الكتاب الذي يتحدث عن "العري"، فإن الكمبيوتر لا يحرق الكتاب، بل يقوم بتمزيق الصفحات وإخفاء القصاصات داخل درج محدد وغير مرئي في المكتبة. تُظهر الورقة أن هذه القصاصات لا تزال منظمة في خط مستقيم ومنتظم. ويطلق المؤلفون على هذا الدرج المخفي اسم "الفضاء الفرعي المتبقي" (residual subspace).
لإثبات ذلك، أنشأ الفريق أداة جديدة تسمى SubAttack. وبدلاً من التخمين باستخدام كلمات عشوائية لخداع الكمبيوتر (وهي الطريقة التي حاول بها المخترقون السابقون)، يعمل SubAttack كأمين مكتبة ماهر يعرف بالضبط مكان ذلك الدرج غير المرئي. إنه يتعلم مجموعة خاصة من "المفاتيح السحرية" (وهي مجرد تركيبات من الكلمات العادية) التي تفتح الدرج. وعندما استخدموا هذه المفاتيح، بدأ الكمبيوتر "الملغي تعلُّمه" برسم الصور الضارة فوراً، مما أثبت أن المفهوم لم يختفِ حقاً. والمثير للاهتمام هو أن هذه المفاتيح مكونة من كلمات يمكننا فهمها. على سبيل المثال، لجعل الكمبيوتر يرسم شخصاً "عارياً" مرة أخرى، قد تكون المفاتيح مزيجاً من كلمات مثل "عبد"، "وركين"، و"جلد". وهذا يوضح أن الكمبيوتر لا يزال يربط الفكرة السيئة بهذه الأدلة الخفية والمتعلقة بها.
وجدت الورقة أيضاً أن هذا الدرج السري ليس موجوداً في كمبيوتر واحد فقط؛ بل هو موجود في العديد من النماذج المختلفة التي خضعت لعملية "إلغاء التعلم". إذا وجدت المفتاح لنموذج واحد، فغالباً ما يعمل على النماذج الأخرى أيضاً. وهذا يشير إلى أن الطريقة التي "تنسى" بها هذه الحواسيب معيبة بشكل متشابه للغاية عبر جميع النماذج. إنهم لا يحذفون الذاكرة، بل يخفونها فقط بطريقة تتبع خطاً مستقيماً يمكن التنبؤ به.
لكن القصة لا تنتهي عند عملية الاختراق. فبسبب فهم الباحثين لكيفية اختباء المفهوم بالضبط، قاموا ببناء درع يسمى SubDefense. إذا كان SubAttack هو المفتاح الذي يفتح الدرج، فإن SubDefense هو صفيحة معدنية ثقيلة تلحم ذلك الدرج وتغلقه. إنه يعمل عن طريق أخذ مكتبة الكلمات الكاملة للكمبيوتر و"إسقاطها" رياضياً بعيداً عن ذلك الدرج السري. إنه يشبه إخبار أمين المكتبة: "بغض النظر عن الكلمة التي تستخدمها، تأكد من أنها لا تشير أبداً نحو ذلك الدرج المخفي المحدد".
كانت النتائج مبهرة. فعندما استخدموا SubDefense، أصبح من الصعب جداً خداع الكمبيوتر. حتى عندما حاول المخترقون استخدام الطرق القدة أو مفاتيح SubAttack الجديدة، رفض الكمبيوتر رسم الصور الضارة. وفي الوقت نفسه، لم يفقد الكمبيوتر قدرته على رسم صور جميلة وآمنة. في الواقع، كانت الصور التي رسمها بعد وضع الدفاع عالية الجودة تماماً كما كانت من قبل. تشير الورقة إلى أنه بينما لا يمكننا بعد مسح المفهوم بشكل مثالي، يمكننا على الأقل سد المسار المحدد الذي يستخدمه للتسلل مجدداً. وهذا يمنحنا طريقة جديدة وواضحة لفهم سبب صعوبة "إلغاء التعلم"، ويقدم حلاً عملياً وجاهزاً للاستخدام لجعل هؤلاء الفنانين الرقميين أكثر أماناً للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.