ملخص تقني: محو المفاهيم المتعامد لنماذج الانتشار (Orthogonal Concept Erasure)
بيان المشكلة
تمتلك نماذج الانتشار من النص إلى الصورة (T2I) قدرات توليدية مذهلة، لكنها عرضة لإنتاج محتوى غير مرغوب فيه، أو غير آمن، أو محمي بحقوق الطبع والنشر. وبينما برز "محو المفاهيم" كحل حاسم للتخفيف من هذه المخاطر، تواجه الأساليب الحالية مقايضات كبيرة بين الفعالية، والكفاءة، والحفاظ على القدرة التوليدية العامة.
تنقسم الطرق الحالية عمومًا إلى ثلاث فئات:
- التدخل أثناء الاستدلال (Inference-time intervention): تعديل مسارات أخذ العينات دون تعديل المعلمات. وتكون هذه الطرق عرضة للتجاوز والالتفاف.
- الطرق القائمة على التدريب (Training-based methods): ضبط معلمات النموذج بدقة لإزالة المفاهيم. ورغم فعاليتها، إلا أنها تتطلب تكالفات حوسبية عالية وتحتاج إلى جولات تحسين متعددة، مما يحد من قابليتها للتوسع.
- الطرق القائمة على التحرير (Editing-based methods): تعديل معلمات النموذج مباشرة باستخدام حلول مغلقة الصيغة. ورغم كفاءتها، إلا أن طرق التحرير الحالية تعتمد عادةً على التحديثات الإضافية للمعلمات (W+Δ). وقد حدد المؤلفون قصورًا جوهريًا في هذا النموذج: التحديثات الإضافية تسبب بطبيعتها تشابكًا في اتجاه العصبون، وحجمه، والهندسة الزاوية. وبما أن دلالات المفاهيم تعتمد بقوة على اتجاه العصبون بينما تعتمد القدرة التوليدية العامة على الحفاظ على الهندسة الزاوية، فإن التحديثات الإضافية تؤدي غالبًا إلى محو غير مستقر وتدهور في المفاهيم غير المستهدفة.
المنهجية: محو المفاهيم المتعامد (OCE)
يقترح البحث محو المفاهيم المتعامد (Orthogonal Concept Erasure - OCE)، وهو منهج قائم على الهندسة والتحرير، يعيد صياغة محو المفاهيم كـ تحويل متعامد ضربي بدلاً من كونه اضطرابًا إضافيًا.
1. التحليل الهندسي
وضع المؤلفون ادعاءين تجريبيين رئيسيين من خلال تجارب مضبوطة:
- الادعاء 1 (C1): تُشفر دلالات المفاهيم في نماذج الانتشار بشكل أساسي في اتجاهات العصبونات، بينما يكون لكتل العصبونات (magnitudes) تأثير ضئيل على التعبير الدلالي.
- الادعاء 2 (C2): إن الحفاظ على الهندسة الزاوية (الزوايا والارتباطات بين العصبونات) أمر بالغ الأهمية للحفاظ على الجودة التوليدية الإجمالية للنموذج.
بناءً على ذلك، يتجنب OCE التحديثات الإضافية التي تزعج كل من الاتجاه والكتلة. وبدلاً من ذلك، يطبق تحويلًا متعامدًا لكل طبقة P على مصفوفات الإسقاط W (تحديدًا مصفوفات المفتاح والقيمة في طبقات الانتباه المتقاطع)، بحيث تكون W∗=PW. تقوم هذه العملية بتدوير اتجاهات العصبونات لمحو المفاهيم المستهدفة مع الحفاظ بصرامة على كتل العصبونات والهندسة الزاوية البينية بين العصبونات.
2. صياغة المشكلة
تصيغ المنهجية عملية المحو كمسألة تحسين لإيجاد مصفوفة متعامدة P (P⊤P=I) تقلل المسافة بين المفاهيم المستهدفة المحولة ومرتكزاتها (anchors)، مع تقليل المسافة بين المفاهيم غير المستهدفة المحولة وتمثيلاتها الأصلية.
الهدف على مستوى المتجه (Vector-wise Objective): بالنسبة لمحوه مفهوم واحد، يعمل الهدف على محاذاة تضمينات الهدف C1 مع تضمينات المرتكز C∗ والحفاظ على مجموعة الاحتفاظ C0. ويتم حل ذلك عبر مسألة بروكروست المتعامدة (Orthogonal Procrustes problem) الكلاسيكية باستخدام تفكيك القيم المفردة (SVD) للحصول على حل مغلق الصيغة: P=UV⊤.
الهدف على مستوى الفضاء الجزئي (Subspace-level Objective): بالنسبة لمحو مفاهيم متعددة، فإن فرض محاذاة صارمة على مستوى المتجه لعدة أهداف يخلق قيودًا متضاربة. يوسع OCE الهدف ليشمل إسقاطًا على مستوى الفضاء الجزئي. فهو يحدد الفضاءات الجزئية للهدف والمرتكز، ويسعى لتثبيط مكونات الفضاء الجزئي المستهدف التي تقع في المتمم المتعامد للفضاء الجزئي للمرتكز. ويتم تحقيق ذلك عن طريق تقليل طاقة الفضاء الجزئي المستهدف خارج المتمم المتعامد للمرتكز، بالتزامن مع الحفاظ على مستوى المتجه لمجموعة الاحتفاظ.
3. تفاصيل التنفيذ
- أولوية الحفاظ العالمية (K0): لضمان الاستقرار العالمي، تقوم المنهجية بحساب أولوية حفظ عامة K0 مسبقًا من مجموعة بيانات ضخمة (COCO-30k)، والتي يُعاد استخدامها عبر مهام المحو المختلفة.
- التصميم غير المتماثل: تستخدم المنهجية صياغة غير متماثلة: المحو على مستوى الفضاء الجزئي (للتعامل مع التضاربات في سيناريوهات المفاهيم المتعددة) مدمجًا مع الحفاظ على مستوى المتجه (لضمان الاحتفاظ الدقيق بالمفاهيم غير المستهدفة).
- المتانة ضد الهجمات العدائية: يمكن دمج الإطار بسلاسة مع استراتيجيات التحرير العدائية لتحسين المتانة ضد الهجمات.
المساهمات الرئيسية
- إعادة الصياغة الهندسية: يقدم OCE تحولًا في النموذج من التحرير الإضافي إلى التحرير المتعامد الضربي، وهو أمر مستند نظريًا إلى ملاحظة أن دلالات المفاهيم تعتمد على الاتجاه بينما تعتمد القدرة التوليدية على الهندسة الزاوية.
- حل مغلق الصيغة: توفر المنهجية حلاً مبدئيًا وكفؤًا مغلق الصيغة لكل من محو المفهوم الواحد والمفاهيم المتعددة عبر SVD، مما يلغي الحاجة إلى التحسين التكراري.
- محو الفضاء الجزئي القابل للتوسع: من خلال توسيع المحو من مستوى المتجه إلى هدف هيكلي على مستوى الفضاء الجزئي، ينجح OCE بفعالية في حل القيود المتضاربة في محو المفاهيم المتعددة واسعة النطاق (مثل محو 100 مفهوم في آن واحد).
- قابلية التطبيق الواسعة: تثبت المنهجية قدرتها على الانتقال إلى كل من النماذج القائمة على U-Net (Stable Diffusion v1.4) والنماذج القائمة على DiT (FLUX.1 dev).
النتائج التجريبية
أُجريت تجارب مكثفة على محو الأشياء، ومحو الأنماط الفنية، ومحو المشاهير، والمحو الضمني للمفاهيم (بما في ذلك الهجمات العدائية).
- محو المفهوم الواحد: في تجربة محو الأشياء على CIFAR-10، حقق OCE أعلى متوسط توافق هارموني (Ho)، حيث خفض متوسط معدل فشل المحو (Acce) إلى 4.61% مع الحفاظ على احتفاظ شبه مثالي بالمفاهيم غير المستهدفة (Accs≈98.68%). وقد تفوق على أفضل الطرق الحالية مثل UCE وMACE وSPEED.
- محو المفاهيم المتعددة: نجح OCE في محو ما يصل إلى 100 مفهوم من مفاهيم المشاهير في خطوة واحدة، وأتم العملية في 4.3 ثانية على وحدة معالجة رسومية واحدة من نوع A100. وقد حافظ على أداء مستقر مع زيادة عدد المفاهوهات الممحوة، بينما عانت الطرق الأخرى من انهيار التوليد أو تدهور كبير في الحفاظ على المفاهيم غير المستهدفة.
- المحو الضمني والمتانة: في محو المفاهيم الضمنية (مثل محتوى NSFW) وتحت الهجمات العدائية (Ring-A-Bell وMMA-Diffusion)، أظهر OCE متانة قوية، خاصة عند دمجه مع التحرير العدائي، محققًا معدلات نجاح هجوم (ASR) منخفضة مع الحفاظ على جودة التوليد العامة (درجات CLIP عالية، وFID منخفض).
- قابلية الانتقال: امتدت المنهجية بفعالية إلى نموذج FLUX.1 dev، محققة محوًا فعالًا للأشياء والأنماط والمشاهير دون الحاجة إلى تغييرات معمارية في منطق التحرير الأساسي.
الأهمية والادعاءات
يزعم البحث أن OCE يقدم حلاً مبدئيًا، وكفؤًا، وقابلًا للتوسع لمحو المفاهيم. ومن خلال معالجة القيود الهندسية للتحديثات الإضافية، يحقق OCE توازنًا متفوقًا بين الدقة في إزالة المفاهيم والحفاظ على القدرات التوليدية الجوهرية للنموذج.
يؤكد المؤلفون أن OCE يوفر آلية قابلة للتحكم لتحسين سلامة وموثوقية نماذج الذكاء الاصطုناعي التوليدي. فهو يدعم محو المفهوم الواحد والمفاهيم المتعددة مع حد أدنى من التداخل في المفاهيم غير ذات الصلة، مما يوفر مسارًا عمليًا لنشر ذكاء اصطناعي أكثر أمانًا في مجالات إنشاء المحتوى، والتعليم، والمنصات العامة. ويشير العمل إلى أن المنظورات الهندسية لفضاء المعلمات يمكن أن تؤدي إلى نماذج تحرير أكثر فعالية واستقرارًا لنماذج الانتشار.
الاعتراف بالقصور:
أشار المؤلفون إلى أن محو الفضاء الجزئي القائم على SVD قد يفرض أعباء حوسبية إضافية للنماذج الكبيرة جدًا. بالإضافة إلى ذلك، نظرًا لأن المنهجية تعمل على مستوى الفضاء الجزئي، فقد تقع المخرجات المولدة في مناطق دلالية وسيطة بدلاً من المطابقة الدقيقة للمفاهيم المرتكزة الدقيقة، مما قد يحد من التطبيق في مهام تحرير محددة. ويتطلب الأمر مزيدًا من الاستكشاف لمحو المفاهيم العلاقاتية أو التركيبية المعقدة.