بناءً على الورقة المقدمة، إليك ملخص تقني مفصل لـ LEMUR: Unlearning (إلغاء التعلم) متعدد الوسائط القائم على الإنتروبيا الكامنة عبر إعادة توجيه الاستدلال المرتكز بصرياً.
تعريف المشكلة
لقد عززت مرحلة ما بعد التدريب باستخدام التعلم المعزز (RL) قدرات الاستدلال البصري لنماذج الاستدلال متعددة الوسائط الضخمة (MLRMs) بشكل كبير من خلال تمكينها من إصدار "سلاسل من الأفكا" (CoT) صريحة قبل الإجابة. ومع ذلك، فإن هذه القدرة تفرض ثغرة أمنية متميزة تتعلق بالخصوصية: فبينما يمكن لطرق إلغاء التعلم الحالية إزالة الحقائق الحساسة بنجاح من الإجابة النهائية للنموذج، إلا أنها غالباً ما تفشل في منع النموذج من استرجاع تلك الحقائق نفسها ضمن مسار الاستدلال الداخلي الخاص به.
حدد المؤلفون أن "تسرب مسار الاستدلال" هذا يكون أكثر وضوحاً بشكل كبير في نماذج MLRM المدربة بالتعلم المعزز مقارنة بنماذجها الأساسية غير المستندة إلى الاستدلال. وتعد أساليب إلغاء التعلم الحالية، التي تركز عادةً على ضبط الأوزان أو التدخل عند مستوى الإجابة النهائية، غير مؤهلة للتعامل مع هذا الأمر؛ فهي إما تفشل في مراقبة المسارات المتنوعة والاستكشافية التي يحفزها التعلم المعزز، أو تؤدي إلى تدهور قدرات الاستدلال لدى النموذج عند محاولة تشويه المسار.
الملاحظة الجوهرية: بصمة الإنتروبيا
الرؤية الأساسية التي تقود هذا العمل هي اكتشاف بصمة إنتروبيا مميزة على مستوى الرمز (token-level entropy signature) مرتبطة باسترجاع المحتوى الحساس المحفوظ في الذاكرة في النماذج المدربة بالتعلم المعزز.
- نمط مرحلتين: عندما يسترجع نموذج مدرب بالتعلم المعزز سمة حساسة، فإنه يظهر نمطاً مميزاً من الارتفاع ثم الانهيار في الإنتروبيا (Ht(v)) على مستوى الرمز:
- مرحلة التداول (Deliberation Stage): يتردد النموذج بين قيم مرشحة، مما يؤدي إلى ارتفاع الإنتروبيا مع تنافس عدة مرشحات.
- مرحلة الالتزام (Commitment Stage): بمجرد التزام النموذج بالنطاق المحفوظ في الذاكرة، تنهار الإنتروبيا إلى ما يقرب من الصفر حيث يقوم باسترجاع السمة بشكل حتمي.
- هذه البصمة غائبة إلى حد كبير في النماذج الأساسية غير المستندة إلى الاستدلال، حيث تكون توزيعات الإنتروبيا أكثر عشوائية. توفر هذه الديناميكية إشارة موثوقة، لا تتطلب تدريباً، للكشف عن متى يبدأ الاستدناء الحساس ومتى ينتهي.
المنهجية: LEMUR
إن LEMUR هو إطار عمل لإلغاء التعلم يعمل بالكامل بدون تدريب، ويعمل أثناء مرحلة الاستدلال (inference-time)، وهو مصمم خصيصاً للنماذج متعددة الوسائط المدربة أصلاً بالتعلم المعزز. يعمل من خلال مراقبة عملية فك التشفير والتدخل فقط عند اكتشاف محتوى حساس. يتكون الأسلوب من ثلاثة مكونات رئيسية:
تبديل الحساسية المعزز بالإنتروبيا:
- يجمع LEMUR بين الفحص المعجمي (مجموعات الرموز المحظورة) وبصمة الإنتروبيا لتفعيل "الوضع الحساس".
- يتم تفعيل شرط التفعيل (gt) إذا تم اكتشاف كتلة عالية من الرموز المحظورة (استرجاع ملتزم) أو إذا تم اكتشاف إنتروبيا عالية جنباً إلى جنب مع كتلة أقل من الرموز المحظورة (مرحلة التداول). يضمن هذا بدء التدخل عند بداية النطاق الحساس تماماً، وليس فقط بعد التزام النموذج بالإجابة الخاطئة.
حقن المرساة البصرية المرتكز بالإنتروبيا:
- بمجرد الدخول في الوضع الحساس، ينتقل LEMUR من فك التشفير التلقائي القياسي إلى نظام فك تشفير كامن (latent decoding regime).
- بدلاً من تغذية النموذج برمز منفصل، يتلقى النموذج تمثيلاً مستمراً (embedding) يتم بناؤه عبر التغذية الراجعة الكامنة المقيدة (إعادة تطبيع التوزيع لاستبعاد الرموز المحظورة) ومرسات إعادة التوجيه البصرية.
- تتكون المرسات من مرساة بصرية (متوسط تمثيل الرموز الخاصة بالصور لإعادة ربط الاستدلال بالصورة) ومرساة الإجابة الآمنة (تمثيلات قوالب الرفض أو عدم اليقين).
- الحقن المتحكم به بالإنتروبيا: يتم تعديل قوة حقن هذه المرسات (γt) ديناميكياً بناءً على إنتروبيا الرمز الحالية. الإنتروبيا العالية (التداول) تتلقى توجيهاً قوياً؛ بينما الإنتروبيا المنخفضة (النص الملتزم) تتلقى توجيهاً أضعف للحفاظ على السلاسة.
مدة المرحلة الديناميكية المتحكم بها بالإنتروبيا:
- لمنع استمرار التدخل لفترة طويلة جداً (مما يؤدي لتدهور السلاسة) أو انتهائه مبكراً جداً (مما يسمح بالتسرب)، يستخدم LEMUR آلية خروج تكيفية.
- يتتبع النظام الإنتروبيا المرجعية للنموذج على النصوص العادية وينهي المرحلة الكامنة فقط عندما تتعافى الإنتربيا فوق عتبة تكيفية (κHˉt) وتتلاشى الكتلة المحظورة.
- تعمل "فترة التبريد المرجعية" (refractory cooldown) على منع التذبذب السريع بين الأنماط المنفصلة والكامنة، مما يضمن تماسك الاستدلال المحيط.
النتائج التجريبية
قام المؤلفون بتقييم LEMUR على نماذج MLRM المدربة بالتعلم المعزز (R1-Onevision-7B و Vision-R1-7B) باستخدام مجموعة بيانات مُعاد بناؤها بناءً على MLLMU-Bench، والتي تتضمن موضوعات وهمية ذات سمات خاصة.
- كبح التسرب: تفوق LEMUR بشكل كبير على كل من النماذج المرجعية القائمة على التدريب (مثل Gradient Ascent و NPO) والنماذج المرجعية التي لا تتطلب تدريباً (مثل R-MUSE). حقق أدنى مستوى في تسرب الاستدلال على مستوى الموضوع (SRL)، مما أدى فعلياً إلى محو الحقائق الحساسة من مسار الاستدماء والإجابة النهائية على حد سواء.
- الحفاظ على الفائدة: على عكس الأساليب القائمة على التدريب التي غالباً ما تضعف القدرات العامة، حافظ LEM-UR على الأداء في البيانات غير المراد نسيانها (تقسيمات Retain و Celebrity) عبر مهام التصنيف، وملء الفراغات، والتوليد.
- السلاسة: أظهر مقياس قدرة الاحتفاظ بالاستدلال (RRA) أن LEMUR حافظ على استدلال سلس ومنظم، بينما تسببت النماذج المرجعية الشرسة غالباً في انهيار النموذج إلى نصوص مكررة أو متدهورة.
- التعميم: تم اختبار الطريقة أيضاً على نماذج غير مدربة بالتعلم المعزز (Qwen2.5-VL) وعلى مجموعات بيانات الاستدلال البصري العامة (VQAv2)، مما أظهر أنه بينما تكون إشارة الإنتروبيا أقوى في نماذج التعلم المعزز، فإن الإطار يظل فعالاً وقابلاً للنقل.
الأهمية والادعاءات
يدعي البحث أنه أول طريقة إلغاء تعلم مصممة خصيصاً لنماذج الاستدلال متعددة الوسائط المدربة أصلاً بالتعلم المعزز. وتتمثل مساهماته الرئيسية في:
- تحديد خطر الخصوصية: إثبات أن الاستكشاف الناتج عن التعلم المعزز يخلق ثغرة أمنية فريدة حيث تسرب مسارات الاستدلال بيانات حساسة حتى عندما تكون الإجابات نظيفة.
- استغلال ديناميكيات الإنتروبيا: إظهار أن بصمة الإنتروبيا على مستوى الرمز لاسترجاع المعلومات المحفوظة توفر إشارة موثوقة ولا تتطلب تدريباً للكشف عن التسرب واعتراضه أثناء فك التشفير.
- إلغاء تعلم فعال بدون تدريب: اقتراح LEMUR، الذي يحقق أداءً رائداً في إلغاء التعلم دون إعادة تدريب، وذلك عبر توجيه مسار فك التشفير من خلال التثبيت البصري المتحكم فيه بالإنتروبيا.
خلص المؤلفون إلى أن ديناميكيات الإنتروبيا أثناء فك التشفير توفر أساساً واعداً للتحكم في الخصوصية في النماذج القادرة على الاستدلال، مما يشير إلى أن أهداف السلامة المستقبلية يمكن معالجتها من خلال استغلال هذه الإشارات الداخلية بدلاً من الاعتماد فقط على تحديثات الأوزان.