← أحدث الأبحاث
🤖 machine learning

Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

تقترح هذه الورقة البحثية "الحذف المتميز" (D2\mathrm{D^2})، وهو نموذج موحد يتم تنفيذه عبر "محاذاة نسيان المعرفة القائمة على الطاقة" (EUA)، والذي يعمل بفعالية على محو المعرفة غير المرغوب فيها وضمان الرفض الآمن من خلال التلاعب بتوزيعات الاستجابة في الفضاء الكامن بدلاً من كبت رموز محددة، مما يتغلب على قيود الطرق الحالية لحذف المعرفة والرفض المتميز.

المؤلفون الأصليون: Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

نُشر 2026-05-19
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة ضخم (LLM) على أنه أمين مكتبة مهووس للغاية. هذا الأمين قد قرأ كل كتاب في العالم ويمكنه الإجابة على أي سؤال تقريبًا. ومع ذلك، قد يكون قد حفظ أحيانًا معلومات حساسة أو خاصة أو ضارة (مثل عيد ميلاد سري لمشهور أو تعليمات حول كيفية صنع جهاز خطير) التي لا ينبغي السماح له بمشاركتها.

الهدف من هذه الورقة البحثية هو تعليم أمين المكتبة هذا كيفية نسيان تلك المعلومات المحددة حقًا دون تدمير قدرته على الإجابة على كل شيء آخر، ودون أن يكتفي فقط بـ "التظاهر" بالنسيان.

يجادل المؤلفون، بونينغ يانغ وزملاؤه، بأن الطرق الحالية لجعل الذكاء الاصطناعي "ينسى" الأشياء معطلة بطريقتين محددتين. وهم يقترحون حلاً جديدًا يسمى الحذف المتميز (Distinguishable Deletion - D2)، المدعوم بطريقة يسمونها محاذاة النسيان القائمة على الطاقة (Energy-based Unlearning Alignment - EUA).

إليك تفصيل ذلك باستخدام تشبيهات بسيطة:

الطريقتان المعطلتان لـ "النسيان"

يحاول الباحثون حاليًا جعل الذكاء الاصطناعي ينسى بطريقتين، وكلتاهما تعاني من عيوب رئيسية:

  1. طريقة "القلم الأحمر" (حذف المعرفة):

    • كيف تعمل: تخيل أن قيل لأمين المكتبة: "إذا سُئلت عن 'عيد ميلاد باسل محفوظ الكويتي'، يجب ألا تذكر التاريخ أبدًا". يحاول أمين المكتبة مسح الكلمات المحددة مثل "09/05/1997" من دماغه.
    • المشكلة: دماغ أمين المكتبة عبارة عن شبكة متشابكة من الروابط. إذا حاولت إزالة تلك الكلمات بدقة جراحية، فقد تمزق بالخطأ صفحة كاملة أو حتى الكتاب بأكمله. قد يبدأ أمين المكتبة في التلعثم، أو قول أشياء غير مفهومة، أو الهلوسة (اختلاق تواريخ مزيفة) لأنه أصبح مرتبكًا. هو لم ينسَ المفهوم فحًا، بل دمر قدرته على التحدث عنه.
    • ادعاء الورقة: يؤدي هذا إلى "حذف منحاز" ومخرجات غير مستقرة وغير مفهومة.
  2. طريقة "رجل الأمن" (الرفض المتميز):

    • كيف تعمل: يحتفظ أمين المكتبة بجميع الكتب كما هي تمامًا (ليظل قادرًا على الإجابة على الأسئلة الأخرى بشكل مثالي). بدلاً من ذلك، يقوم بتعيين رجل أمن عند الباب. إذا سمع الرجل كلمة "باسل"، فإنه يمنع أمين المكتبة من الإجابة ويقول: "لا يمكنني التحدث عن هذا".
    • المشكلة: أمين المكتبة لا يزال يعرف السر. إذا استخدم مخادع ذكي ("هجوم عدائي") كلمة سر أو طرح السؤال بطريقة غريبة، فإن رجل الأمن يرتبك، ويقوم أمين المكتبة ببث السر رغمًا عنه.
    • ادعاء الورقة: هذه الطريقة هشة. فالمعرفة لا تزال موجودة، وتنتظر من يخدعها.

الحل الجديد: الحذف المتميز (D2)

يقترح المؤلفون طريقة ثالثة. بدلاً من مسح كلمات محددة أو تعيين حارس، يريدون تغيير "الحالة الداخلية" أو "الثقة" لأمين المكتبة فيما يتعلق بهذا الموضوع المحدد.

هم يقدمون مفهوم "مؤشر الطاقة" (Energy Index).

  • التشبيه: فكر في "الطاقة" كأنها مقياس للثقة.
    • عندما يعرف أمين المكتبة حقيقة ما (مثل "باريس تقع في فرنسا")، يكون مقياس الثقة منخفضًا (من الناحية الفيزيائية، الطاقة المنخفضة تعني حالة مستقرة ومريحة). هو متأكد جدًا.
    • عندما لا يعرف أمين المكتبة شيئًا ما، يكون مقياس الثقة مرتفعًا (الطاقة العالية تعني حالة فوضوية وغير مستقرة). هو يشعر بعدم اليقين والعشوائية.

الهدف: يريد المؤلفون تدريب أمين المكتبة بحيث عندما يُسأل عن عيد الميلاد السري، يرتفع "مقياس الثقة الداخلي" لديه إلى طاقة عالية (فوضى/عدم يقين). وهذا يعطي إشارة للنظام: "ليس لدي إجابة مهيكلة أو واثقة لهذا السؤال".

كيف يفعلون ذلك: محاذاة النسيان القائمة على الطاقة (EUA)

لتحقيق ذلك، يستخدمون عملية من خطوتين:

  1. تدريب "الحالة المزاجية" (مرحلة التعلم):
    هم لا يكتفون بقول "لا تذكر التاريخ" للنموذج. بل يعلمون النموذج أن الأسئلة حول الموضوع السري يجب أن تبدو "غير مريحة" أو "غير مؤكدة" داخليًا.

    • هم ينشئون "هامش التفضيل الذاتي" (Self-Preference Margin). تخيل أن لدى أمين المكتبة "منطقة راحة" طبيعية لما يعرفه. يقوم النظام تلقائيًا بحساب الخط الفاصل بين "المعرفة المريحة" و"المجاهيل غير المريحة" بناءً على النزعات الطبيعية للنموذج.
    • هم يجبرون النموذج على دفع الأسئلة "السرية" إلى منطقة "عدم الراحة".
  2. آلية الرفض (مرحلة التنفيذ):
    بمجرد تدريب النموذج، يصبح لديه حدود واضحة.

    • سؤال عادي: "ما هي عاصمة فرنسا؟" -> يشعر النموذج بـ طاقة منخفضة (راحة) -> فيجيب بثقة.
    • سؤال سري: "ما هو عيد ميلاد باسل؟" -> يشعر النموذج بـ طاقة عالية (عدم راحة/فوضى) -> يكتشف النظام هذا الارتفاع ويطلق رفضًا مهذبًا: "لا يمكنني الإجابة على هذا بسبب قيود الخصوصية".

لماذا هذا أفضل (النتائج)

تدعي الورقة أن هذه الطريقة الجديدة متفوقة لأنها:

  • نسيان حقيقي: على عكس طريقة "رجل الأمن"، يتم تعطيل المعرفة فعليًا. النموذج لا يكتفي بإخفاء الإجابة؛ بل يفقد الهيكل الداخلي الواثق الذي يسمح له بتوليد الإجابة.
  • مستقرة: على عكس طريقة "القلم الأحمر"، لا يبدأ النموذج في قول أشياء غير مفهومة. هو يعرف كيف يقول "لا أعرف" بتهذيب وترابط.
  • قوية: حتى لو حاول شخص ما خداع النموذج عبر "مطالبات الاختراق" (طرق غريبة في السؤال)، فإن إنذار "الطاقة العالية" الداخلي للنموذج سيظل يعمل، وسيرفض الإجابة.

ملخص

تقدم الورقة طريقة لجعل الذكاء الاصطناعي ينسى المعلومات الحساسة عن طريق تغيير ثقته الداخلية بدلاً من مجرد حذف الكلمات أو إضافة حارس.

  • الطريقة القديمة: "لا تقل كلمة 'عيد ميلاد'!" (تسبب تعثر الذكاء الاصطناعي وتعطله).
  • الطريقة القديمة 2: "إذا سمعت كلمة 'عيد ميلاد'، توقف عن الكلام!" (الذكاء الاصطناعي لا يزال يعرف السر ويمكن خداعه).
  • الطريقة الجديدة (D2): "عندما تفكر في 'عيد ميلاد'، اشعر بعدم اليقين والفوضى." (يرفض الذكاء الاصطناعي الإجابة بشكل طبيعي لأنه يشعر أنه لا يعرف، ويفعل ذلك بأمان واتساق).

لقد اختبر المؤلفون هذه الطريقة على نماذج مختلفة (مثل LLaMA و Qwen) ووجدوا أنها تعمل بشكل أفضل بكثير في إزالة المعرفة الضارة مع الحفاظ على ذكاء النموذج وفائدته في كل شيء آخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →