← أحدث الأبحاث
💬 NLP

LLM Unlearning with LLM Beliefs

تحدد هذه الورقة "تأثير العصر" (squeezing effect) في طرق نسيان النماذج اللغوية الكبيرة الحالية، حيث تنتقل الكتلة الاحتمالية إلى إعادة صياغات ذات صلة دلالية، وتقترح إطار عمل للتمهيد الذاتي (bootstrapping framework) يستفيد من معتقدات النموذج عالية الثقة الخاصة به لقمع الاستجابات المستهدفة وإعادة صياغاتها بشكل أكثر فعالية مع الحفاظ على الفائدة.

المؤلفون الأصليون: Kemou Li, Qizhou Wang, Yue Wang, Fengpeng Li, Jun Liu, Bo Han, Jiantao Zhou

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kemou Li, Qizhou Wang, Yue Wang, Fengpeng Li, Jun Liu, Bo Han, Jiantao Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "نسيان النماذج اللغوية الكبيرة عبر معتقداتها" (LLM Unlearning with LLM Beliefs)، مترجمة إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

المشكلة الكبرى: لعبة "ضرب الخلد" في ذاكرة الذكاء الاصطناعي

تخ lập أن لديك أمين مكتبة ذكي جداً ومطلع (الذكاء الاصطناعي) قد حفظ مكتبة ضخمة من الكتب. وفي أحد الأيام، تدرك أن أحد هذه الكتب يحتوي على سر خطير أو عنوان خاص لا ينبغي أن يكون هناك. أنت تريد من أمين المكتبة أن ينسى ذلك تماماً.

تقول لأمين المكتبة: "من فضلك، لا تقل كلمة 'سر' أبداً مرة أخرى".

ماذا يحدث مع الطرق الحالية؟
يحاول أمين المكتبة جاهداً التوقف عن قول كلمة "سر". ولكن لأن عقله مبرمج على ربط الأفكار ببعضها، فعندما تمنعه من قول كلمة "سر"، يقفز عقله غريزياً إلى أفضل بديل متاح. فبدلاً من قول "سر"، يبدأ في قول "الشيء المخفي"، أو "المعلومة السرية"، أو "العنوان الخاص".

يعتقد أمين المكتبة أنه يساعد عبر إعادة صياغة الكلام، لكنه لا يزال يكشف السر! هذا ما تسميه الورقة البحثية "النسيان الزائف" (Spurious Unlearning). يبدو الأمر وكأنه نسي، لكنه وجد فقط ثغرة للالتفاف.

"تأثير العصر": لماذا تفشل الطرق القديمة؟

تحدد الورقة البحثية ظاهرة تسمى "تأثير العصر" (Squeezing Effect).

تخيل عقل أمين المكتبة كبالون ماء مملوء بالماء (الاحتمالية). يمثل الماء كل الأشياء التي يمكن لأمين المكتبة قولها.

  • الهدف: أنت تريد عصر الماء من قسم "السر" في البالون.
  • المشكلة: الماء لا يختفي؛ بل ينتقل فقط. عندما تعصر منطقة "السر"، يُدفع الماء إلى المناطق المجاورة.
  • النتيجة: "المناطق المجاورة" هي الأشياء التي تبدو تشبه إلى حد كبير السر (إعادة الصياغات). لذا، بمحاولتك حذف السر، فإنك تتسبب بالخطأ في جعل إعادة الصياغات أعلى صوتاً وأكثر احتمالاً للظهور.

تحاول أدوات الذكاء الاصطناعي الحالية حذف السر عن طريق الضغط عليه للأسفل، لكنها لا تدرك أنها تقوم فقط برفع مستوى صوت النسخ المعاد صياغتها.

الحل الجديد: "التعزيز الذاتي" (Bootstrapping) باستخدام معتقدات الذكاء الاصطناعي الخاصة

يقترح المؤلفون طريقة جديدة تسمى التعزيز الذاتي (BS). الاسم مستوحى من فكرة "رفع الشخص لنفسه من رباط حذائه"، ولكن هنا المعنى هو استخدام أفكار الذكاء الاصطناعي لمساعدته على النسيان.

الفكرة الجوهرية بسيطة: لا تخبر الذكاء الاصطناعي فقط بما لا يجب قوله. أخبره أيضاً ألا يقول الأشياء التي يريد قولها بشدة.

عندما يحاول الذكاء الاصطناعي نسيان سر ما، فإنه يميل طبيعياً لقول البديل الأقرب والأكثر منطقية. الطريقة الجديدة تقول: "نحن نعلم أنك تريد قول ذلك البديل. سنعاقبك على قول ذلك أيضاً".

يفعلون ذلك بطريقتين:

1. BS-T (على مستوى الكلمات/الرموز): "شرطة الكلمات"

تخيل أن أمين المكتبة على وشك قول جملة.

  • الطريقة القديمة: "لا تقل 'سر'".
  • الطريقة الجديدة (BS-T): "لا تقل 'سر'. وأيضاً، لا تقل 'الشيء المخفي' أو 'المعلومة السرية'".
  • كيف تعمل: ينظر الذكاء الاصطناعي إلى عقله، ويرى أي الكلمات هي الأكثر احتمالاً لاختيارها تالياً (معتقداته)، ثم يخبر نفسه: "لا، ليس هذه أيضاً". إنه يقمع الكلمة المستهدفة والكلمات القليلة الأولى التي كان يميل إليها. هذا يمنع الماء من الاندفاع نحو الجيران.

2. BS-S (على مستوى التسلسل/الجمل): "شرطة القصص"

أحياناً، لا يقوم الذكاء الاصطناعي باستبدال كلمة واحدة فحسب، بل يستبدل هيكل الجملة بالكامل.

  • الطريقة القديمة: "لا تقل السر".
  • الطريقة الجديدة (BS-S): يقوم الذكاء الاصطناعي بتوليد قصة جديدة بالكامل تكاد تكشف السر (مثلاً: "لا يمكنني إخبارك بالسر، ولكن إليك قصة عن سر مشابه..."). الطريقة الجديدة تأخذ هذه القصة المولدة بالكامل وتقول: "احذف هذه القصة بالكامل أيضاً".
  • كيف تعمل: إنها تجبر الذكاء الاصطناعي على نسيان ليس فقط الإجابة المحددة، بل المسار الكامل للتفكير الذي يؤدي إلى تلك الإجابة.

لماذا هذا أفضل؟

فكر في الأمر كأنك تحاول مسح رسمة على سبورة بيضاء.

  • الطريقة القديمة: تمسك بالممحاة وتفرك بقوة فوق الكلمة "سر". ينتشر الحبر، والآن لديك بقعة كبيرة غير واضحة لكنها لا تزال تشبه الكلمة.
  • الطريقة الجديدة: تدرك أن الفرك يسبب انتشار الحبر فقط. لذا، تأخذ قطعة قماش مبللة وتمسح المنطقة بأكملها حول الكلمة، بما في ذلك آثار الحبر المنتشرة، مما يضمن نظافة القسم بأكمله.

النتائج

اختبرت الورقة البحثية هذه الطرق على نماذج ذكاء اصطناعي مختلفة.

  • الطرق القديمة غالباً ما حصلت على درجات عالية في الاختبارات الآلية (مثل التحقق مما إذا كانت كلمة "سر" قد ظهرت)، ولكن عندما قرأ البشر الإجابات، كان الذكاء الاصطناعي لا يزال يسرب المعلومات بطرق ذكية.
  • الطريقة الجديدة جعلت الذكاء الاصطناعي ينسى المعلومات بشكل شامل. لقد منعت الذكاء الاصطناعي من إيجاد الثغرات، مع الحفاظ على ذكاء النموذج وقدرته على الإجابة على الأسئلة الأخرى بشكل صحيح.

الملخص

تحل هذه الورقة مشكلة معقدة حيث "تنسى" نماذج الذكاء الاصطناعي الأشياء عبر تغيير كلماتها قليلاً فقط. وجد المؤلفون أنه من خلال إجبار الذكاء الاصطناعي على نسيان الهدف، وأيضاً نسيان إجاباته البديلة "المفضلة"، يمكنهم تحقيق نسيان حقيقي وعميق دون إتلاف قدرة الذكاء الاصطناعي على أن يكون مفيداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →