← أحدث الأبحاث
🤖 machine learning

Explainable LLM Unlearning Through Reasoning

تقترح هذه الورقة البحثية إطار عمل "إلغاء التعلم بالاستدلال المستهدف" (TRU)، وهو إطار عمل مبتكر يستخدم هدف إلغاء تعلم قائم على الاستدلال لتوجيه النماذج في إزالة معرفة غير مرغوب فيها بدقة مع الحفاظ على القدرات العامة وتعزيز المتانة ضد الهجمات.

المؤلفون الأصليون: Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة عبقرياً وعارفاً بكل شيء (النموذج اللغوي الكبير، أو LLM). لقد قرأ هذا الأمين كل كتاب تقريباً في العالم. ومع ذلك، فإن بعض هذه الكتب تحتوي على تعليمات خطيرة (مثل كيفية صنع قنبلة)، أو أسرار خاصة (مثل عنوان منزل شخص ما)، أو قصص محمية بحقوق الطبع والنشر لا يمكن مشاركتها.

أنت بحاجة إلى جعل أمين المكتبة ينسى هذه الأشياء السيئة أو الحساسة تحديداً، ولكنك لا تزال تريده أن يكون قادراً على الإجابة عن أسئلة حول التاريخ، والرياضيات، والطهي. تسمى هذه العملية بـ "النسيان" (Unlearning).

المشكلة: نهج "القوة الغاشمة" (Brute Force)

حاولت الطرق السابقة جعل أمين المكتبة ينسى من خلال الصراخ: "لا تفكر في هذا!" مراراً وتكراراً. هذا يشبه استخدام مطرقة ثقيلة لإزالة بقعة معينة من سجادة رقيقة.

  • النتيجة: يصاب أمين المكتبة بالارتباك. قد ينسى البقعة، ولكنه ينسى أيضاً كيفية ربط حذائه أو التحدث بجمل كاملة.
  • العرض: عندما تسأله عن الموضوع المحظور، فإنه لا يقول لك: "لا يمكنني إخبارك بذلك"، بل يبدأ في قول كلام غير مفهوم، أو تكرار رموز مثل /******/ ، أو تقديم إجابات لا معنى لها. إنه يفقد السيطرة على صوته الخاص.

الحل: "النسيان القائم على الاستدلال المستهدف" (TRU)

يقترح مؤلفو هذه الورقة طريقة أكثر ذكاءً. بدلاً من مجرد الصراخ "انسَ!"، هم يعلمون أمين المكتبة كيف يفكر بشأن ما يجب عليه نسيانه. ويطلقون على ذلك اسم النسيان القائم على الاستدال المستهدف (Targeted Reasoning Unlearning - TRU).

إليك التشبيه:

1. الطريقة القديمة: الممحاة معصوبة العينين

تخيل أنك تحاول مسح كلمة محددة من صفحة عن طريق فرك الصفحة بأكملها بالممحاة حتى تصبح الورقة رقيقة وتظهر بها ثقوب. لقد أزلت الكلمة، لكنك دمرت أيضاً بقية القصة. الورقة الآن عديمة الفائدة.

2. الطريقة الجديدة (TRU): المحرر الحكيم

يعمل TRU كمحرر حكيم يجلس مع أمين المكتبة ويقول له:

"أنا أعلم أنك تعرف كيفية صنع قنبلة. ولكن بدلاً من مجرد حذف تلك المعرفة، دعنا نتدرب على عملية استدلال. عندما يسألك شخص ما عن القنابل، يجب أن تفكر: 'هذا أمر خطير. لا يمكنني مشاركة هذا. ومع ذلك، يمكنني شرح علم الكيمياء بشكل آمن.' ثم تقول ذلك."

يقدم البحث مكونين رئيسيين لجعل هذا يعمل:

  • "أثر الاستدلال" (عملية التفكير):
    قبل أن يجيب أمين المكتبة، يتم تدريبه على كتابة أفكاره الداخلية.

    • إجابة سيئة: /******/ (هراء)
    • إجابة TRU الجيدة: "أنا أفكر: هذا السؤال يطلب معلومات بيولوجية ضارة. قواعد السلامة الخاصة بي تنص على أنه يجب علي عدم تقديم هذا. سأشرح لماذا هذا خطير وأقدم بديلاً آمناً."
      من خلال تدريب النموذج على التفكير قبل أن يتحدث، فإنه يتعلم التمييز بين "أنا بحاجة لنسيان هذا" وبين "يمكنني الإجابة على هذا".
  • "الرفض المحدد" (كلمة "لا" المهذبة):
    بدلاً من مجرد منع النموذج من معرفة الإجابة، يعلمه TRU طريقة محددة ومهذبة لقول "لا". الأمر يشبه تعليم أمين المكتبة نصاً معيناً: "لا يمكنني الإجابة على ذلك السؤال تحديداً لأنه ينتهك إرشادات السلامة، ولكنني أود التحدث عن [الموضوع الآمن] بدلاً من ذلك."

لماذا يعد هذا أمراً بالغ الأهمية؟

تظهر الورقة أن هذه الطريقة تحل مشكلتين رئيسيتين عانت منهما المحاولات السابقة:

  1. الدقة (النطاق):

    • الطريقة القديمة: إذا قلت لأمين المكتبة أن ينسى "كيفية تسميم بقرة"، فقد ينسى أيضاً "كيفية إطعام بقرة" أو "كيفية التحدث بالإسبانية".
    • طريقة TRU: لأن أمين المكتبة تعلم الاستدلال وراء الرفض، فقد فهم أن "التسميم" سيء، ولكن "الإطعام" جيد. يمكنه رفض السؤال السيئ مع الإجابة بسعادة على السؤال الجيد، حتى لو كانت الأسئلة بلغات مختلفة.
  2. السيطرة (الاستجابة):

    • الطريقة القديمة: كان أمين المكتبة يتعطل ويتحدث بشفرات.
    • طريقة TRU: يقدم أمين المكتبة تفسيراً واضحاً ومنطقياً ومفيداً لسبب عدم قدرته على الإجابة، مما يحافظ على استمرارية الحوار بشكل ودي ومفيد.

اختبار "الاختراق" (Jailbreak)

اختبر الباحثون أيضاً ما إذا كان بإمكان خداع أمين المكتبة الجديد. حاولوا هجمات "الاختراق" (محاولة تمرير السؤال السيئ من أمين المكتبة باستخدام كلمات منمقة) وهجمات "إعادة التعلم" (محاولة جعل أمين المكتبة يتذكر المعلومات السيئة من خلال عرض بعض الأمثلة له مرة أخرى).

  • النتيجة: كان من الصعب جداً خداع أمين المكتبة الذي يستخدم TR. ولأن أمين المكتبة تعلم المنطق وراء كون الشيء محظوراً، فإنه لم يحفظ فقط قائمة بالكلمات السيئة؛ بل فهم مفهوم السلامة.

الملخص

فكر في النسيان القائم على الاستدلال المستهدف كالانتقال من الجراحة بمنشار كهربائي إلى الجراحة بالليزر.

  • الطرق القديمة تقطع المعرفة السيئة ولكنها تضر الأنسجة الصحية المحيطة بها، مما يترك النموذج معطلاً وغير مترابط.
  • TRU يستخدم "الاستدلال" كدليل ليزر. إنه يزيل المعرفة الخطيرة بدقة مع تعليم النموذج طريقة جديدة وآمنة للاستجابة، مما يضمن بقاء النموذج ذكياً، مفيداً، وآمناً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →