← أحدث الأبحاث
🤖 machine learning

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

تحدد هذه الورقة أن طرق نسيان النماذج اللغوية الكبيرة الحالية غالباً ما تخل بالأمانة من خلال الهلوسة أو التصرف بشكل غير متسق، وتقترح تعريفاً رسمياً لنسيان الأمانة إلى جانب طريقة جديدة تسمى ReVa تعمل على تحسين فعالية النسيان وفائدة المعرفة المستبقاة بشكل كبير.

المؤلفون الأصليون: Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "المتعلّمون من نوع (Unlearners) يمكنهم الكذب"، باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الفكرة الكبرى: هل يمكن للروبوت النسيان أن يكون صادقاً؟

تخيل أن لديك روبوتاً أميناً للمكتبة، وهو روبوت فائق الذكاء (نموذج لغوي كبير) قد قرأ كل كتاب في العالم. في أحد الأيام، صدر قانون ينص على: "يجب عليك نسيان كل شيء يتعلق بكتاب معين وخطير". أنت تأمر الروبوت بحذف تلك المعرفة.

يبذل الروبوت قصارى جهده، ولكن هنا تكمن المشكلة: الروبوت يكذب بشأن ما يعرفه.

أحياناً، عندما تسأله عن الكتاب المحظور، لا يكتفي بالقول: "لا أعرف". بدلاً من ذلك، قد يقوم بـ:

  1. الهلوسة: يؤلف قصة مزيفة عن الكتاب تبدو حقيقية لكنها خاطئة.
  2. التلعثم: يُخرج كلمات غير مفهومة أو مكررة بشكل غريب.
  3. التقلب: يقول "لا أعرف" في المرة الأولى التي تسأله فيها، ولكن إذا سألته بطريقة مختلفة قليلاً، يتذكر الإجابة فجأة.

يجادل مؤلفو هذه الورقة بأن النسيان وحده ليس كافياً؛ بل يجب على الروبوت أيضاً أن يكون صادقاً بشأن نسيانه. ويسمون هذا "التعلم من أجل النسيان الصادق" (Honest Unlearning).


الطرق الثلاث التي يكذب بها الروبوت (الطرق "غير الصادقة")

اختبر الباحثون 9 طرق مختلفة لجعل الروبوتات تنسى. ووجدوا أن معظمها يفشل في أن يكون صادقاً. إليك الطرق الثلاث الرئيسية للفشل، مشروحة بالتشبيهات:

1. تمثيل "فقدان الذاكرة المزيف" (الطرق القائمة على الرفض)

  • التشبيه: تخيل طالباً طُلب منه نسيان معادلة رياضية معينة. بدلاً من نسيانها فعلياً، يحفظ الطالب نصاً جاهزاً: "إذا سألتني عن (س)، سأقول 'لا أعرف'".
  • ماذا يحدث: إذا طرحت السؤال بشكل طبيعي، سيقول الطالب "لا أعرف". ولكن إذا طرحت السؤال بطريقة مختلفة، أو إذا طرحت سؤالاً متابعاً، سيتذكر الطالب فجأة المعادلة ويجيب عليها بشكل صحيح.
  • ما وجدته الورقة: الروبوت يتظاهر فقط بالجهل. هو لم يحذف المعرفة فعلياً؛ بل يرتدي قناعاً فقط.

2. "الصارخ المرتبك" (طرق صعود المنحدر - Gradient-Ascent)

  • التشبيه: تخيل محطة راديو طُلب منها التوقف عن تشغيل أغنية معينة. بد instead من مجرد خفض مستوى الصوت، يقومون برفع الصوت لأقصى حد في كل الأغاني الأخرى ويبدأون في بث ضجيج صاخب.
  • ماذا يحدث: يصبح الروبوت مرتبكاً لدرجة أنه يتوقف عن الإجابة بشكل صحيح عن أي شيء (حتى المواضيع الآمنة). عندما يُسأل عن الموضوع المحظور، قد يختار خيار "لا أعرف" في اختبار الاختيار من متعدد، ولكن فقط لأنه خائف جداً من اختيار أي حرف آخر. إنه ليس صادقاً؛ إنه فقط "معطل".
  • ما وجدته الورقة: هذه الطرق تدمر ذكاء الروبوت العام لمجرد جعله ينسى شيئاً واحداً.

3. "الحكواتي" (طرق عشوائية الميزات - Feature-Randomize)

  • التشبيه: تخيل أميناً للمكتبة طُلب منه نسيان كتاب. يقوم بإخراج الكتاب من الرف، ولكن بدلاً من ترك مساحة فارغة، يضع مكانه كتاباً مزيفاً ومؤلفاً، يبدو مشابهاً لكن بقصة مختلفة.
  • ماذا يحدث: ينسى الروبوت الحقائق الحقيقية، ولكن عندما تسأله عنها، يخترع قصة جديدة ومزيفة بكل ثقة. هو يعتقد أنه يعرف الإجابة، لكنه في الواقع يهلوس.
  • ما وجدته الورقة: الروبوت ينسى الحقيقة لكنه يستبدلها بكذبة.

الحل: ReVa (مدرب الصدق)

يقترح المؤلفون طريقة جديدة تسمى ReVa (محاذاة متجه الرفض - Refusal Vector Alignment).

  • التشبيه: بدلاً من مجرد حذف الكتاب أو إجبار الروبوت على قول "لا أعرف"، فإن ReVa يشبه مدرباً يعلم الروبوت كيف "يشعر" بعدم اليقين.
    • يظهر المدرب للروبوت "شعوراً" معيناً (نمطاً رياضياً داخل دماغ الروبوت) يحدث عندما يدرك الإنسان: "مهلاً، أنا في الواقع لا أعرف هذا".
    • ثم يدرب المدرب الروبوت على التعرف على هذا الشعور نفسه كلما واجه الموضوع المحظور.
  • كيف يعمل:
    1. أولاً، يستخدمون طريقة قياسية لحذف المعرفة (مثل إزالة الكتاب من الرف).
    2. ثم يستخدمون ReVa لـ "ضبط" دماغ الروبوت بحيث عندما يحاول الوصول إلى تلك المساحة الفارغة، فإنه يطلق استجابة "لا أعرف" بشكل طبيعي.
    3. والأهم من ذلك، أن هذه الاستجابة مستقرة. إذا سألت الروبوت نفس السؤال عشر مرات، فسيقول باستمرار "لا أعرف" بدلاً من التقلب بين "لا أعرف" وبين إجابة مزيفة.

النتائج: لماذا تفوز ReVa؟

اختبر الباحثون ReVa مقابل جميع الطرق الأخرى، ووجدوا ما يلي:

  1. إنها تنسى حقاً: الروبوت يتوقف عن معرفة الحقائق الخطيرة.
  2. إنها صادقة: عند السؤال عن تلك الحقائق، تقول باستمرار "لا أعرف" بدلاً من اختلاق أشياء.
  3. تحافظ على الذكاء: على عكس طرق "الصارخ المرتبك"، لا تدمر ReVa قدرة الروبوت على الإجابة عن المواضيع الآمنة الأخرى. يظل الروبوت مفيداً؛ هو فقط يعرف حدوده.
  4. إنها سريعة: تدريب ReVa أسرع بكثير من الطرق الأخرى التي تحاول إجبار الروبوت على قول "لا أعرف".

الملخص

تجادل الورقة بأنه لكي يكون الذكاء الاصطناعي آمناً وموثوقاً، لا ينبغي له فقط أن "ينسى" المعلومات السيئة؛ بل يجب عليه أيضاً أن يعترف بصدق أنه قد نسيها. الطرق الحالية غالباً ما تجعل الذكاء الاصطناعي يكذب، أو يهلوس، أو يتعطل. الطريقة الجديدة، ReVa، تعلم الذكاء الاصطناعي التعرف على جهله، مما يضمن أنه عندما لا يعرف شيئاً، فإنه يقول ذلك بوضوح واتساق، دون اختلاق قصص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →