From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models
تقترح الورقة البحثية MAGE، وهو إطار عمل لـ "إلغاء التعلم" (unlearning) لا يعتمد على المتون، يستخدم ركائز مستخدم خفيفة الوزن لاستعادة وتنظيم الذاكرة المستهدفة تلقائياً في رسم بياني للذاكرة، مما يؤدي إلى توليد إشراف محدد النطاق لمحو المحتوى الحساس من النماذج اللغوية الكبيرة بفعالية دون الحاجة إلى الوصول إلى بيانات التدريب الأصلية.
المؤلفون الأصليون: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang
المؤلفون الأصليون: Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك ملخص تقني مفصل لورقة البحث بعنوان "من المرتكزات إلى الإشراف: التوجيه عبر رسم بياني للذاكرة لعملية محو المعرفة الخالية من المتون للنماذج اللغوية الكبيرة" (MAGE).
1. تعريف المشكلة
غالبًا ما تقوم النماذج اللغوية الكبيرة (LLMs) بحفظ معلومات حساسة أو محمية بحقوق الطأليف، مما يخلق مخاطر قانونية وخصوصية (مثل "الحق في النسيان" بموجب اللائحة العامة لحماية البيانات GDPR). تعتمد نماذج محو المعرفة الحالية عادةً على قيام المستخدمين بتوفير مجموعة نسيان (Sf)—وهي مجموعة بيانات تحتوي صراحةً على المعلومات المراد مسحها.
حدد المؤلفون ثلاث عيوب حرجة في نموذج مجموعة النسيان التي يوفرها المستخدم:
- تسرب الخصوصية: إن رفع محتوى حساس لغرض محو المعرفة ينطوي على خطر تسرب البيانات الثانوية إذا تم اعتراض المجموعة أو إساءة التعامل معها.
- القابلية للتدقيق وإساءة الاستخدام: لا يمكن لمزودي الخدمة التدقيق بسهولة في المجموعات المقدمة خارجيًا. يمكن للمتربصين تقديم مجموعات "ذات نطاق خاطئ" (تحتوي على بيانات مستخدمين آخرين) أو مجموعات "مسمومة" (تتضمن أبوابًا خلفية) لتقليل فائدة النموذج أو جعل عملية المحو قابلة للاسترداد.
- التبعية: تفترض الطرق الحالية أن المستخدم يعرف بالضبط ما يجب توفيره، وهو أمر غير عملي غالبًا في حالة محو المعرفة على مستوى الكيانات حيث تكون الحقائق المحفوظة المحددة غير معروفة للمستخدم.
الهدف: اقتراح نموذج محو معرفة خالٍ من المتون (Corpus-free) ومُقلل للمدخلات من قبل المستخدم، حيث يقدم المستخدم فقط مرتكزًا (Anchor) أدنى (مثل اسم "تايلور سويفت")، ويقوم مزود خدمة النموذج اللغوي الكبير بإعادة بناء الإشراف اللازم ذاتيًا لمحو المعرفة المستهدفة دون الوصول إلى متن التدريب الأصلي.
2. المنهجية: إطار عمل MAGE
يقترح المؤلفون إطار عمل MAGE (المحو الموجه برسم بياني للذاكرة)، وهو إطار عمل يتكون من مرحلتين ويعمل دون بيانات خارجية.
المرحلة الأولى: تنقيب الذاكرة الداخلية
بدلاً من الاعتماد على مطالبة (Prompt) واحدة، يقوم MAGE بإعادة بناء المعرفة الداخلية للنموذج حول الكيان المستهدف (Et) عن طريق بناء رسم بياني للذاكرة المحلية الموزونة (Gt).
- التوسع التكراري: بدءًا من المرتكز الأدنى، يتم استعلام النموذج N من المرات لاستخراج حقائق ذات صلة.
- الاستقرار الذاتي للذاكرة: يتم تقييم المرشحين بناءً على تكرار الذكر عبر عمليات توليد مستقلة. تشير المذكرات عالية التكرار إلى آثار مستقرة ومحفوظة بقوة، بينما تُعامل المذكرات منخفضة التكرار على أنها ضوضاء.
- بناء الرسم البياني: يقوم النظام بالتوسع حتى K من القفزات (Hops). تمثل العقد كيانات/أحداث، وتمثل الحواف قوة الاستدعاء المشترك. يعكس الوزن w(u,v) عدد المرات التي يتم فيها استدعاء v عند كون u هو المرتكز.
- المخرجات: رسم بياني مهيكل يلخص أنماط حفظ الذاكرة الخاصة بالنموذج فيما يتعلق بالهدف.
المرحلة الثانية: بناء الإشراف المحدد للنطاق
يتم تحويل رسم الذاكرة إلى مجموعة نسيان محددة النطاق (Sf) ومجموعة جيران (Sn) لعملية الضبط الدقيق اللاحقة.
- أخذ عينات المسارات الموزونة: يقوم النظام بإجراء جولات عشوائية موزونة حسب القوة على الرسم البياني لأخذ عينات من المسارات. يضمن ذلك تركيز الإشراف على المحتوى الأكثر حفظًا بقوة (الأوزان العالية للحواف) مع الحفاظ على التغطية.
- تخليق الأحداث من الحواف: يتم تحويل أزواج العقد المتجاورة في المسار إلى أزواج سؤال وجواب (QA pairs) ذرية.
- مجموعة النسيان (Sf): تستهدف الأسئلة العلاقة بين المرتكز وأحد الجيران، ويكون الجواب هو الكيان المستهدف. يتم حساب الخسارة (Loss) فقط على نطاق الإجابة لتحديد التحديثات بدقة.
- مجموعة الجيران (Slan): تُستخدم المسارات التي تبدأ من جيران أقوياء ولكنها تستبعد الكيان المستهدف لإنشاء أزواج سؤال وجواب يكون فيها الجواب كيانًا غير مستهدف. يعمل هذا كقيد حدودي للحفاظ على المعرفة المحيطة ومنع "النسيان الجانبي".
- التكامل: يتم دمج أزواج (Sf,Sn) المولدة في خوارزميات محو المعرفة القياسية (مثل Gradient Ascent أو NPO) جنبًا إلى جنب مع مجموعة الاحتفاظ العامة.
3. المساهمات الرئيسية
- تحول في النموذج: تقديم نموذج محو معرفة مقلل لمدخلات المستخدم وخالٍ من المتون، مما يلغي الحاجة لقيام المستخدمين برفع مجموعات نسيان حساسة، وبالتالي يقلل من مخاطر تسرب الخصوصية ومخاطر التدقيق.
- إطار عمل MAGE: تطوير طريقة مبتكرة لاستعادة الذاكرة المتعلقة بالهدف من بارامترات النموذج عبر التوسع التكراري وبناء رسم بيٍ للذاكرة، وتحويلها إلى إشراف محدد النطاق دون مراجع خارجية.
- التحقق التجريبي: إثبات أن الإشراف المولد ذاتيًا يمكن أن يحقق أداء محو معرفة يضاهي (وفي بعض الأحيان يتفوق على) الطرق التي تعتمد على بيانات خارجية عالية الجودة (مثل ويكيبيديا)، مع الحفاظ على فائدة النموذج.
4. النتائج التجريبية
تم تقييم إطار العمل على معيارين: RWKU (أشخاص مشهورون في العالم الحقيقي) و TOFU (مؤلفون خياليون اصطناعيون)، باستخدام استراتيجيات ضبط دقيق متنوعة (GA, NPO, GA+GD, GA+KL).
- فعالية محو المعرفة:
- في RWKU، حقق MAGE أدنى درجات "مجموعة النسيان" (مما يشير إلى محو أفضل) في 3 من أصل 4 استراتيجيات مقارنة بالنماذج المرجعية مثل ELUDe (الذي يستخدم ويكيبيديا) و DirectQA.
- في TOFU، تفوق MAGE بشكل كبير على DirectQA، مما أظهر أن رسوم الذاكرة المستخرجة توفر إشرافًا أكثر فعالية وتحديدًا للهدف من المطالبات المباشرة.
- الحفاظ على الفائدة:
- حافظ MAGE على أداء عالٍ في مقاييس الفائدة (MMLU, BBH, TruthfulQA, إلخ)، وغالبًا ما تفوق على النماذج المرجعية التي عانت من النسيان الكارثي أو التدهور الشديد في الفائدة.
- كان إدراج مجموعة الجيران أمرًا حاسمًا؛ حيث أدى استبدالها ببيانات ويكيبيديا عامة إلى تدهور الأداء، مما يثبت أهمية الإشراف الواعي بالسياق.
- تحليل المتانة:
- الهلوسة: النظام قوي بشكل مفاجئ تجاه الهلوسات الواقعية في أزواج السؤال والجواب المولدة؛ ظل الأداء مستقرًا حتى مع نسب صحة مختلطة.
- التغطية: ارتبطت التغطية الأعلى لرسم الذاكرة في مجموعة النسيان بمحو أقوى، مما يؤكد أن تنقيب الذاكرة الشامل هو المفتاح.
- خصوصية النموذج: تباينت رسوم الذاكرة المستعادة بشكل كبير عبر بنيات النماذج المختلفة (مثل Llama-2 مقابل Llama-3)، مما يشير إلى أن إشراف محو المعرفة يجب إعادة توليده لكل نموذج.
5. الأهمية
يعالج هذا العمل عقبة حرجة في النشر العملي لمحوا المعرفة الآلية. من خلال نقل عبء إعداد البيانات من المستخدم إلى مزود النموذج عبر نهج موجه برسم بياني للذاكرة، يقوم MAGE بـ:
- تعزيز الأمن: يمنع المتربصين من حقن بيانات مسمومة أو تسريب معلومات حساسة عبر طلب محو المعرفة نفسه.
- تحسين القابلية للتدقيق: يسمح للمزودين بالتحقق من أن نطاق محو المعرفة يقتصر بدقة على الكيان المطلوب، حيث يتم اشتقاق الإشراف داخليًا.
- تمكين التطبيق في العالم الحقيقي: يجعل "الحق في النسيان" أمرًا ممكنًا للمستخدمين الذين لا يستطيعون أو لا ينبغي لهم تقديم بيانات خام، مما يدعم نظامًا بيئيًا للذكاء الاصطناعي أكثر أمانًا وقابلية للتدقيق.
في الختام، يثبت MAGE أن محو المعرفة الفعال الخالي من المتون أمر ممكن من خلال الاستفولاع من هياكل الذاكرة الداخلية للنموذج اللغوي الكبير لتوليد إشرافه الخاص، مما يوفر مسارًا عمليًا نحو ذكاء اصطناعي يحافظ على الخصوصية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث NLP كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.