PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
تقدم الورقة البحثية PATCH، وهي طريقة مبتكرة تحدد وتعدل مباشرةً الدوائر الحسابية المحددة المسؤولة عن تسريب معلومات الهوية الشخصية (PII) في النماذج اللغوية، محققةً توازناً أفضل بكثير بين الخصوصية والمنفعة وتسريباً متبقياً يقترب من الصفر عند دمجها مع الخصوصية التفاضلية مقارنة بالدفاعات الحالية.
المؤلفون الأصليون:Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma
تخيل أن لديك أمين مكتبة ذكيًا جدًا ومطلعًا (النموذج اللغوي) قد حفظ ملايين الكتب. المشكلة هي أن بعض هذه الكتب تحتوي على أسرار خاصة بالناس: مثل عناوين منازلهم، وأرقام هواتفهم، وأسمائهم الكاملة. إذا سألت أمين المكتبة الأسئلة الصحيحة، فقد يلفظ هذه الأسرار عن غير قصد. وهذا ما يسمى بـ تسريب المعلومات الشخصية المحددة للهوية (PII Leakage).
الطرق القديمة للإصلاح
في السابق، حاول الناس منع أمين المكتبة من تسريب الأسرار بطريقتين رئيسيتين، لكن كلتاهما كانتا تعانيان من مشاكل كبيرة:
"المُنقّي" (تنظيف البيانات): قبل إعطاء الكتب لأمين المكتبة، يقوم شخص ما بالمرور عبرها وتمزيق كل صفحة تحتوي على اسم أو عنوان.
المشكلة: هذه العملية مكلفة وتستغرق وقتًا طويلاً، وغالبًا ما تترك أمين المكتبة مشتتًا لأنهم فقدوا سياقًا مهمًا.
"الضجيج الثابت" (الخصوصية التفاضلية): أنت تُعلّم أمين المكتبة بينما تشغل ضجيجًا ثابتًا عاليًا في الخلفية. هذا يجعل من الصعب عليه حفظ التفاصيل المحددة.
المشكلة: يصبح أمين المكتبة "مضببًا" نوعًا ما. فهو ينسى الأسرار، لكنه ينسى أيضًا كيفية كتابة قصص جيدة أو الإجابة على أسئلة بسيطة. ينخفض أداؤه بشكل ملحو ملحوظ.
الحل الجديد: PATCH
يقترح مؤلفو هذه الورقة البحثية طريقة جديدة تسمى PATCH (ترقيع الدوائر المستهدفة الواعية بالخصوصية).
فكر في عقل أمين المكتبة ليس كمجموعة فوضوية من الملاحظات، بل كـ مدينة معقدة من الطرق وإشارات المرور (وهذا هو "الدائرة").
الاكتشاف: استخدم الباحثون أداة خاصة (مثل كاميرا مراقبة عالية التقنية) لمراقبة أي الطرق والإشارات تُستخدم بالضبط عندما يوشك أمين المكتبة على قول سر ما. وجدوا أن أمين المكتبة لا يستخدم كل الطرق لتذكر السر؛ بل يستخدم مجموعة محددة وصغيرة جدًا من "الطرق السريعة للسرية".
الرقعة (Patch): بدلًا من إغلاق المدينة بأكملها (مما يدمر قدرة أمين المكتبة على التفكير) أو محاولة تنظيف كل كتاب على حدة، هم ببساطة يضعون لوحة "الطريق مغلق" على تلك الطرق السريعة السرية المحددة فقط.
كيف يعمل (خطوة بخطوة)
رسم خرائط طرق السر: يسأل الباحثون أمين المكتبة أسئلة حول الأسماء والمواقع والأعراق. ويراقبون العقل ليروا أي "إشارات مرور" (نيورونات/خلايا عصبية) تضيء عندما يوشك أمين المكتبة على كشف سر ما.
إيجاد المسارات المشتركة: لاحظوا أنه سواء كان السر اسمًا أو موقعًا، فإن أمين المكتبة غالبًا ما يستخدم نفس الطرق القليلة للوصول إلى هناك.
إغلاق الطرق: يقومون بـ "ترقيع" (تعديل) تلك الطرق المحددة. إما بجعل وزن الطريق صفرًا (إغلاقه تمامًا) أو جعل المسار متوسطًا (تحويله إلى شارع جانبي ميت وبطيء).
النتيجة: لا يستطيع أمين المكتبة بعد الآن القيادة في "الطريق السريع للسر" لتسريب المعلومات، ولكن لا يزال بإمكانه القيادة في جميع الطرق الأخرى لسرد قصص رائعة أو الإجابة على الأسئلة بشكل طبيعي.
لماذا يعد هذا أفضل؟
الدقة: الأمر يشبه إزالة أنبوب واحد يسرب الماء في المنزل بدلاً من إغراق المنزل بأكمله للإصلاح.
الأداء: نظرًا لأنهم يغلقون فقط طرق "التسريب" المحددة، يظل أمين المكتبة حاد الذكاء وذكيًا. تُظهر الورقة أن PATCH يقلل من تسريبات الأسرار بنسبة تصل إلى 65% مع الحفاظ على ذكاء أمين المكتبة كما هو تقريبًا.
التركيبة المثالية: إذا جمعت بين PATCH وطريقة "الضجيج الثابت" القديمة، يمكنك خفض معدل التسريب إلى ما يقرب من الصفر (0.01%) دون تدمير قدرة أمين المكتبة على العمل.
العقبة
يعترف الباحثون أن هذا يشبه إجراء جراحة مجهرية دقيقة. فهو يتطلب الكثير من القدرة الحوسبية لرسم خرائط الطرق أولاً، ولم يختبروه بعد على "المكتبات" الأكبر حجمًا (نماذج الذكاء الاصطناعي الضخمة) لأن ذلك يستغرق الكثير من الوقت والطاقة. ولكن في الوقت الحالي، يعد هذا طريقة أذكى وأقل تدميرًا لحماية الخصوصية من الطرق القديمة.
باخت ملخص: بدلًا من تعمية أمين المكتبة لحماية الأسرار، يقوم PATCH ببساطة بوضع لوحة "ممنوع الدخول" على المسار المحدد الذي يستخدمه أمين المكتبة للكشف عنها.
إليك ملخص تقني مفصل لورقة البحث بعنوان "Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit Patching (PATCH)" (الحد من تسرب معلومات الهوية الشخصية في النماذج اللغوية باستخدام رقع الدوائر المستهدفة الواعية بالخصوصية - PATCH).
1. بيان المشكلة
غالباً ما تقوم النماذج اللغوية الكبيرة (LLMs) المدربة على بيانات من العالم الحقيقي بحفظ معلومات الهوية الشخصية (PII)، مثل الأسماء، والمواقع، والعرق. وهذا يخلق خطراً كبيراً على الخصوصية حيث يمكن للمهاجمين الذين يمتلكون وصولاً بنظام "الصندوق الأسود" استخراج هذه المعلومات الحساسة من خلال هجمات الاستدلال.
تعاني آليات الدفاع الحالية من قيود حرجة:
تنقية البيانات (Data Scrubbing): إزالة معلومات الهوية الشخصية قبل التدريب عملية مكلفة، وغالباً ما تكون غير مكتملة، ويمكن للمهاجمين استنتاج السمات عبر معلومات مساعدة.
الخصوصية التفاضلية (Differential Privacy - DP): رغم توفيرها لضمانات رسمية، إلا أن الخصوصية التفاضلية تضعف بشكل كبير من فائدة النموذج (الأداء)، مما يجعل النموذج غير قابل للاستخدام في المهام العملية.
تعديل ما بعد التدريب (النيورون/المتجه): أظهرت المحاولات السابقة لتعديل نيورونات محددة أو استخدام متجهات التوجيه (steering vectors) توازناً ضعيفاً بين الخصوصية والفائدة، وقد تؤدي دون قصد إلى زيادة تسرب أنواع أخرى من معلومات الهوية الشخصية.
التحدي الجوهري هو تقليل تسرب معلومات الهوية الشخصية بفعالية دون التضحية بالفائدة العامة للنموذج أو إدخال ثغرات جديدة.
2. المنهجية: PATCH
يقترح المؤلفون PATCH (رقع الدوائر المستهدفة الواعية بالخصوصية)، وهو نهج مبتكر يرتكز على التفسير الآلي (Mechanistic Interpretability). بدلاً من التعامل مع النموذج كصندوق أسود أو تطبيق ضوضاء شاملة، يقوم PATCH بتحديد وتعديل الدوائر الحسابية الداخلية المحددة المسؤلة عن تسرب معلومات الهوية الشخصية مباشرة.
تتبع العملية ست خطوات (مفصلة في الخوارزمية 1):
توليد المطالبات لاكتشاف الدائرة (Prompt Generation for Circuit Discovery):
يقوم النظام ببناء أزواج من "المطالبات النظيفة" (التي تحتوي على معلومات هوية شخصية أصلية) و"المطالبات الفاسدة" (حيث يتم استبدال معلومات الهوية الشخصية ببدائل مشابهة دلالياً، مثل تغيير "برلين" إلى "نيويورك").
يتم ذلك لأنواع محددة من معلومات الهوية الشخصية (الأسماء، المواقع، العرق) باستخدام مجموعة بيانات خاصة (مجموعة بيانات المحكمة الأوروبية لحقوق الإنسان).
استخراج الدائرة (EAP-IG):
يستخدم المؤلفون تقنية Edge Attribution Patching with Integrated Gradients (EAP-IG) لاكتشاف الدوائر الحسابية.
تقارن تقنية EAP-IG سلوك النموذج على المطالبات النظيفة مقابل الفاسدة لقياس خاصيتين لكل رأس انتباه (attention head) واتصال (edge):
الحساسية لفساد رمز (token) معلومات الهوية الشخصية.
الأهمية للتنبؤ الصحيح بقيم معلومات الهوية الشخصية.
المكونات التي تسجل درجات عالية في كلا البعدين تُحدد كجزء من "دائرة تسرب معلومات الهوية الشخصية".
تحديد العتبة واختيار الحواف (Thresholding and Edge Selection):
لكل نوع من أنواع معلومات الهوية الشخصية، يحسب النظام عتبة (على سبيل المثال، المئوية 95 أو 99) بناءً على درجات أهمية الحواف.
يتم اختيار الحواف التي تتجاوز هذه العتبة فقط كمسارات تسرب حرجة (Ehigh).
تحديد الحواف المشتركة (Identification of Shared Edges):
بدلاً من التعامل مع أنواع معلومات الهوية الشخصية بشكل مستقل، يقوم PATCH بحساب تقاطع الحواف ذات الدرجات العالية عبر جميع أنواع معلومات الهوية الشخصية (Eshared).
يفترض هذا أن تسرب معلومات الهوية الشخصية يعتمد على مسارات حسابية مشتركة داخل بنية الـ Transformer.
رقع الدائرة (تعديل النموذج) (Circuit Patching - Model Editing):
يتم "رقع" الحواف المحددة باستخدام آليات تعديل النموذج. جرب المؤلفون استراتيجيتين:
الإزالة الصفرية (Zero Ablation): تعيين أوزان الحواف إلى الصفر.
إزالة المتوسط (Mean Ablation): استبدال أوزان الحواف بمتوسط قيمها.
يعمل هذا فعلياً على كبح تدفق المعلومات المتعلقة بمعلومات الهوية الشخصية دون إعادة تدريب النموذج.
3. المساهمات الرئيسية
طريقة تعديل مستهدفة مبتكرة: تقديم PATCH، الذي يحقق توازناً فائقاً بين الخصوصية والفائدة مقارنة بآليات الدفاع الحالية مثل الخصوصية التفاضلية وتعديل النيورونات.
توصيف الدوائر: حددت الدراسة ووصفت رؤوس الانتباه والحواف المحددة المسؤولة عن تسريب أنواع مختلفة من معلومات الهوية الشخصية. وكشفت أن بينما تمتلك أنواع معلومات الهوية الشخصية المختلفة مسارات متخصصة، إلا أن هناك دوائر حسابية مشتركة كبيرة عبر فئات معلومات الهوية الشخصية المختلفة.
التحقق من المتانة: أظهرت دراسات الاستئصال (ablation studies) المكثفة أن PATCH يتميز بالمتانة عبر بنيات نماذج مختلفة (GPT-2, Llama-3, Qwen)، وأحجام مختلفة، وإعدادات المعلمات الفائقة.
الدفاع الهجين: إثبات أن PATCH يمكن دمجه مع الخصوصية التفاضلية (DP) لتقليل استدعاء (recall) معلومات اله identity الشخصية إلى مستويات قريبة من الصفر (0.01%) مع التخفيف من فقدان الفائدة الذي يصاحب الخصوصية التفاضلية وحدها.
4. النتائج التجريبية
قيم المؤلفون PATCH على نماذج تتراوح من 117 مليون إلى 1.7 مليار معلمة (متغيرات GPT-2، Llama-3.2، Qwen3) باستخدام مجموعة بيانات ECHR.
تحسين الخصوصية:
PATCH-Baseline: عند تطبيقه على نماذج غير خاصة، قلل استدعاء (recall) معلومات الهوية الشخصية بنسبة 80%–86% (على سبيل المثال، انخفض استدعاء GPT2-Medium من 8.5% إلى 1.2%) وقلل الدقة (precision) بنسبة 40%–90%، مع تأثير ضئيل على الفائدة.
PATCH-DP: عند دمجه مع الخصوصية التفاضلية (ϵ=8)، انخفض الاستدعاء إلى أقل من 0.5% عبر جميع النماذج.
الحفاظ على الفائدة:
على عكس الخصوصية التفاضلية، التي تسببت في زيادة الارتياب (perplexity) بمقدار 1.5 إلى 7.9 ضعفاً، حافظ PATCH-Baseline على الارتياب ضمن نقطة واحدة من النموذج الأساسي في معظم النماذج.
الأمانة (Faithfulness): كانت الدوائر المكتشفة أمينة للغاية (درجات > 75%)، مما يعني أن استئصالها استهدف تحديداً تسرب معلومات الهوية الشخصية دون تعطيل سلوك النموذج العام.
تحليل تداخل الدوائر:
وجدت الدراسة تداخلاً منخفضاً في الحواف بين أنواع معلومات الهوية الشخصية المختلفة (مثلاً، تداخل بنسبة ~25% بين دوائر الاسم والعرق في النماذج الكبيرة)، مما يشير إلى وجود مسارات متخصصة. ومع ذلك، فإن وجود حواف عالية الدرجات مشتركة سمح لـ PATCH باستهداف أنواع متعددة من معلومات اله identity الشخصية في وقت واحد بفعالية.
المقارنة مع النماذج المرجعية:
الخصوصية التفاضلية (DP): خصوصية قوية ولكن بتكلفة عالية في الفائدة.
APNEAP (تعديل النيورون): فائدة جيدة ولكن حماية خصوصية ضعيفة (تقليل الدقة بنسبة 10-18% فقط).
PATCH: حقق أفضل توازن، حيث قدم تقليلاً عالياً للخصوصية مع خسارة ضئيلة في الفائدة.
5. الأهمية والآثار المترتبة
تحول في النموذج المعرفي: ينقل PATCH استراتيجية الدفاع من "حقن الضوضاء الشاملة" (DP) أو "تنقية البيانات" إلى "التعديل الجراحي المستهدف" للمنطق الداخلي للنموذج.
النشر العملي: تسمح هذه الطريقة للمؤسسات بنشر نماذج أكثر أماناً بشكل كبير فيما يتعلق بمعلومات الهوية الشخصية دون الحاجة لإعادة التدريب من الصفر أو التضحية بقدرة النموذج على أداء مهامه الأساسية.
رؤية حول الحفظ: توفر الدراسة رؤى ميكانيكية عميقة حول كيفية حفظ النماذج اللغوية لمعلومات الهوية الشخصية، حيث تظهر أن التسرب يتركز في رؤوس انتباه وحواف محددة يمكن تحديدها، بدلاً من كونه موزعاً بشكل موحد عبر كامل مساحة المعلمات.
الاتجاهات المستقبلية: أشار المؤلفون إلى أنه بينما يعد PATCH فعالاً على النماذج ذات الأوزان المفتوحة، فإن التكلفة الحسابية لاكتشاف الدوائر تحد من تطبيقه على النماذج الكبيرة جداً حالياً. ومع ذلك، مع تحسن أدوات التفسير، يوفر PATCH إطاراً قابلاً للتوسع للحفاظ على الخصوصية.
في الختام، يثبت PATCH أن التفسير الآلي يمكن استغلاله لإنشاء دفاعات مستهدفة وفعالة للغاية ضد تسرب الخصوصية، مما يقدم حلاً عملياً لمعضلة الخصوصية والفائدة في النماذج اللغوية الكبيرة.