← أحدث الأبحاث
📊 statistics

Label Differential Privacy via Aggregation

تقترح هذه الورقة إطاراً للخصوصية التفاضلية للبيانات المسمومة (label differential privacy) لمهام الانحدار، والذي يحقق ضمانات خصوصية قوية من خلال التجميع الخطي الموزون لنماذج التدريب أو الحقائب المنفصلة، مما يوفر حدوداً عملية محسنة وحفاظاً على المنفعة دون الحاجة إلى ضجيج تسمية إضافي.

المؤلفون الأصليون: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

نُشر 2026-09-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في العصر الرقمي الحديث، تُجمع كميات هائلة من المعلومات الشخصية يومياً لتدريب برامج الكمبيوتر التي تضع التوقعات، بدءاً من تقدير أسعار المنازل وصولاً إلى التنبؤ بالمبيعات. ويتمثل أحد التحديات الحاسمة في هذا المجال في كيفية تعليم هذه الأنظمة دون الكشف عن التفاصيل الحساسة للأفراد الذين قدموا بياناتهم. ويبرز "الخصوصية التفاضلية" (differential privacy) كحل قوي، حيث يعمل كدرع رياضي؛ فهو يضمن أن النتيجة النهائية لتحليل الكمبيوتر تبدو متشابهة تقريباً سواء تم تضمين بيانات أي شخص أو استبعادها، مما يجعل من المستحيل على أي طرف خارجي عكس هندسة معلومات ذلك الشخص تحديداً. وبينما تمت دراسة هذا المفهوم جيداً للبيانات العامة، تبرز مشكلة محددة وصعبة عندما تكون المعلومات الحساسة مخفية تماماً داخل "التصنيفات" (labels)—أي الإجابات أو النتائج المرتبطة بالبيانات، مثل التشخيص الطبي للمريض أو خيار الناخب. وقد ظل حماية هذه التصنيفات دون تدمير قدرة الكمبيوتر على تعلم الأنماط المفيدة عائقاً طويلاً.

لقد طور فريق من الباحثين في "جوجل ريسيرش إنديا" (Google Research India) طريقة جديدة لحل هذه المشكلة من خلال تغيير كيفية تجميع ودمج البيانات قبل استخدامها في التدريب. وبدلاً من إضافة ضوضاء عشوائية إلى البيانات، وهي تقنية غالباً ما تؤدي إلى تشويش النتائج وتقليل الدقة، اقترحوا نظاماً من "التجميع الموزون" (weighted aggregation). تخيل أخذ مجموعة كبيرة من السجلات الفردية وخلطها معاً في مجموعات صغيرة، أو "أكياس". في نهجهم، يتم ضرب كل سجل داخل الكيس في رقم فريد تم إنشاؤه عشوائياً ومستمد من توزيع محدد يشبه الجرس. ثم يقوم النظام بجمع هذه السجلات الموزونة لإنشاء نقطة بيانات واحدة جديدة للكيس. وتتكرر هذه العملية لإنشاء العديد من النقاط المجمعة. وقد وجد الباحثون أن هذه الطريقة المحددة لخلط البيانات، باستخدام هذه الأوزان العشوائية، تخلق حاجزاً رياضياً يحمي خصوصية التصنيفات الأصلية. والأهم من ذلك، أنهم أثبتوا أن هذه الحماية تظل قائمة حتى لو كان المهاجم يعرف كل شيء عن السجلات الأخرى في الكيس، بشرما كان حجم مجموعة البيانات كبيراً بما يكفي ولم تكن جميع التصنيفات متطابقة.

توضح الدراسة أن هذه الطريقة تعمل بفعالية في سيناريوهين مختلفين. في الأول، يتم تضمين كل سجل في المجموعة بأكملها في كل كيس، مما يخلق مجموعة مجمعة شديدة الاختلاط. وفي الثاني، يتم تقسيم مجموعة البيانات إلى مجموعات صغيرة غير متداخلة، وتتم معالجة كل مجموعة على حدة. وفي كلتا الحالتين، أظهر الباحثون أن نموذج الكمبيوتر الذي يتم تدريبه على هذه النقاط المجمعة والمحمية بالخصوصية لا يزال قادراً على تعلم كيفية إجراء التوقعات بدقة تقارب دقة النموذج المدرب على البيانات الأصلية الخام. وقد اختبروا ذلك على مجموعات بيانات واقعية ضخمة، بما في ذلك تعداد سكاني لأكثر من 130 مليون شخص من عام 1940، ومجموعة تضم أكثر من 1.7 مليون سجل من منصة إعلانية عبر الإنترنت. وكانت النتائج واضحة: حققت النماذج المدربة على البيانات المجمعة مستوى من الدقة يقارب مستويات النماذج المدربة على البيانات الخام، مع الالتزام بضمانات خصوصية صارمة.

إن الاكتشاف الرئيسي لهذا العمل هو أن مجرد جمع التصنيفات في مجموعة ما دون هذه الأوزان العشوائية الخاصة لا يوفر أي حماية حقيقية للخصوصية. فإذا تم جمع البيانات فحسب، فإن تغييراً في تصنيف شخص واحد سيؤدي إلى إزاحة يمكن اكتشافها في الإجمالي، مما يكشف معلوماته. وقد أثبت الباحثون أن التوزين العشوائي ضروري لإخفاء المساهمات الفردية. علاوة على ذلك، أظهروا أن هذه التقنية لا تتطلب إضافة ضوضاء إضافية إلى التصنيفات، وهو مطلب شائع في طرق الخصوصية الأخرى التي غالباً ما تضعف جودة التعلم. ومن خلال الاعتماد فقط على الخصائص الرياضية لهذا التجميع الموزون، حافظوا على فائدة البيانات لمهام الانحدار (regression tasks)، والتي تُستخدم للتنبؤ بالقيم المستمرة مثل أرقام المبيعات أو ساعات العمل.

كما استكشف الفريق نوعاً من التغيير حيث يتم تعديل جزء صغير من التصنيفات عمداً باستخدام الضوضاء قبل تجميعها، ودمج ذلك مع التجميع الموزون. سمح هذا النهج الهجين بتوسيع ضمانات الخصوصية لتشمل مهام تعلم أكثر تعقيداً تتضمن الشبكات العصبية، وهي نماذج التعلم العميق القادرة على التعامل مع الأنماط المعقدة. وأكدت تجاربهم أنه حتى مع هذه التعقيدات المضافة، حافظت النماذج على فائدة عالية. ويشير هذا العمل إلى أنه بالنسبة للعديد من التطبيقات العملية، خاصة تلك المقيدة باللوائح أو القيود النظامية التي تمنع استخدام البيانات الفردية الخام، فإن طريقة التجميع هذه توفر مساراً قوياً للمضي قدماً. فهي تسمح للمؤسسات ببناء أدوات تنبؤية قوية باستخدام بيانات حساسة دون المساس بخصوصية الأفراد وراء تلك الأرقام، وكل ذلك دون الخسارة الكبيرة في الدقة التي غالباً ما تصاحب تقنيات الحفاظ على الخصوصية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →