Towards the Anonymization of the Language Modeling
تقترح هذه الورقة منهجيات الحجب ونمذجة اللغة السببية التي تحافظ على الخصوصية لتخصيص النماذج الشبيهة بـ BERT والشبيهة بـ GPT على البيانات الحساسة، مما يمنع بفعالية حفظ المعرفات المباشرة وغير المباشرة مع الحفاظ على فائدة عالية للمشاركة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "نحو إخفاء هوية نماذج اللغات"، مقسمة إلى مفاهيم بسيطة مع تشبيهات من الحياة اليومية.
المشكلة الكبرى: "الببغاء" في المستشفى
تخيل ببغاءً ذكيًا جدًا (نموذج لغة اصطناعي) تم تدريبه على آلاف السجلات الطبية للمرضى. هذا الببغاء مفيد للغاية؛ إذ يمكنه تلخيص التقارير، والتنبؤ بالأمراض، والإجابة على الأسوات الطبية.
ومع ذلك، هناك جانب مخيف: الببغاء لديه ذاكرة سيئة للغاية. نظرًا لأنه درس السجلات بدقة شديدة، فهو لا يتعلم فقط كيفية التحدث بلغة الطب، بل يحفظ أيضًا تفاصيل محددة عن أشخاص محددين. إذا سألته سؤالًا، فقد يخرج فجأة بكلمات مثل: "أوه، نعم، ذلك المريض، جون سميث، الذي يعيش في 123 شارع مابل، يعاني من حالة نادرة".
هذه كارثة تتعلق بالخصوصية. تريد المستشفيات مشاركة هذه الببغاوات الذكية مع باحثين آخرين للمساعدة في الجميع، لكن لا يمكنها فعل ذلك إذا كان الببغاء سيسرب أسرارًا خاصة.
الطريقة القديمة: "القلم الأحمر" (إخفاء الهوية بالأسماء المستعارة)
تقليديًا، قبل تدريب الببغاء، يقوم البشر باستخدام قلم أحمر ووضع خطوط فوق الأسماء والعناوين وأرقام الهواتف الواضحة. تسمى هذه العملية "إخفاء الهوية بالأسماء المستعارة" (Pseudonymization).
تجادل الورقة البحثية بأن هذا ليس كافيًا. وإليك السبب:
- المعرفات المباشرة: شطب "جون سميث" ينجح.
- المعرفات غير المباشرة: ولكن ماذا لو كان المريض هو الشخص الوحيد في مجموعة البيانات بأكملها الذي لديه مزيج محدد ونادر من الأعراض، مثل "أعسر، ولديه حساسية من الفول السوداني، وندبة على ركبته اليسرى"؟ حتى لو شطبت الاسم، فإن الببغاء يتعلم أن هذا المزيج المحدد ينتمي إلى شخص واحد محدد. إذا كرر الببغاء ذلك المزيج لاحقًا، فإنه يكشف هوية المريض.
طريقة "القلم الأحمر" القديمة تغفل هذه الإشارات الخفية.
الحل الجديد: "الأمين الصارم" (PPmlm-bert)
يقترح المؤلفون طريقة جديدة تسمى "نمذجة اللغة المقنعة المحافظة على الخصوصية" (PPmlm-bert). فكر في هذا كأمين مكتبة صارم يدير عملية التدريب.
إليك كيف يعمل أمين المكتبة:
قائمة الضيوف (المعالجة المسبقة): قبل أن يبدأ الببغاء في الدراسة، يقوم أمين المكتبة بإنشاء "قائمة سوداء".
- أولاً، يستخدمون أداة قياسية للعثور على الأسماء والأرقام الواضحة (المعرفات المباشرة).
- ثم يقومون بشيء ذكي: ينظرون إلى مكتبة السجلات بأكملها ويتساءلون: "من هو الشخص الوحيد الذي استخدم هذه الكلمة المحددة؟" إذا ظهرت كلمة (أو عبارة) في ملف شخص واحد فقط، فسيتم وضعها في القائمة السوداء. هذه هي المعرفات غير المباشرة.
لعبة "ملء الفراغات" (نمذجة اللغة المقنعة):
- لتعليم الببغاء، يلعب أمين المكتبة لعبة. يأخذ جملة، ويغطي كلمة بقناع (مثل
[MASK])، ويطلب من الببغاء تخمين الكلمة التي كانت هناك. - الخدعة: أمين المكتبة لا يسمح أبدًا للببغاء بتخمين كلمة موجودة في القائمة السوداء.
- مثال: إذا كانت الجملة "ذهب جون سميث إلى المستشفى"، وكان "جون سميث" في القائمة السوداء، فلن يطلب أمين المكتبة من الببغاء تخمين "جون". بدلاً من ذلك، قد يغطي كلمة شائعة مثل "ذهب" أو "المستشفى".
- تفصيل حاسم: لا يزال بإمكان الببغاء رؤية الكلمات الموجودة في القائمة السوداء في الجملة لمساعدته في تخمين الكلمات الأخرى، لكنه لا يتم اختباره على تذكرها. الأمر يشبه عرض صورة لشخص مشهور على الببغاء ولكن دون سؤاله: "من هذا؟" حتى لا يتعلم نطق الاسم.
- لتعليم الببغاء، يلعب أمين المكتبة لعبة. يأخذ جملة، ويغطي كلمة بقناع (مثل
النتيجة: يتعلم الببغاء اللغة الطبية بشكل ممتاز (منفعة عالية)، لكنه لا يحفظ أبداً التفاصيل المحددة التي قد تكشف هوية مريض واحد (خصوصية عالية).
قاعدة "k-anonymity" (السرية لـ k من الأشخاص)
تستخدم الورقة مفهوم k-anonymity (تحديدًا ضبط ).
- تخيل حفلة. إذا كنت الشخص الوحيد الذي يرتدي قبعة حمراء، فسيعرف الجميع من أنت.
- إذا كنت أنت وشخص آخر ترتديان قبعات حمراء، فستكونان غير مميزين عن بعضكما البعض.
- تضمن طريقة المؤلفين أن الببغاء يتعلم فقط الكلمات التي استخدمها شخصان مختلفان على الأقل. إذا استخدم شخص واحد فقط كلمة ما، يُمنع الببغاء من تعلم التنبؤ بها.
هل نجح الأمر؟ (النتائج)
اختبر المؤلفون هذا على تقارير طبية ونصوص قانونية باستخدام نماذج ذكاء اصطناعي مختلفة (مثل BERT و RoBERTa).
- الخصوصية: حاولوا خداع النماذج للكشف عن أسماء المرضى أو تفاصيل فريدة. كانت الطريقة الجديدة (PPmlm-bert) جيدة للغاية في الحفاظ على الأسرار. لقد منعت النماذج من حفظ الأسماء الواضحة أو تلك التوليفات المعقدة والفريدة من الكلمات.
- الفائدة: تحققوا أيضًا مما إذا كانت النماذج لا تزال ذكية بما يكفي للقيام بمهام طبية (مثل التنبؤ بما إذا كان المريض مدخنًا أو يعاني من السمنة). ومن المثير للدهشة، أن الطريقة الجديدة قدمت أداءً يضاهي الطرق القديمة المحفوفة بالمخاطر.
- المقارنة:
- الطريقة القديمة (القلم الأحمر): سربت الأسرار.
- الخصوصية التفاضلية (إضافة الضجيج/الضوضاء): حافظت على الأسرار جيدًا، لكنها جعلت الببغاء غبيًا جدًا (منفعة منخفضة).
- الطريقة الجديدة (الأمين الصارم): حافظت على الأسرار وأبقت الببغاء ذكيًا.
الخلاصة
تقدم هذه الورقة طريقة عملية لتدريب الذكاء الاصطناعي على بيانات حساسة (مثل السجلات الطبية) دون أن يتحول الذكاء الاصطناعي إلى "دلو مثقوب" يسرب معلومات خاصة. ومن خلال ضمان عدم ممارسة الذكاء الاصطناعي للتنبؤ بالتفاصيل الفريدة والوحيدة، يمكن للمستشفيات مشاركة نماذج الذكاء الاصطناعي الخاصة بها مع العالم دون انتهاك خصوصية المرضى أو مخالفة القانون (GDPR).
باخت-القول: لقد علموا الذكاء الاصطناعي تعلم لغة الطب دون حفظ قصص المرضى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.