← أحدث الأبحاث
🤖 AI

Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs

تقترح هذه الورقة البحثية وتقيم مسار عمل متعدد المراحل لنماذج اللغات الكبيرة يتيح تصنيفاً مرناً ومستقلاً عن التصنيفات لبيانات تحديد الهوية الشخصية في حركة مرور HTTP، مع معالجة ندرة البيانات من خلال توليد حركة مرور اصطناعية وإثبات دقة الكشف عبر تعريفات الخصوصية المتنوعة.

المؤلفون الأصليون: Thomas Cory, Axel Küpper

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Thomas Cory, Axel Küpper

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مفتش خصوصية في مدينة مزدحمة. مهمتك هي فحص كل رسالة، وطرد، ورسالة رقمية تغادر المدينة للتأكد من أن لا أحد يرسل بالخطأ معلومات شخصية سرية (مثل عناوين المنازل، أرقام الهواتف، أو السجلات الطبية). تُسمى هذه المعلومات السرية بـ PII (معلومات تحديد الهوية الشخصية).

لسنوات، استخدم المفتشون أداتين رئيسيتين:

  1. كتاب القواعد: قائمة صارمة من الكلمات المفتاحية (مثل "البريد الإلكتروني" أو "رقم الضمان الاجتماعي"). تعمل هذه الأداة بشكل جيد مع الرسائل البسيطة، لكنها تفشل عندما يكتب الناس بطرق غريبة أو يستخدمون رموزاً مشفرة.
  2. الكلب المدرب: وهو نموذج تعلم آلي تم تدريبه على آلاف الأمثلة. هو ذكي، لكنه يعرف فقط القواعد المحددة التي تعلمها. إذا تغيرت القواعد (على سبيل المثال، إذا غير قانون جديد تعريف "البيانات الصحية")، يحتاج الكلب إلى إعادة تدريب من الصفر، وهو أمر يستغرق وقتاً طويلاً ويتطلب إمداداً هائلاً من الرسائل الحقيقية السرية ليدرسها.

المشكلة: الحصول على الرسائل الحقيقية السرية أمر صعب (بسبب قوانين الخصوصية)، والقواعد المتعلقة بما يُعتبر "سرياً" تتغير باستمرار. هذا يترك المفتشين في نقص في أدوات التدريب الجيدة والبيانات المتاحة.

الحل الجديد: "المترجم الخارق"

تقدم هذه الورقة نهجاً جديداً باستخدام نماذج اللغات الكبيرة (LLMs). فكر في نموذج اللغة الكبير ليس ككلب مدرب، بل كـ مترجم ذكي ومرن قرأ كل شيء تقريباً في المكتبة. أنت لا تحتاج لتدريب هذا المترجم على قواعد محددة؛ بل يكفي أن تسلمه كتاب القواعد الآن (أثناء التشغيل)، وسيمكنه فهمه فوراً.

إليك كيف بنى المؤلفون نظامهم، باستخدام تشبيهات بسيطة:

1. خط التجميع (المسار - The Pipeline)

بدلاً من طلب القيام بكل شيء من المترجم دفعة واحدة، بنى المؤلفون خط تجميع مكون من ثلاث خطوات:

  • الخطوة 1: المنظف (المعالجة المسبقة): قبل أن يرى المترجم الرسالة، تقوم آلة بتنظيفها. تقوم بفك الرموز (مثل تحويل %20 مرة أخرى إلى مسافة) حتى يرى المترجم جملة واضحة وسهلة القراءة.
  • الخطوة 2: المحقق والكاتب (التوسيم على مرحلتين):
    • المحقق: أولاً، ينظر نموذج اللغة الكبير إلى الرسالة ويقول: "أرى رقم هاتف واسماً هنا، ولكن لا توجد سجلات طبية". ثم ينشئ قائمة قصيرة بما يجب البحث عنه.
    • الكاتب: بعد ذلك، تركز تمريرة ثانية فقط على إيجاد النص الدقيق لتلك العناصر المحددة. ومن خلال تضييق نطاق التركيز، لا يرتبك الكاتب بسبب الأرقام أو الكلمات الأخرى.
  • الخطوة 3: المحرر (المراجعة): تقوم مراجعة نهائية بفحص العمل. إذا أغفل الكاتب رقماً أو التقط الكلمة الخاطئة، يقوم المحرر بإصلاح الأمر.

2. مصنع "الرسائل المزيفة" (البيانات الاصطناعية)

بما أن المفتشين لا يمكنهم استخدام رسائل الناس الحقيقية السرية لتدريب أدواتهم، فقد بنى المؤلفون مصنعاً يصنع رسائل مزيفة.

  • يأخذ هذا المصنع كتاب القواعد (التصنيف) ويطلب من نموذج اللغة الكبير كتابة رسائل تبدو واقعية تحتوي على أسرار محددة (مثل "رقم هاتف جون دو").
  • والأهم من ذلك، يكتب المصنع أيضاً الإجابات (الحقيقة الأرضية) لكل رسالة يصنعها.
  • لماذا هذا مهم: هذا يحل مشكلة "النقص". يمكنك توليد آلاف الرسائل التدريبية مع إجابات مثالية فوراً، دون الحاجة للمس أي بيانات خاصة لشخص حقيقي.

3. تجربة القيادة (التقييم)

اختبر المؤلفون هذا النظام باستخدام ثلاثة "كتب قواعد" (تصنيفات):

  1. AI4Privacy: قائمة واسعة للأسرار الشائعة (أسماء، رسائل بريد إلكتروني، هويات).
  2. mHealth: قائمة محددة لتطبيقات الصحة (العلامات الحيوية، بيانات اللياقة البدنية).
  3. PlayStore: قائمة عالية المستوى تستخدمها متاجر التطبيقات (مثل "البيانات المالية" أو "الموقع").

النتائج:

  • النجاح: عمل النظام بشكل جيد للغاية مع أول كتابين للقواعد. لقد استطاع قراءة الرسالة، والاطلاع على كتاب القواعد المحدد المقدم في ذلك اليوم، وإيجاد الأسرار بدقة.
  • التحدي: واجه النظام صعوبة أكبر قليلاً مع كتاب قواعد "PlayStore". يوضح المؤلفون أن هذا لأن هذا الكتاب يستخدم فئات واسعة جداً (مثل "البيانات المالية") والتي يصعب تحديدها بكلمة معينة في الرسالة مقارنة بالأشياء الملموسة مثل "رقم الهاتف".
  • خطوة "المحرر": من المثير للاهتمام أن خطوة "المحرر" النهائية لم تجعل الأمور أفضل دائماً. فأحياناً كانت تصلح الأخطاء، وأحياناً أخرى كانت تتسبب في أخطاء جديدة. يشير المؤلفون إلى أن هذا قد يكون لأن المحرر كان يستخدم نفس "العقل" الذي يستخدمه الكاتب، لذا ارتكب نفس أنواع الأخطاء.

الخلاصة

تثبت هذه الورقة أنك لست بحاجة لإعادة تدريب آلة في كل مرة تتغير فيها قواعد الخصوصية. بدلاً من ذلك، يمكنك استخدام ذكاء اصطناعي مرن يقرأ القواعد أثناء التشغيل.

  • للمفتشين: يمكنك تبديل كتب القواعد فوراً دون إعادة بناء أدواتك.
  • لنقص البيانات: يمكنك توليد بيانات تدريبية خاصة بك (رسائل مزيفة) لاختبار أدواتك، دون الحاجة لسرقة بيانات حقيقية للناس.

يخلص المؤلفون إلى أنه على الرغم من أن هذا ليس بديلاً مثالياً للكواشف خفيفة الوزن والسريعة بعد، إلا أنه أداة قوية لإنشاء بيانات تدريب عالية الجودة وتدقيق الأنظمة مع تطور قوانين الخصوصية. ويقترحون أن المسار الأفضل للمستقبل هو استخدام هذا الذكاء الاصطناعي المرن لإنشاء البيانات، ثم تعليم آلات أصغر وأسرع كيفية القيام بالمهمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →