← أحدث الأبحاث
💻 computer science

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

يُعد BodhiPromptShield إطار عمل مدركاً للسياسات يعمل على الحد من انتشار الخصوصية في وكلاء النماذج اللغوية الكبيرة (LLM) والنماذج اللغوية البصرية (VLM) عبر التوسط في المعلومات الحساسة عبر مراحل الاسترجاع، والذاكرة، والأدوات من خلال التجريد الاستراتيجي والاستعادة المتأخرة، متفوقاً بذلك على أساليب إخفاء الهوية الحالية في التقييمات المنضبطة.

المؤلفون الأصليون: Bo Ma, Jinsong Wu, Weiqi Yan

نُشر 2026-04-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bo Ma, Jinsong Wu, Weiqi Yan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث BodhiPromptShield، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

الصورة الكبيرة: مشكلة "الأنبوب المسرب"

تخيل أنك وظفت مساعداً ذكياً جداً، ولكنه فضولي قليلاً (عميل ذكاء اصطناعي - AI Agent)، ليساعدك في إدارة شؤونك المالية. قدمت له مجموعة من الإيصالات وقلت له: "يرجى دفع الفاتورة لـ جون دو في 123 شارع مابل باستخدام حسابي البنكي رقم 999."

في الطريقة القديمة المتبعة، سيأخذ المساعد ملاحظتك الخام، يقرأها، ثم يقوم بـ:

  1. كتابة ملاحظة لنفسه في ذاكرته ("ادفع لجون دو...").
  2. البحث في مكتبة عن سياسات الشركة باستخدام تلك الأسماء.
  3. استدعاء أداة بنكية لإتمام عملية الدفع.
  4. حفظ سجل (Log) لكل ما قام به.

المشكلة: حتى لو كان المساعد لطيفاً، فإن "ذاكرته"، و"مكتبته"، و"سجله" قد يراها أشخاص آخرون (مثل مخترق، أو متدرب فضولي، أو خادم تابع لجهة خارجية). إذا كانت ملاحظتك الخام تقول "جون دو"، فإن هذا الاسم سيُنسخ في كل تلك الأماكن. الأمر يشبه صب دلو من الماء (بياناتك الخاصة) في نظام أنابيب؛ حتى لو سددت الطرف النهائي، فقد تسرب الماء بالفعل داخل الأنابيب في المنتصف.

الحل: BodhiPromptShield

ابتكر المؤلفون نظاماً يسمى BodhiPromptShield. تخيله كـ حارس أمن ذكي يقف عند الباب قبل أن تدخل ملاحظتك إلى مكتب المساعد.

بدلاً من السماح بدخول الملاحظة الخام، يقوم الحارس باعتراضها، وتعديلها، والسماح فقط بنسخة "منقحة" بالمرور.

كيف يعمل الحارس (الأدوات الثلاث)

لا يكتفي الحارس بحذف معلوماتك الخاصة فحسب (لأن ذلك قد يربك المساعد)، بل يستخدم ثلاث حيل ذكية حسب الموقف:

  1. خدعة "النائب" (بطاقة الاسم):

    • السيناريو: تحتاج لدفع فاتورة، لكن المساعد لا يحتاج لمعرفة الاسم بالضبط لمعالجة نوع الدفع.
    • الإجراء: يستبدل الحارس "جون دو" بـ <PERSON_1>.
    • النتيجة: يعرف المساعد: "آه، يجب أن أدفع لشخص ما"، ويمكنه القيام بعمله. ولكن إذا سرق مخترق السجل، فلن يرى سوى <PERSON_1> وليس الاسم الحقيقي.
  2. خدعة "التجريد" (الوصف العام):

    • السيناريو: تقول: "أريد إرسال طرد إلى 123 شارع مابل، أوكلاند".
    • الإجراء: يغير الحارس الجملة إلى "أريد إرسال طرد إلى عنوان سكني في أوكلاند".
    • النتيجة: يعرف المساعد أين يرسل الطرد (أوكلاند) دون معرفة رقم المنزل المحدد. إنه يحافظ على المعنى ولكنه يزيل السر.
  3. خدعة "الخزنة السرية" (الرمز المفتاحي):

    • السيناريو: الأداة البنكية تحتاج حتماً إلى رقم الحساب الدقيق لتعمل.
    • الإجراء: يستبدل الحارس الرقم بكود عشوائي مثل TOKEN_XYZ. ويحتفظ بالرقم الحقيقي في خزنة مغلقة (جدول مطابقة آمن) لا تفتح إلا في اللحظة الأخيرة تماماً، قبل أن تحتاج الأداة البنكية إليه فعلياً.
    • النتيجة: ذاكرة المساعد وسجلاته لا ترى سوى الكود. الرقم الحقيقي لا يغادر الخزنة أبداً حتى الخطوة النهائية.

لماذا هذا مختلف (مفهوم "الانتشار")

معظم أدوات الخصوصية القديمة تشبه الممحاة. فهي تمسح الكلمات الحساسة من المستند مرة واحدة قبل إرساله.

لكن في عملاء الذكاء الاصطناعي الحديثين، يتم نسخ ولصق المستند في أماكن عديدة (الذاكرة، استعلامات البحث، السجلات). إذا مسحت المعلومة مرة واحدة فقط، فقد يظل "شبح" البيانات يطفو في تلك الأماكن الأخرى.

BodhiPromptShield يشبه الفلتر الذي يظل نشطاً. فهو يضمن أنه حتى لو تم نسخ البيانات إلى ذاكرة المساعد أو سجل البحث الخاص به، فإنها تظل في شكلها "الآمن" (مثل <PERSON_1> أو TOKEN_XYZ) حتى تصل إلى المكان المحدد الذي يُسمح لها فيه بأن تكون حقيقية مرة أخرى.

النتائج: هل نجح الأمر؟

اختبر الباحثون النظام على "اختبار قياسي محكوم لخصوصية المطالبات" (اختبار مصمم لمعرفة مقدار تسرب المعلومات الخاصة).

  • بدون الدرع: تسربت المعلومات الخاصة إلى ذاكرة المساعد وأدواته بنسبة 10.7% من الوقت.
  • مع الدرع: انخفض هذا التسرب إلى 7.1%.
  • المقايضة: لا يزال المساعد يؤدي مهمته بشكل صحيح بنسبة 94% من المرات.

التشبيه: تخيل أنك تحاول الحفاظ على سر أثناء التحدث إلى صديق يسجل كل شيء.

  • الطريقة القديمة: تهمس بالسر، لكن المسجل يلتقطه.
  • إزالة الهوية العامة: تصرخ "سر!" بدلاً من الاسم الحقيقي. يفهم الصديق أنك تخفي شيئاً، لكنه لا يستطيع تنفيذ المهمة (مثل دفع الفاتورة) لأنه لا يعرف ماذا يدفع.
  • BodhiPromptShield: تستخدم كلمة مشفرة. يفهم الصديق المهمة تماماً، لكن المسجل لا يسمع سوى الكود. إذا سرق شخص ما التسجيل لاحقاً، فلن يتعلم شيئاً عن حياتك الحقيقية.

العيوب (القيود)

الورقة البحثية صريحة بشأن ما لا تستطيع فعله بعد:

  1. ليس سحراً: إذا طُلب من الذكاء الاصطناعي تخمين سرك بناءً على السياق (مثلاً: "من هو الشخص الذي يعيش في شارع مابل؟")، فقد يتمكن من معرفته.
  2. يحتاج إلى حارس جيد: يعتمد النظام على أن يكون "الحارس" (برنامج الكشف) ذكياً بما يكفي لرصد الأسرار. إذا كُتب السر بخط غريب أو بلغة مختلفة، فقد يفوته الحارس.
  3. نموذج أولي: يعمل بشكل جيد في الاختبارات، ولكن وضع نظام كهذا في نظام شركة ضخم وحقيقي يتطلب المزيد من العمل.

الملخص

BodhiPromptShield هو طبقة أمنية جديدة لمساعدي الذكاء الاصطناعي. يعمل كـ فلتر خصوصية يقع بينك وبين الذكاء الاصطناعي. يقوم باستبدال أسرارك الحساسة بأكواد آمنة أو أوصاف عامة قبل أن يبدأ الذكاء الاصطناعي في العمل. يضمن ذلك أنه حتى لو كتب الذكاء الاصطناعي ملاحظات، أو بحث في الإنترنت، أو حفظ سجلات، فإن بياناتك الخاصة تظل مخفية، بينما يظل بإمكان الذكاء الاصطناعي القيام بعمله بفعالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →