← أحدث الأبحاث
💻 computer science

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

تقدم هذه الورقة FlashRT، وهو إطار عمل مبتكر يعزز بشكل كبير كفاءة الحوسبة والذاكرة لعمليات الاختبار الأحمر القائمة على التحسين للنماذج اللغوية الكبيرة ذات السياق الطويل، مما يتيح تقييمات أمنية أسرع وأكثر سهولة ضد هجمات حقن الأوامر وفساد المعرفة.

المؤلفون الأصليون: Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة فائق الذكاء (نموذج لغوي كبير، أو LLM) قد قرأ ملايين الكتب ويمكنه الإجابة على أي سؤال بناءً على مكتبة ضخمة من المستندات التي يحملها حالياً. هذه هي قدرة "السياق الطويل" (long-context) التي تجعل الذكاء الاصطناي الحديث قوياً للغاية.

ومع ذلك، هناك مشكلة: يمكن لمحتال ذكي (مهاجم) أن يمرر ملاحظة صغيرة مخفية داخل تلك الكومة الضخمة من المستندات. وإذا لم يكن أمين المكتبة حذراً، فقد يتجاهل السؤال الأصلي ويتبع ملاحظة المحتال بدلاً من ذلك، مما يؤدي إلى إعطاء إجابة خاطئة أو خطيرة. يُسمى هذا "حقن الأوامر" (Prompt Injection) أو "فساد المعرفة" (Knowledge Corruption).

وللحفاظ على سلامة أمناء المكتبة هؤلاء، يقوم باحثو الأمن بلعب ألعاب "الفريق الأحمر" (Red Team). فهم يحاولون تقمص دور المحتال ليروا مدى سهولة خداع أمين المكتبة. وأفضل طريقة لاختبار ذلك هي استخدام طرق "القائمة على التحسين" (optimization-based)—بمعنى استخدام الكمبيوتر لحساب الملاحظة المخفية "المثالية" لتمريرها.

المشكلة: "حقيبة الظهر الثقيلة"
المشكلة في أفضل طرق الاختبار هذه هي أنها ثقيلة وبطيئة للغاية.

  • الحقيبة (الذاكرة): لكي يتمكن الكمبيوتر من إيجاد الملاحظة المثالية، يتعين عليه حمل "حقيبة ظهر" ضخمة من الحسابات (التدرجات/gradients) لكل كلمة في المكتبة الضخمة. وإذا كانت المكتبة طويلة، تصبح الحقيبة ثقيلة جداً (تستهلك كل ذاكرة الكمبيوتر) مما يؤدي إلى تعطل الكمبيوتر.
  • الماراثون (الوقت): يتعين على الكمبيوتر خوض ماراثون، حيث يفحص آلاف الملاحظات المحتملة واحدة تلو الأخرى. بالنسبة للمكتبات الطويلة، يمكن أن يستغرق هذا العملية ساعات.

بسبب ثقل هذه الاختبارات، غالباً ما لا يستطيع الباحثون اختبار أكثر نماذج الذكاء الاصطناعي قوة وضخامة، أو يضطرون للتخلي عن اختبار المستندات الطويلة تماماً.

الحل: FlashRT (أداة "الوميض")
قام مؤلفو هذه الورقة البحثية ببناء أداة جديدة تسمى FlashRT. تخيل FlashRT كأنها مجموعة من "حيل الكفاءة" التي تسمح للكمبيوتر بالقيام بنفس اختبار الأمن ولكن بحقيبة ظهر أخف بكلاً وتوقيت تشغيل أقصر بكثير.

إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:

1. خدعة "إعادة القراءة الانتقائية" (حل مشكلة الوقت)

عادةً، للتحقق مما إذا كانت ملاحظة مخفية جديدة تعمل، يجب على الكمبيوتر إعادة قراءة كامل كومة المستندات من البداية في كل مرة يحاول فيها ملاحظة جديدة. هذا يشبه إعادة قراءة كتاب مكون من 500 صفحة لمجرد تغيير جملة واحدة في منتصفه.

إصلاح FlashRT:
يدرك FlashRT أن معظم الكتاب لم يتغير. فهو يقول: "دعونا نتذكر النصف الأول من الكتاب ونهاية الكتاب. نحن نحتاج فقط لإعادة قراءة الجزء الأوسط حيث توجد الملاحظة، وربما بضع جمل مهمة بالقرب منها".

  • التشبيه: تخيل أنك تتحقق من وصفة طويلة. إذا غيرت مكوناً واحداً في المنتصف، فلست بحاجة لإعادة قراءة قائمة المكونات بأكملها وتعليمات التقديم النهائية. أنت تحتاج فقط لإعادة حساب الجزء الذي غيرته وبعض الخطوات التي تعتمد عليه.
  • النتيجة: هذا يقلل الوقت اللازم لاختبار الملاحظة بمقدار 2 إلى 7 مرات. الاختبار الذي كان يستغرق ساعة أصبح الآن يستغرق أقل من عشر دقائق.

2. خدعة "الخريطة الجزئية" (حل مشكلة الذاكرة)

لإيجاد الملاحظة المثالية، يحتاج الكمبيوتر عادةً إلى رسم خريطة مفصلة للمكتبة بأكملها ليرى كيف ترتبط كل كلمة بالكلمات الأخرى. بالنسبة لمكتبة ضخمة، تأخذ هذه الخريطة مساحة كبيرة (ذاكرة وحدة معالجة الرسومات/GPU) لدرجة أن الكمبيوتر ينفد منه المكان.

إصلاح FlashRT:
يقول FlashRT: "لا نحتاج إلى خريطة مثالية للمكتبة بأكملها لتخمين الاتجاه. دعونا نلقي نظرة على عينة عشوائية من الرفوف للحصول على فكرة عامة عن الاتجاه".

  • التشبيه: إذا كنت تحاول العثور على كتاب محدد في مكتبة ضخمة، فأنت لست بحاجة لحفظ موقع كل كتاب. تحتاج فقط للتحقق من بعض الممرات العشوائية للحصول على تصور جيد حول الاتجاه الذي يجب أن تبحث فيه. إنها ليست دقيقة بنسبة 100%، لكنها "جيدة بما يكفي" للاستمرار في التحرك في الاتجاه الصحيح دون حمل خريطة للمبنى بأكمله.
  • النتيجة: هذا يقلص الذاكرة المطلوبة بمقدار 2 إلى 4 مرات. الاختبار الذي كان يتطلب 264 جيجابايت من الذاكرة (وهو ما لا تملكه معظم الحواسيب) أصبح الآن يتسع في 65 جيجابايت قياسية.

ماذا وجدوا؟
اختبر الباحثون FlashRT على نماذج وبيانات مختلفة من الذكاء الاصطناعي (مثل فهم الاستيعاب وتلخيص التقارير الطويلة).

  • السرعة: كان أسرع بمقدار 2 إلى 7 مرات.
  • الذاكرة: استخدم ذاكرة أقل بمقدار 2 إلى 4 مرات.
  • الفعالية: كان بنفس جودة (أو حتى أفضل من) الطرق القدية الثقيلة في العث_ ثغرات الأمن.

لماذا هذا مهم؟
قبل FlashRT، لم يكن العديد من الباحثين قادرين على اختبار أمن الذكاء الاصطناعي ذي السياق الطويل لأن حواسيبهم ستتعطل أو أن العملية ستستغرق وقتاً طويلاً جداً. يعمل FlashRT كنسخة "خفيفة الوزن" من اختبار الأمن، مما يسمح للباحثين بالتحقق بشكل منهجي مما إذا كانت مساعدات الذكاء الاصطناعي القوية هذه آمنة للاستخدام في العالم الحقيقي، حتى عندما يقرؤون آلاف الصفحات من النصوص في وقت واحد.

تشير الورقة أيضاً إلى أن هذه الأداة يمكن أن تساعد في اختبار نماذج الذكاء الاصطناعي المصممة لتكون "آمنة" (مثل Meta-SecAlign)، مما يثبت أن حتى النماذج القوية يمكن خداعها إذا كان الهجوم قوياً بما يكفي، والآن يمكننا اختبار ذلك دون الحاجة إلى كمبيوتر خارق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →