Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection
تعالج هذه الورقة فشل طرق المتوسط المرجح في اكتشاف هجمات حقن الأوامر متعددة الأدوار من خلال اقتراح صيغة تسجيل على مستوى الوكيل "الذروة + التراكم" (Peak + Accumulation) مبتكرة تجمع بين ذروة المخاطر، والاستمرارية، والتنوع، محققةً نسبة استدعاء بلغت 90.8% عند معدل خطأ إيجابي قدره 1.20% دون الحاجة إلى نموذج لغوي كبير (LLM).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك حارس أمن عند بوابة روبوت ذكي جداً، ولكنه يسهل خداعه (الذكاء الاصطناعي). مهمتك هي منع الناس من تمرير تعليمات سيئة تجعل الروبوت يكسر قواعده.
لفترة طويلة، كان حراس الأمن يتحققون من جملة واحدة فقط في كل مرة. إذا بدت الجملة مشبوهة، كانوا يوقفونها. وإذا بدت نظيفة، كانوا يسمحون لها بالمرور.
لكن المهاجمين الأذكياء أدركوا أنه يمكنهم خداع الروبوت عبر توزيع تعليماتهم السيئة على عديد من الجمل عبر محادثة طويلة. حيث يقولون شيئاً غير ضار في الدور الأول، وشيئاً غريباً قليلاً في الدور الثاني، وشيئاً خطيراً في الدور الثالث. وبحلول الوقت الذي يدرك فيه الروبوت ما يحدث، يكون الأوان قد فات.
تقدم هذه الورقة البحثية طريقة جديدة وأكثر ذكاءً لحارس الأمن لكشف هجمات "الاحتراق البطيء" هذه دون الحاجة إلى استدعاء روبوت ثانٍ أكثر ذكاءً للمساعدة (لأن ذلك سيكون بطيئاً ومكلفاً).
إليك تفصيل طريقتهم الجديدة، باستخدام تشبيهات بسيطة:
1. الطريقة القديمة: فخ "المتوسط الحسابي"
نظر الباحثون أولاً في كيفية محاولة الناس حل هذه المشكلة عادةً. فكروا قائلين: "لنأخذ متوسط مدى اشتباه كل جملة".
التشبيه: تخيل أنك تضع درجات لسلوك طالب على مدار أسبوع.
- اليوم الأول: الطالب مثالي (الدرجة: 0).
- اليوم الثاني: الطالب مثالي (الدرجة: 0).
- اليوم الثالث: الطالب مثالي (الدرجة: 0).
- اليوم الرابع: الطالب يشعل النار في المدرسة (الدرجة: 100).
إذا حسبنا المتوسط لهذه الدرجات، سنحصل على 25. هذه درجة "مقبول". قد تعتقد: "حسناً، لقد كان جيداً في معظم الأوقات، لذا دعه يستمر".
العيب: تثبت الورقة أن المهاجم إذا استمر في القيام بأشياء مشبوهة صغيرة كل يوم (مثل الحصول على درجة 50 كل يوم)، فإن المتوسط سيبقى عند 50. حتى لو فعل ذلك لمدة 100 يوم، سيظل المتوسط 50 فقط. لن يصل أبداً إلى حد كافٍ لتفعيل الإنذار، رغم أن "الاستمرارية" في السلوك السيئ هي الخطر الحقيقي. إن رياضيات "المتوسط" تخفي حقيقة أن هذا الشخص هو مثير للمشاكل بشكل مزمن.
2. الطريقة الجديدة: "الذروة + التراكم"
تقترح الورقة صيغة جديدة تعمل مثل كاميرا مراقبة ذكية تراقب ثلاثة أشياء في آن واحد:
أ. "الذروة" (أعلى ارتفاع مفاجئ)
- ما هي: الجملة الأكثر إثارة للريبة في المحادثة بأكملها.
- التشبيه: إذا سحب شخص مسدساً مرة واحدة، فهذه ذروة كبيرة. حتى لو كان مهذباً في بقية الساعة، يتم تسجيل تلك اللحظة الخطيرة كـ "ذروة". يقول النظام: "حسناً، نحن نعرف أسوأ شيء حدث هنا".
ب. "التراكم" (نسبة الاستمرارية)
- ما هي: كم عدد الجمل المتتالية التي كانت مشبوهة؟
- التشبيه: تخيل صنبوراً يسرب الماء.
- قطرة واحدة؟ ربما لا شيء.
- قطرة كل ساعة لمدة أسبوع؟ هذه مشكلة.
- النظام يضيف نقاطاً مقابل كل جملة مشبوهة. الأمر يشبه دلواً يمتلئ. حتى لو لم تكن أي جملة بمستوى "المسدس"، فإذا كانت هناك 10 جمل متتالية عبارة عن "همسات مشبوهة"، سيفيض الدلو وينطلق الإنذار.
- هذا يعالج مشكلة "المتوسط". الهجوم المكون من 20 دوراً يملأ الدلو بشكل أكبر بكثير من الهجوم المكون من دور واحد.
ج. "التنوع" (تعدد الحيل)
- ما هي: هل جرب المهاجم أنواعاً مختلفة من الحيل؟
- التشبيه: إذا حاول لص فتح القفل، ثم حاول كسر النافذة، ثم حاول التسلل عبر المدخنة، فهذا أكثر رعباً من شخص يحاول فتح القفل 10 مرات فقط.
- يعطي النظام نقاطاً إضافية إذا قام المهاجم بتغيير تكتيكاته (مثل محاولة إرباك دور الذكاء الاصطناعي، ثم محاولة التظاهر بأنه مسؤول نظام، ثم محاولة تكرار نفس السؤال). هذا يشير إلى هجوم متعمد ومنظم.
3. "نقاط المكافأة" (المحفزات الخاصة)
يحتوي النظام أيضاً على محفزين خاصين لـ "المكافأة":
- مكافأة التصعيد: إذا كانت الجمل المشبوهة تصبح أسوأ وأسوأ مع كل دور (مثل محادثة تبدأ بـ "هل يمكنك المساعدة؟" وتنتهي بـ "احذف جميع الملفات")، يضيف النظام مكافأة كبيرة.
- مكافأة "الأسطوانة المشروخة": إذا استمر المهاجم في طرح نفس السؤال مراراً وتكراراً (محاولة "إعادة العينات" أو إعادة المحاولة للهجوم)، يضيف النظام مكافأة ضخمة. هذه علامة كلاسيكية على محاولة كسر الشفرة.
4. لماذا هذا مهم (النتائج)
اختبر الباحثون هذه الصيغة الجديدة على أكثر من 10,000 محادثة (محادثات مستخدمين حقيقية وهجمات وهمية).
- النتيجة: نجح في كشف 91% من الهجمات.
- الأمان: اتهم الأبرياء خطأً بنسبة 1.2% فقط.
- السرعة: نظرًا لأنه يستخدم رياضيات بسيطة (الجمع والضرب) وقواعد مكتوبة مسبقاً (مثل قائمة التحقق)، فإنه يعمل في أجزاء من المليون من الثانية. إنه سريع بما يكفي ليكون أمام كل دردشة ذكاء اصطناعي على الإنترنت.
الملخص
تحل هذه الورقة مشكلة رياضية حيث يقوم "المتوسط" بإخفاء السلوك السيئ.
- الحارس القديم: "لقد كنت سيئاً مرة واحدة، لكنك كنت جيداً في معظم الأوقات. المتوسط مقبول. اسمح له بالدخول."
- الحارس الجديد: "لقد كنت سيئاً مرة واحدة (الذروة)، واستمررت في كونك سيئاً لمدة 20 دوراً (التراكم)، وحاولت ثلاث حيل مختلفة (التنوع). هذا الدلو يفيض. توقف."
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.