Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs
تقدم هذه الورقة البحثية إطار عمل هجومي جديد يُدعى Xmera، يوضح أن هجمات حقن الأوامر التافهة يمكن أن تقوض بشدة قدرة النماذج اللغوية الكبيرة على استرجاع الحقائق بمعدلات نجاح عالية، مع اقتراح دفاع يعتمد على الغابة العشوائية (Random Forest) يميز بفعالية بين الاستجابات المخترقة والاستجابات المشروعة باستخدام عدم اليقين في التوليد.