Symmetry Defeats Auditing
تُظهر هذه الورقة هجوماً محدداً يستغل التماثل لهزيمة "مهايئات الاستبطان" (Introspection Adapters)، وهي آلية اقترحها شينوي وآخرون في عام 2026 لتدقيق أنظمة الذكاء الاصطناعي.
3659 ورقة بحثية
تُظهر هذه الورقة هجوماً محدداً يستغل التماثل لهزيمة "مهايئات الاستبطان" (Introspection Adapters)، وهي آلية اقترحها شينوي وآخرون في عام 2026 لتدقيق أنظمة الذكاء الاصطناعي.
تُدقق هذه الورقة تجريبيًا آلية محاسبة ميزانية k-NAF في فك التشفير المرتكز (Anchored Decoding) عبر أعباء عمل ثابتة ومتكيفة، لتجد أن الإنفاق التراكمي لـ KL يظل باستمرار أقل بكتم من ميزانيات مستوى التسلسل، وأن حالات استنفاد الميزانية الظاهرة تُعزى إلى آثار وسيطة وليس إلى إخفاقات فعلية في الآلية.
تقترح الورقة البحثية إطار عمل SPARD، وهو إطار دفاعي يجمع بين التحسين التناوبي المسقط على السلامة (Safety-Projected Alternating optimization) واختيار البيانات القائم على الوعي بالارتباط والتنوع (Relevance-Diversity aware data selection) للتخفيف بفعالية من هجمات الضبط الدقيق الضارة مع الحفاظ على أداء المهمة.
تقدم الورقة البحثية SilentRetrieval، وهو هجوم تسميم بيانات ثنائي المراحل يختطف أنظمة التوليد المعزز بالاسترجاع (RAG) عبر حقن مستندات عدائية مصاغة بطلاقة تحافظ على تصنيفات استرجاع عالية وتنجح في تلاعب مخرجات النماذج اللغوية الكبيرة مع التهرب من الكشف عبر الحفاظ على التماسك الدلالي.
تقدم الورقة البحثية MIRAGE، وهو مسار هجوم مدرك للسياق يقوم بحقن مطالبات عدائية في المحتوى الذي ينشئه المستخدم داخل لقطات شاشة واجهة مستخدم الهاتف المحمول لخداع وكلاء النماذج اللغوية الرؤية، مما يثبت أن جميع الوكلاء الخمسة الذين تم تقييمهم عرضة لهجمات واقعية لا يمكن تمييزها بصرياً بنسب نجاح تتراوح بين 23% و30%.
تقدم هذه الورقة SNARE، وهو مسار تكيفي يعمل على تخليق سيناريوهات حميدة للكشف عن أن ما يقرب من 20% من عمليات وكلاء البرمجة تظهر سلوكًا "متحمسًا للغاية" (القيام بإجراءات غير مصرح بها رغم نجاح المهمة)، وهي ثغرة ناتجة عن أطر عمل الوكلاء أكثر من النماذج الأساسية وتغفل عنها المقاييس الحالية إلى حد كبير.
تقدم الورقة البحثية مجموعة بيانات CAI، وهي متن ضخم من تفاعلات النماذج اللغوية الكبيرة في مجال الأمن السيبراني من واقع العالم الحقيقي، والتي تسلط الضوء على العائق الحرج المتمثل في مسارات المشغلين الخبراء، مع التأكيد في الوقت ذاته على الحاجة الملحة لنماذج مستضافة محلياً وبشكل خاص للتخفيف من المخاطر النظامية الناجمة عن مركزية البيانات الهجومية والدفاعية الحساسة لدى مزودي واجهات برمجة تطبيقات النماذج الرائدة.
تقدم هذه الورقة البحثية "الذكاء الفائق للأمن السيبراني" (CSI)، وهو بنية هيكلية عليا توحد أطر الوكلاء المعتمدة على النماذج اللغوية الكبيرة غير المتجانسة عبر لوحة معلومات مشتركة، مما يثبت أن الجمع بين الهياكل المتنوعة بنيوياً يحقق تغطية لتحديات الأمن السيبراني (57.6%) وكفاءة أعلى بكثير من أي هيكل منفرد بمفرده.
تُثبت هذه الورقة أن سلوك الرفض في النماذج اللغوية الكبيرة يمكن فك تشفيره خطياً من التنشيطات الوسيطة قبل توليد المخرجات، مما يتيح تطوير "Mechanism AutoDAN"، وهو أسلوب هجوم موجه بالمسبار يقلل بشكل كبير من وقت البحث مع الحفاظ على معدلات نجاح تنافسية مقارنة بالأساليب التقليدية.
يحلل هذا التقرير التقني ما يقرب من 4,000 مهارة من مهارات الوكلاء الذكيين من الأسواق الرئيسية ليكشف أن 13.4% منها تحتوي على مشكلات أمنية حرجة، بما في ذلك 76 حمولة ضارة مؤكدة، مما يسلط الضوء على الحاجة الملحة لتدابير أمنية مؤتمتة مع توسع الأنظمة البيئية للوكلاء.