Capability-Based Scaling Trends for LLM-Based Red-Teaming
تستقصي هذه الورقة تحدي "من الضعيف إلى القوي" في عمليات اختبار الاختراق لنماذج اللغات الكبيرة (LLM) من خلال إثبات أن معدلات نجاح الهجوم تنخفض بشكل حاد عندما تتجاوز قدرة النموذج المستهدف قدرة المهاجم، مما يؤدي إلى اقتراح "منحنى توسع كسر الحماية" للتنبؤ بالهشاشة بناءً على فجوة القدرات.