RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
تقدم الورقة البحثية RLSpoofer، وهو إطار عمل للتعلم التعزيزي خفيف الوزن ومن نوع الصندوق الأسود (black-box)، والذي يبرهن على ضعف مخططات العلامات المائية الحالية للنماذج اللغوية الكبيرة (LLMs) من خلال تحقيق معدل نجاح في التزييف بنسبة 62% مع حد أدنى من بيانات التدريب ودون الوصول إلى المعلمات الداخلية للنموذج.