ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
يُعد ReGA إطار عمل وقائيًا قائمًا على النماذج وقابلًا للتوسع، يستفيد من تمثيلات منخفضة الأبعاد للمواقف الحرجة تتعلق بالسلامة لتجريد ومراقبة النماذج اللغوية الكبيرة بفعالية، محققًا دقة عالية وقابلية للتفسير في اكتشاف المحتوى الضار مع التغلب على قيود القابلية للتوسع التي تفرضها تقنيات التحليل التقليدية.