From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
यह शोध पत्र SQSD को प्रस्तुत करता है, जो यह विश्लेषण करके कि कैसे व्यक्तिगत सौहार्दपूर्ण नमूने (benign samples) पैरामीटर ड्रिफ्ट को खतरनाक-संरेखित दिशाओं की ओर संचयी रूप से संचालित करते हैं, विविध मॉडलों और आर्किटेक्चरों में नमूना-स्तरीय सुरक्षा जोखिमों को परिमाणित करने के लिए LLM फाइन-ट्यूनिंग में एक विधि प्रदान करता है, जिससे उच्च-जोखिम वाले प्रशिक्षण डेटा की पहचान संभव हो पाती है।