The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning
यह शोध पत्र पहला व्यापक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि विभिन्न भाषाओं में गैर-प्रतिकूल (non-adversarial) डेटा के साथ बड़े भाषा मॉडलों का सौम्य फाइन-ट्यूनिंग (benign fine-tuning), विषम और विच्छेदित (decoupled) सुरक्षा विचलन का कारण बनता है, जो अक्सर काफी बढ़ी हुई प्रतिकूल अनुपालन दरों की ओर ले जाता है जिन्हें केवल अंग्रेजी-केंद्रित मूल्यांकनों द्वारा नहीं पकड़ा जा सकता है।