Why Do Safety Guardrails Degrade Across Languages?
यह शोध पत्र विभिन्न भाषाओं में लार्ज लैंग्वेज मॉडल्स (LLMs) में सुरक्षा क्षरण (safety degradation) को चलाने वाले विशिष्ट कारकों को अलग करने और उनका विश्लेषण करने के लिए एक मल्टी-ग्रुप आइटम रिस्पांस थ्योरी फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि सुरक्षा विफलताएं मुख्य रूप से एकआयामी हैं, अक्सर कम-संसाधन वाली भाषाओं की तुलना में अंग्रेजी में अधिक गंभीर होती हैं, और केवल अनुवाद की गुणवत्ता के बजाय भौतिक हानि और सांस्कृतिक बेमेल से संबंधित प्रॉम्प्ट-विशिष्ट क्रॉस-लिंगुअल अंतराल से महत्वपूर्ण रूप से प्रभावित होती हैं।