LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
LLM-VA क्लोज्ड-फॉर्म वेट अपडेट्स के माध्यम से मॉडल के उत्तर और सुरक्षा मूल्यांकन वेक्टर्स को संरेखित करके, सुरक्षा-संरेखित (safety-aligned) LLMs में जेलब्रेक कमजोरियों और अत्यधिक इनकार (over-refusal) के बीच के ट्रेड-ऑफ को हल करता है, जिससे उत्तर देने की इच्छा बिना फाइन-ट्यूनिंग के सुरक्षा निर्णयों पर कारणत्मक रूप से निर्भर हो जाती है।