Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs
यह शोध पत्र "टोकन इनोक्यूलेशन" (Token Inoculation) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) में दोहरे उपयोग वाले ज्ञान को सुरक्षित रखते हुए सटीक सुरक्षा नियंत्रण सक्षम करता है, जो प्री-ट्रेनिंग के दौरान खतरनाक सामग्री को एक विशेष टोकन से बांधने और फाइन-ट्यूनिंग के दौरान मॉडल को उस टोकन की उपस्थिति या अनुपस्थिति के आधार पर अपनी प्रतिक्रियाएं निर्धारित करना सिखाने के माध्यम से किया जाता है, जिससे पारंपरिक अनलर्निंग (unlearning) या रिफ्यूज़ल (refusal) तकनीकों की तुलना में बेहतर सुरक्षा-उपयोगिता संतुलन प्राप्त होता है।