Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment
यह शोध पत्र प्रदर्शित करता है कि बाइट-पेयर एनकोडिंग (BPE) टोकनाइजेशन महत्वपूर्ण शब्दों को उप-शब्द टुकड़ों में विभाजित करके एलएलएम (LLM) सुरक्षा संरेखण (safety alignment) में शोषण योग्य अंतराल पैदा करता है, जो एक ऐसी भेद्यता है जो कई मॉडल परिवारों में इनकार तंत्र (refusal mechanisms) को दरकिनार कर देती है और जिसे वैश्विक प्रदर्शन पतन (global performance collapse) का कारण बने बिना वर्तमान संरेखण डेटासेट या मानक प्रशिक्षण विन्यासों द्वारा मजबूती से ठीक नहीं किया जा सकता है।