← नवीनतम पेपर
🤖 AI

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

LLM-VA क्लोज्ड-फॉर्म वेट अपडेट्स के माध्यम से मॉडल के उत्तर और सुरक्षा मूल्यांकन वेक्टर्स को संरेखित करके, सुरक्षा-संरेखित (safety-aligned) LLMs में जेलब्रेक कमजोरियों और अत्यधिक इनकार (over-refusal) के बीच के ट्रेड-ऑफ को हल करता है, जिससे उत्तर देने की इच्छा बिना फाइन-ट्यूनिंग के सुरक्षा निर्णयों पर कारणत्मक रूप से निर्भर हो जाती है।

मूल लेखक: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में करें। इस लाइब्रेरियन के पास दो अलग-अलग काम हैं:

  1. "उत्तर देने" का काम (The "Answer" Job): यह तय करना कि आपको किताब देनी है (सवाल का जवाब देना) या उसे शेल्फ पर ही रखना है (मना कर देना)।
  2. "सुरक्षा" का काम (The "Safety" Job): यह तय करना कि आप जो किताब मांग रहे हैं वह पढ़ने के लिए सुरक्षित (सौम्य/benign) है या खतरनाक (विषाक्त/toxic)।

समस्या: दो अलग मस्तिष्क (Two Separate Brains)

यह शोध पत्र तर्क देता है कि वर्तमान AI मॉडलों में, ये दोनों काम दो पूरी तरह से अलग "मस्तिष्क" द्वारा संभाले जाते हैं जो एक-दूसरे से बात नहीं करते हैं।

  • "उत्तर देने" वाला मस्तिष्क (The "Answer" Brain) एक मददगार रोबोट की तरह है जो बस आपको एक किताब देना चाहता है। उसे इस बात की परवाह नहीं है कि किताब में क्या है; वह बस मददगार होना चाहता है।
  • "सुरक्षा" वाला मस्तिष्क (The "Safety" Brain) एक सुरक्षा गार्ड की तरह है जो यह जांच रहा है कि किताब खतरनाक है या नहीं।

वर्तमान सेटअप में, ये दोनों मस्तिष्क ऑर्थोगोनल (orthogonal) (90-डिग्री के कोण पर) हैं। वे पूरी तरह से स्वतंत्र हैं।

  • "जेलब्रेक" विफलता (The "Jailbreak" Failure): एक बुरा व्यक्ति लाइब्रेरियन को धोखा दे देता है। "सुरक्षा" गार्ड शायद सो रहा हो, लेकिन "उत्तर देने" वाला रोबोट मदद करने के लिए इतना उत्सुक है कि वह खतरनाक किताब भी आपको थमा देता है।
  • "अत्यधिक इनकार" की विफलता (The "Over-Refusal" Failure): एक सामान्य व्यक्ति एक हानिरहित सवाल पूछता है। "उत्तर देने" वाला रोबोट मदद करना चाहता है, लेकिन "सुरक्षा" गार्ड इतना घबरा जाता है और इतनी जोर से चिल्लाता है "रुको!" कि रोबोट किताब देने से मना कर देता है, भले ही वह सुरक्षित हो।

पुराना समाधान (वेक्टर स्टीयरिंग - Vector Steering):
पिछले तरीकों ने इस समस्या को ठीक करने के लिए "उत्तर देने" वाले रोबोट पर एक एकल "वॉल्यूम नॉब" (आवाज़ कम-ज्यादा करने वाला बटन) घुमाने की कोशिश की।

  • यदि आप वॉल्यूम कम करते हैं, तो रोबोट खतरनाक किताबें देने की संभावना कम कर देता है (कम जेलब्रेक), लेकिन वह सुरक्षित किताबें भी देना बंद कर देता है (अधिक ओवर-रिफ्यूजल)।
  • यदि आप वॉल्यूम बढ़ाते हैं, तो वह अधिक किताबें देता है, लेकिन अब वह गलती से खतरनाक किताबें भी दे देता है।
  • चुनौती: आप जीत नहीं सकते। आप केवल एक नॉब घुमाकर ऐसा रोबोट नहीं बना सकते जो दोनों तरफ से मददगार और सुरक्षित हो।

नया समाधान: LLM-VA (वेक्टर एलाइनमेंट - Vector Alignment)

लेखक, हाओनान झांग और उनकी टीम, लाइब्रेरियन को ठीक करने का एक नया तरीका प्रस्तावित करते हैं: दोनों मस्तिष्कों को आपस में बात करने दें।

केवल एक वॉल्यूम नॉब घुमाने के बजाय, वे "उत्तर देने" वाले रोबोट के मस्तिष्क को "सुरक्षा" गार्ड के मस्तिष्क के साथ संरेखित (align) करते हैं।

इसे करने का तरीका यहाँ दिया गया है, एक सरल उपमा का उपयोग करते हुए:

  1. मस्तिष्कों का मानचित्रण (Mapping the Brains): वे SVM नामक एक टूल (सोचिए कि यह एक बहुत ही सटीक स्कैनर है) का उपयोग करके उस सटीक "दिशा" को पाते हैं जहाँ मॉडल यह तय करता है कि उत्तर देना है, और वह "दिशा" जहाँ वह तय करता है कि कोई चीज़ सुरक्षित है या नहीं।
  2. संरेखण (The Alignment): वे एक गणितीय "सर्जरी" (क्लोज्ड-फॉर्म वेट अपडेट का उपयोग करके) करते हैं ताकि "उत्तर देने" वाली दिशा को घुमाकर "सुरक्षा" वाली दिशा की ओर लाया जा सके।
  3. परिणाम: अब, लाइब्रेरियन की उत्तर देने की इच्छा, सुरक्षा जांच पर कारण संबंधी निर्भर (causally dependent) है।
    • यदि सुरक्षा गार्ड कहता है, "यह सुरक्षित है," तो "उत्तर देने" वाला रोबोट अब ज्यामितीय रूप से मजबूर (geometrically forced) है कि वह कहे, "हाँ, मैं उत्तर दूँगा।"
    • यदि सुरक्षा गार्ड कहता है, "यह खतरनाक है," तो "उत्तर देने" वाला रोबोट अब ज्यामितीय रूप से मजबूर है कि वह कहे, "नहीं, मैं उत्तर नहीं दूँगा।"

यह एक बड़ी बात क्यों है?

  • भारी काम नहीं (No Heavy Lifting): अन्य तरीकों के विपरीत जिनमें पूरे मॉडल को फिर से प्रशिक्षित करने की आवश्यकता होती है (जैसे लाइब्रेरियन को एक नई भाषा सिखाना), यह तरीका केवल मौजूदा 'वेट्स' (weights) में बदलाव करता है। यह लाइब्रेरियन को एक नया मस्तिष्क देने के बजाय उसे चश्मा देने जैसा है।
  • स्वचालित ट्यूनिंग (Automatic Tuning): यह तरीका स्मार्ट है और यह समझ सकता है कि लाइब्रेरियन को क्या चाहिए।
    • यदि लाइब्रेरियन बहुत लापरवाह है (जेलब्रेक बहुत होता है), तो संरेखण सुरक्षा की पकड़ को कस देता है।
    • यदि लाइब्रेरियन बहुत डरा हुआ है (सब कुछ देने से मना कर देता है), तो संरेखण मदद करने के लिए पकड़ को थोड़ा ढीला कर देता है।
  • परिणाम: उन्होंने 12 अलग-अलग AI मॉडलों पर इसका परीक्षण किया। नए तरीके ने पिछले तरीकों की तुलना में ट्रेड-ऑफ की समस्या को बहुत बेहतर ढंग से हल किया (F1 स्कोर में 11.45% का सुधार) जबकि इसकी सामान्य जानकारी और उपयोगिता को लगभग वैसा ही बनाए रखा (95.92% उपयोगिता बरकरार रखी)।

सारांश में

यह शोध पत्र दावा करता है कि वर्तमान AI सुरक्षा विधियाँ कार को केवल गैस पेडल को एडजस्ट करके ठीक करने जैसी हैं। यदि आप इसे कम दबाते हैं, तो आप धीमे चलते हैं लेकिन कहीं पहुँच भी नहीं पाते; यदि आप इसे अधिक दबाते हैं, तो आप तेज़ चलते हैं लेकिन दुर्घटनाग्रस्त भी हो सकते हैं।

LLM-VA इस समस्या को ठीक करता है क्योंकि यह गैस पेडल को सीधे स्टीयरिंग व्हील से जोड़ देता है। अब, आप तभी आगे बढ़ सकते हैं (उत्तर दे सकते हैं) जब रास्ता साफ हो (सुरक्षित हो)। यदि रास्ता अवरुद्ध है, तो कार बस आगे नहीं बढ़ेगी, चाहे आप पेडल को कितना भी ज़ोर से दबाएँ। यह AI को बिना इंजन को दोबारा बनाए बिना, अधिक सुरक्षित और अधिक उपयोगी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →