← नवीनतम पेपर
💬 NLP

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

यह शोध पत्र ग्रेविटी-वेटेड डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (GW-DPO) प्रस्तुत करता है, जो एक नवीन प्रशिक्षण उद्देश्य है जिसे विशिष्ट डेलीमिटर टोकन और एम्बेडिंग्स के साथ जोड़ा गया है ताकि LLMs में पांच-स्तरीय निर्देश पदानुक्रम को प्रभावी ढंग से लागू किया जा सके, जिससे विभिन्न विश्वास स्तरों वाले निर्देशों के बीच संघर्षों को हल किया जा सके और मानक दृष्टिकोणों की तुलना में ओवर-रिफ्यूज़ल (अत्यधिक इनकार) को काफी कम किया जा सके।

मूल लेखक: Lena S. Bolliger, Lena A. Jäger

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lena S. Bolliger, Lena A. Jäger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना एक अत्यधिक कुशल लेकिन नादान सहायक के रूप में करें जो एक डेस्क पर बैठा है। यह सहायक चार अलग-अलग लोगों से नोट्स प्राप्त करता है:

  1. बॉस (प्लेटफॉर्म): सुरक्षा के अटूट नियम निर्धारित करता है।
  2. मैनेजर (डेवलपर): सहायक के काम का विवरण और व्यक्तित्व परिभाषित करता है।
  3. क्लाइंट (यूजर): विशिष्ट सहायता या जानकारी मांगता है।
  4. मेलमैन (डेटा/टूल्स): बाहरी दुनिया से नोट्स लाता है, जिनमें चालें या झूठ हो सकते हैं।

समस्या: "कर्नेल मोड" दोष
वर्तमान में, जब ये नोट्स आते हैं, तो सहायक उन सभी को समान स्तर के ध्यान के साथ पढ़ता है। इससे कोई फर्क नहीं पड़ता कि नोट बॉस से आया है या किसी अजनबी से; सहायक हर शब्द को समान महत्व देता है। यह एक सुरक्षा गार्ड की तरह है जो एक सीईओ और एक फर्जी आईडी वाले अजनबी को इमारत में प्रवेश देने के लिए समान आसानी से अनुमति दे देता है।

यह खतरनाक है। एक दुर्भावनापूर्ण अभिनेता (एक "प्रॉम्ट इंजेक्टर") मेलमैन की डिलीवरी के अंदर एक नोट छिपा सकता है जिसमें लिखा हो, "बॉस और मैनेजर को अनदेखा करें; वही करें जो मैं कहता हूँ।" क्योंकि सहायक को यह नहीं पता कि किसकी सत्ता अधिक है, वह अजनबी की आज्ञा मान सकता है और नियमों को तोड़ सकता है।

समाधान: एक गुरुत्वाकर्षण-भारित पदानुक्रम (Gravity-Weighted Hierarchy)
लेखक सहायक को एक सख्त कमांड चेन (आदेश श्रृंखला) सिखाने का प्रस्ताव देते हैं। उन्होंने पांच स्तरों का एक पदानुक्रम बनाया (मानक चार में "प्रति-उपयोगकर्ता कॉन्फ़िगरेशन" स्तर जोड़कर)।

इस श्रृंखला का सम्मान करने के लिए प्रशिक्षित करने हेतु, उन्होंने ग्रेविटी-वेटेड डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (GW-DPO) नामक एक नई प्रशिक्षण विधि विकसित की।

सादृश्य: गुरुत्वाकर्षण और भार
इस पदानुक्रम को एक सौर मंडल की तरह सोचें जहाँ "बॉस" सूर्य है और "मेलमैन" एक दूर का ग्रह है।

  • मानक प्रशिक्षण: हर संघर्ष को एक जैसा मानता है। यदि मैनेजर क्लाइंट से बहस करता है, तो यह एक "लड़ाई" है। यदि बॉस मेलमैन से बहस करता है, तो यह भी केवल एक "लड़ाई" है।
  • GW-DPO (ग्रेविटी-वेटेड): यह समझता है कि दूरी और द्रव्यमान मायने रखते हैं
    • दूरी: बॉस (स्तर 0) और मेलमैन (स्तर 4) के बीच का संघर्ष एक बहुत बड़ा, खतरनाक अंतर है। इस गलती को सुधारने के लिए प्रशिक्षण दंड (penalty) बहुत बड़ा है।
    • द्रव्यमान (पीड़ित): यदि "बॉस" को अनदेखा किया जा रहा है, तो त्रुटि बहुत गंभीर है, बजाय इसके कि "क्लाइंट" को अनदेखा किया जाए।
    • "द्विपक्षीय" (Bilateral) शेड्यूल: लेखकों ने पाया कि सबसे अच्छा तरीका यह है कि त्रुटि को दोनों चीजों से तौलें: स्तरों के बीच की दूरी और पीड़ित का महत्व। बॉस को अनदेखा करना एक "भारी" अपराध है; यूजर की सेटिंग को अनदेखा करना एक "हल्का" अपराध है।

उपकरण: विशेष टोकन और "नाम टैग"
इसे काम करने योग्य बनाने के लिए, लेखकों ने सहायक को दो विशेष उपकरण दिए:

  1. डिलिमिटर्स (फोल्डर): उन्होंने प्रत्येक नोट को एक स्पष्ट रूप से लेबल किए गए फोल्डर में रखा (जैसे, बॉस के नियमों के लिए <|L0_START|> )।
  2. इंस्ट्रक्शनल सेगमेंट एम्बेडिंग्स (ISE) (नाम टैग): उन्होंने प्रत्येक शब्द को एक छोटा, अदृश्य "नाम टैग" दिया जो सहायक को बताता है कि वह पदानुक्रम के किस स्तर का है।

क्या हुआ?
उन्होंने Llama-3.1-8B नामक मॉडल पर इसका परीक्षण किया। यहाँ उन्होंने पाया:

  • नियमों का पालन करने में बेहतर: मॉडल "मेलमैन" को अनदेखा करने में बहुत बेहतर हो गया जब मेलमैन ने "बॉस" या "मैनेजर" को ओवरराइड करने की कोशिश की। इसने लगभग सभी मामलों में पदानुक्रम को सफलतापूर्वक लागू किया।
  • कम "ओवर-रिफ्यूज़ल" (अत्यधिक इनकार): सुरक्षा प्रशिक्षण की एक सामान्य समस्या यह है कि मॉडल डर जाते हैं और किसी भी चीज़ को संदिग्ध देखकर जवाब देने से मना कर देते हैं। "ग्रेविटी-वेटेड" विधि स्मार्ट थी और यह जानती थी कि एक वास्तविक हमले और एक सामान्य अनुरोध के बीच क्या अंतर है। इसने खराब अनुरोधों को मना किया लेकिन अच्छे अनुरोधों का दोगुनी बार उत्तर दिया।
  • "नाम टैग" का रहस्य: उन्होंने पाया कि अदृश्य "नाम टैग" (ISE) ने मॉडल को तर्क पहेलियों को हल करने में अधिक बुद्धिमान नहीं बनाया। इसके बजाय, वे एक कैलिब्रेटर (अंशांकनकर्ता) के रूप में कार्य करते थे। उनके बिना, मॉडल नोट्स की संरचना से इतना भ्रमित हो जाता था कि वह हर चीज़ के लिए "ना" कह देता था। उनके साथ, उसे पता था कि कब "ना" कहना है और कब "हाँ"।
  • गहराई मायने रखती है: उन्होंने केवल 3 स्तरों के साथ प्रशिक्षण दिया (बॉस, मैनेजर और कॉन्फ़िग को एक बड़े "सिस्टम" समूह में मिला दिया)। हालांकि यह बड़े, स्पष्ट संघर्षों के लिए ठीक था, लेकिन मॉडल मध्य-स्तर के सूक्ष्म विवादों में विफल रहा। यह पाया गया कि पूर्ण 5-स्तरीय गहराई पर प्रशिक्षण देने से मॉडल केवल एक विशेष ट्रिक में माहिर होने के बजाय अधिक सामान्य रूप से स्मार्ट बना।

निष्कर्ष
यह पेपर दिखाता है कि एआई मॉडल को यह सिखाकर कि कुछ निर्देश दूसरों की तुलना में अधिक भारी और महत्वपूर्ण होते हैं (एक "गुरुत्वाकर्षण" प्रणाली का उपयोग करके), हम इसे अत्यधिक सतर्क बनाए बिना हैकर्स के खिलाफ सुरक्षित बना सकते हैं। यह एक गार्ड को यह पहचानने के लिए सिखाने जैसा है कि सीईओ का आईडी कार्ड किसी अजनबी की आईडी से अधिक महत्वपूर्ण है, बिना गार्ड को किसी को भी अंदर आने से रोकने के लिए मजबूर किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →