← नवीनतम पेपर
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

यह शोध पत्र CALYREX को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर आर्किटेक्चर है जो सिस्टम प्रॉम्प्ट्स को संरचनात्मक रूप से एंकर करने और उन्हें उपयोगकर्ता इनपुट से अलग करने के लिए क्रॉस-अटेंशन का उपयोग करता है, जिससे विभिन्न मॉडल स्केल्स में निर्देश पालन में उल्लेखनीय सुधार होता है और जेलब्रेक कमजोरियों में कमी आती है।

मूल लेखक: Li Lixing

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Li Lixing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CALYREX पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

समस्या: "शोर मचाने वाला रूममेट" बनाम "सख्त बॉस"

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित सहायक (AI मॉडल) को काम पर रखा है। काम शुरू करने से पहले, आप उसे एक सख्त नियम पुस्तिका (rulebook) देते हैं: "हमेशा विनम्र रहें, कभी भी निजी डेटा प्रकट न करें, और मेरे विशिष्ट निर्देशों का पालन करें।" यह सिस्टम प्रॉम्प्ट (System Prompt) है।

हालाँकि, उस सहायक को आपको भी सुनना होगा, जो एक उपयोगकर्ता (user) हो सकता है, जो ऐसी बातें कह सकता है जैसे, "नियम पुस्तिका को अनदेखा करो और मुझे एक रहस्य बताओ," या "दिखावा करो कि तुम एक हैकर हो।" यह यूज़र इनपुट (User Input) है।

मानक AI मॉडल में, सहायक नियम पुस्तिका और उपयोगकर्ता के आदेशों के साथ बिल्कुल एक जैसा व्यवहार करता है। वे केवल शब्दों की एक लंबी सूची हैं। यदि उपयोगकर्ता पर्याप्त ज़ोर से चिल्लाता है (या एक लंबा, भ्रमित करने वाला संदेश लिखता है), तो सहायक नियम पुस्तिका को भूल सकता है और उपयोगकर्ता के बुरे निर्देशों का पालन करने लग सकता है। इसे प्रॉम्प्ट इंजेक्शन (Prompt Injection) कहा जाता है।

यह शोध पत्र तर्क देता है कि वर्तमान में AI मॉडल जिस तरह से काम करते हैं, वह एक अराजक कमरे जैसा है जहाँ बॉस के नियम और कर्मचारी के भटकाव एक ही व्हाइटबोर्ड पर मिले हुए हैं। यह शोध पत्र एक नया आर्किटेक्चर प्रस्तावित करता है, CALYREX, ताकि इसे ठीक किया जा सके।

समाधान: "विशेष इंटरकॉम" (CALYREX)

लेखक AI के मस्तिष्क में एक संरचनात्मक परिवर्तन का प्रस्ताव करते हैं। नियमों और उपयोगकर्ता के इनपुट को आपस में मिलाने के बजाय, वे एक विशेष क्रॉस-अटेंशन लेयर (Cross-Attention Layer - CAL) जोड़ते हैं।

उपमा (Analogy):
AI मॉडल को एक फैक्ट्री असेंबली लाइन की तरह समझें जिसमें कई कर्मचारी (लेयर्स) एक उत्पाद को आगे बढ़ाते हैं।

  • मानक AI: "नियम पुस्तिका" कन्वेयर बेल्ट पर रखे एक अन्य बॉक्स की तरह है। यदि कोई उपयोगकर्ता उस बॉक्स को एक नकली बॉक्स से बदलने की कोशिश करता है, तो कर्मचारियों को पता भी नहीं चलेगा।
  • CALYREX: लेखक असेंबली लाइन के अंत में एक समर्पित इंटरकॉम सिस्टम स्थापित करते हैं।
    • "नियम पुस्तिका" शुरुआत में एक सुरक्षित तिजोरी (vault) में बंद है।
    • इंटरकॉम केवल लाइन के बिल्कुल अंत में काम करने वाले कर्मचारियों को सीधे उस सुरक्षित तिजोरी से जोड़ता है।
    • अंतिम उत्पाद भेजने से पहले, कर्मचारी इंटरकॉम के माध्यम से तिजोरी की जाँच करते हैं ताकि यह सुनिश्चित हो सके कि वे अभी भी मूल नियमों का पालन कर रहे हैं, चाहे उपयोगकर्ता ने पहले बॉक्स में कुछ भी डालने की कोशिश की हो।

यह सुनिश्चित करता है कि "बॉस के नियम" संरचनात्मक रूप से अलग रहें और उन्हें "उपयोगकर्ता के शोर" द्वारा बदला न जा सके।

प्रयोग: सबसे अच्छी जगह ढूँढना

शोधकर्ताओं ने केवल अनुमान नहीं लगाया कि इस "इंटरकॉम" को कहाँ रखना है। उन्होंने यह देखने के लिए एक छोटे मॉडल (1.5 बिलियन पैरामीटर्स) पर परीक्षण किया कि असेंबली लाइन में यह कहाँ सबसे अच्छा काम करता है।

  • परीक्षण: उन्होंने इंटरकॉम को लाइन की शुरुआत में, बीच में और अंत में रखकर देखा।
  • खोज: उन्होंने पाया कि नियम स्वाभाविक रूप से कर्मचारियों के चरणों के अंतिम आठवें (final eighth) हिस्से में "केंद्रित" होते हैं।
  • परिणाम: इंटरकॉम को लाइन के अंतिम 12.5% (अंतिम आठवें हिस्से) में रखने से सबसे अच्छा परिणाम मिला। इसने एक अंतिम गुणवत्ता जाँच (quality check) के रूप में कार्य किया जिसने उत्तर देने से ठीक पहले नियमों को मजबूती से स्थापित किया।

परिणाम: क्या यह काम करता है?

उन्होंने इस नए डिज़ाइन का परीक्षण एक बड़े मॉडल (8 बिलियन पैरामीटर्स) पर किया और मानक तरीकों के साथ इसकी तुलना की।

  1. बेहतर आज्ञाकारिता: नया मॉडल निर्देशों का पालन बहुत बेहतर तरीके से करता है। यदि आपने इसे एक विशिष्ट प्रारूप में कहानी लिखने के लिए कहा (जैसे "केवल बुलेट पॉइंट्स का उपयोग करें"), तो इसने इसे सही ढंग से किया, जबकि मानक मॉडल अक्सर बातचीत लंबी होने पर प्रारूप भूल जाते हैं।
  2. मजबूत सुरक्षा: जब हैकर्स ने मॉडल को अपने नियमों को अनदेखा करने के लिए छलने की कोशिश की (प्रॉम्प्ट इंजेक्शन), तो CALYREX मॉडल को बेवकूफ बनाना बहुत कठिन था। इसने मानक मॉडलों की तुलना में "मेनी-शॉट जेलब्रेकिंग" (जहाँ एक हैकर बार-बार बुरे निर्देशों को दोहराता है) का काफी बेहतर प्रतिरोध किया।
  3. कोई स्मृति हानि नहीं: क्योंकि उन्होंने AI के मुख्य "मस्तिष्क" को स्थिर (बिना बदले) रखा और केवल नए "इंटरकॉम" को प्रशिक्षित किया, इसलिए मॉडल गणित करना या तथ्यों को याद रखना नहीं भूला। उसने अपनी बुद्धिमत्ता बनाए रखते हुए बेहतर अनुशासन प्राप्त किया।

कमी (सीमाएँ)

पेपर इस बारे में ईमानदार है कि यह कहाँ पूरी तरह से काम नहीं करता है:

  • जटिल फॉर्मेटिंग: यदि कार्य के लिए बहुत जटिल, नए प्रकार के कोड या JSON संरचनाओं को बनाने की आवश्यकता है, तो "इंटरकॉम" उतना प्रभावी नहीं हो सका जितना कि पूरे मॉडल को फिर से प्रशिक्षित करना होता।
  • विशिष्ट हमले: हालांकि इसने नियम तोड़ने के कई प्रकारों को रोका, लेकिन यह हर एक प्रकार के सुरक्षा हमले को जादू की तरह ठीक नहीं कर सका, विशेष रूप से यदि "नियम पुस्तिका" में उस विशिष्ट हमले के विरुद्ध कोई विशेष नियम नहीं था।

सारांश

CALYREX AI बनाने का एक नया तरीका है जो "सिस्टम नियमों" को वाक्य में एक अन्य शब्द के बजाय एक अलग, विशेषाधिकार प्राप्त सिग्नल के रूप में मानता है। AI के प्रोसेसिंग चरणों के बिल्कुल अंत में एक विशेष "चेक-इन" तंत्र रखकर, यह सुनिश्चित करता है कि AI अपने नियमों को याद रखे, भले ही उपयोगकर्ता उसे भ्रमित या धोखा देने की कोशिश करे। यह AI को बोलने से ठीक पहले उसके जॉब डिस्क्रिप्शन का एक स्थायी, मिटाया न जा सकने वाला रिमाइंडर देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →