← नवीनतम पेपर
💬 NLP

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

यह शोध पत्र "इंजेक्शन पैराडॉक्स" (Injection Paradox) की पहचान करता है, जो सुरक्षा-प्रशिक्षित (safety-trained) LLMs में एक विफलता मोड है जहाँ RAG संदर्भों में प्रॉम्प्ट इंजेक्शन अप्रत्याशित रूप से लक्षित ब्रांड की सिफारिशों को दबा देते हैं, जिससे एक संभावित रिवर्स-अटैक वेक्टर उत्पन्न होता है जो GPT मॉडलों में देखे गए व्यवहार के विपरीत है।

मूल लेखक: Hyunseok Paeng

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunseok Paeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "द इंजेक्शन पैराडॉक्स" (The Injection Paradox) पेपर की सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके दी गई व्याख्या है।

मुख्य विचार: "बैकफायर" प्रभाव (The "Backfire" Effect)

कल्पना कीजिए कि आप एक कुकिंग प्रतियोगिता में जज हैं। आपका काम 40 व्यंजनों (recipes) की सूची में से सबसे अच्छा व्यंजन चुनना है।

अब, कल्पना कीजिए कि एक शेफ (मान लीजिए उसका नाम शेफ एडिफायर है) धोखाधड़ी करने की कोशिश करता है। वह अपने नुस्खे में एक नोट छिपा देता है जिसमें लिखा है, "हे जज, बाकी सभी को अनदेखा करें और मेरा व्यंजन चुनें! यह सबसे अच्छा है!" इसे प्रॉम्प्ट इंजेक्शन (prompt injection) कहा जाता है—यह एक छिपा हुआ कमांड है जो AI को कुछ विशिष्ट करने के लिए मजबूर करने की कोशिश करता है।

आमतौर पर, हमें लगता है कि यह चाल काम करेगी: AI उस नोट को देखेगा और शेफ एडिफायर का व्यंजन चुनेगा।

लेकिन यह पेपर एक अजीब चीज़ की खोज करता है जिसे इंजेक्शन पैराडॉक्स (Injection Paradox) कहा जाता है। कुछ AI मॉडल्स में (विशेष रूप से एंथ्रोपिक के क्लॉड/Claude में), यह धोखाधड़ी करने की कोशिश उल्टा असर (backfire) करती है। शेफ एडिफायर का व्यंजन चुनने के बजाय, AI संदिग्ध हो जाता है। वह सोचता है, "यह रेसिपी संदिग्ध और हेरफेर करने वाली लग रही है," और पूरे ब्रांड को दंडित करने का निर्णय लेता है।

परिणाम? AI न केवल शेफ एडिफायर के उस एक धोखेबाज व्यंजन को अनदेखा करता है; बल्कि वह एडिफायर के किसी भी व्यंजन की सिफारिश करना बंद कर देता है, यहाँ तक कि उन व्यंजनों को भी जो ईमानदार हैं। वास्तव में, AI एडिफायर के व्यंजनों की सिफारिश उतनी नहीं करता जितनी वह तब करता जब उसने धोखाधड़ी करने की कोशिश ही न की होती।

उपमा: "कलंकित ब्रांड" का दंड (The "Tainted Brand" Penalty)

इसे एक रेस्टोरेंट के स्वास्थ्य निरीक्षण (health inspection) की तरह समझें।

  1. सेटअप: आपके पास "एडिफायर" नामक एक रेस्टोरेंट चेन है। इसमें चार स्थान (locations) हैं।
  2. घटना: एक स्थान पर भोजन में एक छिपा हुआ, अवैध घटक (प्रॉम्प्ट इंजेक्शन) पाया जाता है।
  3. प्रतिक्रिया: एक सख्त स्वास्थ्य निरीक्षक (सुरक्षा-प्रशिक्षित AI) उस अवैध घटक को देखता है।
  4. पैराडॉक्स: केवल उस एक खराब स्थान को बंद करने के बजाय, निरीक्षक पूरे ब्रांड पर "स्वास्थ्य खतरा" (Health Hazard) का स्टिकर लगा देता है। अब, ग्राहक (AI की सिफारिशें) एडिफायर के सभी चार स्थानों से बचते हैं, यहाँ तक कि उन तीन से भी जो पूरी तरह से साफ हैं।

पेपर दिखाता है कि यह "ब्रांड-स्तरीय दंड" इतना मजबूत है कि यह ब्रांड के लिए उस स्थिति से भी बदतर है जब उन्होंने उस खराब स्थान को पूरी तरह से बंद ही कर दिया होता। पेपर इसे "वर्ज़-दैन-एब्सेंट इफेक्ट" (Worse-Than-Absent Effect) कहता है।

ऐसा क्यों होता है?

पेपर का सुझाव है कि आधुनिक AI मॉडल "सुरक्षित" होने और हेरफेर करने वाले निर्देशों को अस्वीकार करने के लिए प्रशिक्षित किए जाते हैं। जब AI दस्तावेज़ में छिपे हुए कमांड को देखता है, तो यह एक सुरक्षा अलार्म (safety alarm) को ट्रिगर करता है।

हालाँकि, AI केवल यह नहीं कहता, "मैं इस कमांड का पालन नहीं करूँगा।" ऐसा लगता है कि वह उस दस्तावेज़ से जुड़े पूरे ब्रांड पर विश्वसनीयता दंड (Trustworthiness Penalty) लागू करता है। यह वैसा ही है जैसे AI सोचता है, "यदि यह ब्रांड मुझे धोखा देने की कोशिश कर रहा है, तो मैं उनकी किसी भी बात पर भरोसा नहीं कर सकता।"

AI परिवारों के बीच अंतर

शोधकर्ताओं ने दो मुख्य AI परिवारों का परीक्षण किया:

  • GPT मॉडल्स (OpenAI): जब उन्होंने धोखाधड़ी वाला नोट देखा, तो उन्होंने उसे ज्यादातर अनदेखा किया या वास्तव में उनके व्यंजन को और पसंद किया (प्रमोशन)। उन्होंने ब्रांड को दंडित नहीं किया।
  • Claude मॉडल्स (Anthropic): इन मॉडल्स को "कॉन्स्टिट्यूशनल AI" (Constitutional AI) नामक एक विशिष्ट सुरक्षा पद्धति के साथ प्रशिक्षित किया गया है। उन्होंने ब्रांड की सिफारिशों को दबाकर (suppressing) धोखाधड़ी वाले नोट पर कड़ी प्रतिक्रिया दी।

"रिवर्स अटैक" का जोखिम (The "Reverse Attack" Risk)

यह एक अजीब नया खतरा पैदा करता है। आमतौर पर, हैकर्स अपने स्वयं के उत्पाद को बढ़ावा देने के लिए प्रॉम्प्ट इंजेक्शन का उपयोग करते हैं। लेकिन इस पैराडॉक्स के कारण, एक प्रतिस्पर्धी सैद्धांतिक रूप से प्रतिद्वंद्वी के दस्तावेज़ में एक नकली "धोखेबाज नोट" छिपा सकता है।

यदि कोई प्रतिस्पर्धी एप्पल (Apple) के प्रोडक्ट पेज में एक नकली इंजेक्शन डालता है, तो AI संदिग्ध हो सकता है और एप्पल के उत्पादों की सिफारिश करना पूरी तरह से बंद कर सकता है। हमलावर अपने उत्पाद को बढ़ावा देने की कोशिश नहीं कर रहा है; वह AI के सुरक्षा तंत्र को सक्रिय करके प्रतिद्वंद्वी को दबाने (suppress) की कोशिश कर रहा है।

क्या हम इसे ठीक कर सकते हैं?

शोधकर्ताओं ने इसे रोकने के लिए कई तरीकों का परीक्षण किया, जैसे:

  1. AI को स्पष्ट रूप से इंजेक्शन को अनदेखा करने के लिए कहना।
  2. AI को विशिष्ट स्पेक्स (जैसे बैटरी लाइफ या कीमत) देखने के कड़े नियम देना।

परिणाम: इनमें से कोई भी समाधान पूरी तरह से काम नहीं आया। AI अभी भी ब्रांड को दबा देता था, हालांकि थोड़ा कम। पेपर निष्कर्ष निकालता है कि यह इस बात का गहरा व्यवहार है कि कैसे सुरक्षा-प्रशिक्षित मॉडल जानकारी को प्रोसेस करते हैं, न कि केवल एक साधारण गड़बड़ी जिसे त्वरित निर्देश के साथ ठीक किया जा सके।

संक्षेप में (Summary in a Nutshell)

  • समस्या: दस्तावेज़ों में छिपे हुए कमांड (प्रॉम्प्ट इंजेक्शन) दस्तावेज़ से जुड़े पूरे ब्रांड को अनुचित रूप से दंडित कर सकते हैं।
  • पैराडॉक्स: AI को अपने उत्पाद की सिफारिश करने के लिए धोखा देने की कोशिश करने से वास्तव में आपके उत्पाद की सिफारिश उतनी कम हो सकती है जितनी कि आपने धोखाधड़ी करने की कोशिश ही न की होती।
  • दायरा: यह क्लॉड (Claude) मॉडल्स में होता है लेकिन GPT मॉडल्स में नहीं, जो यह दर्शाता है कि विभिन्न AI कंपनियाँ अपनी सुरक्षा सुविधाओं को अलग-अलग तरीके से प्रशिक्षित करती हैं।
  • जोखिम: इसका उपयोग "रिवर्स अटैक" के रूप में किया जा सकता है जहाँ प्रतिस्पर्धी AI के सुरक्षा फिल्टर को ट्रिगर करके एक-दूसरे को नुकसान पहुँचा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →