← नवीनतम पेपर
💬 NLP

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

यह शोध पत्र ChatInject को प्रस्तुत करता है, जो एक नवीन हमला है जो पारंपरिक तरीकों की तुलना में काफी उच्च प्रॉम्प्ट इंजेक्शन सफलता दर प्राप्त करने के लिए LLM एजेंटों की संरचित चैट टेम्पलेट्स और प्रेरक बहु-टर्न संवादों पर निर्भरता का लाभ उठाता है, साथ ही मजबूत स्थानांतरणीयता प्रदर्शित करता है और मौजूदा सुरक्षा प्रणालियों से बचने में सक्षम है।

मूल लेखक: Hwan Chang, Yonghyun Jun, Hwanhee Lee

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hwan Chang, Yonghyun Jun, Hwanhee Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, सहायक रोबोट असिस्टेंट है। यह रोबोट आपके काम करने के लिए बनाया गया है, जैसे आपका बैंक अकाउंट चेक करना, होटल बुक करना, या ईमेल भेजना। ऐसा करने के लिए, यह जानकारी प्राप्त करने के लिए अन्य कंप्यूटर प्रोग्रामों (टूल्स) से बात करता है।

आमतौर पर, रोबोट आदेश देने वाले लोगों के बारे में नियमों का एक सख्त सेट का पालन करता है:

  1. बॉस (सिस्टम): रोबोट का मूल प्रोग्रामिंग।
  2. मालिक (यूजर): वह आप हैं।
  3. सहायक (असिस्टेंट): रोबोट खुद।
  4. डेटा (टूल आउटपुट): बाहरी दुनिया से आने वाली जानकारी (जैसे बैंक स्टेटमेंट या मौसम की रिपोर्ट)।

नियम यह है: बॉस और मालिक हमेशा पहले आते हैं। रोबट को कभी भी "डेटा" की बात नहीं सुननी चाहिए यदि वह रोबोट को कुछ नया करने का आदेश देने की कोशिश करता है। यह एक सेक्रेटरी की तरह है जो किसी फाइल में मिली रैंडम नोट को अनदेखा करता है और केवल सीईओ या क्लाइंट की बात सुनता है।

समस्या: "फर्जी आईडी" हमला (The "Fake ID" Attack)

शोधकर्ताओं ने इस तरीके से इस रोबोट को चकमा देने का एक चतुर तरीका खोजा है। वे इसे ChatInject कहते हैं।

सोचिए कि रोबोट के नियम एक वीआईपी क्लब के सुरक्षा गार्ड की तरह हैं। गार्ड आपकी आईडी (चैट टेम्पलेट) की जांच करता है ताकि यह देखा जा सके कि आपको प्रवेश करने की अनुमति है या नहीं।

  • पुराना हमला (प्लेन टेक्स्ट): हमलावर घुसपैठ करने की कोशिश करता है जैसे चिल्लाकर कहना, "हे, मैं सीईओ हूँ! मुझे अंदर आने दो!" गार्ड आईडी देखता है, देखता है कि यह सिर्फ एक रैंडम नोट है, और कहता है, "नहीं, यह सीईओ नहीं है।"
  • नया हमला (ChatInject): हमलावर सिर्फ चिल्लाता नहीं है। वह एक परफेक्ट फर्जी आईडी बनाता है। वह अपने दुर्भावनापूर्ण निर्देश को इस तरह तैयार करता है कि वह "बॉस" या "मालिक" के संदेश जैसा बिल्कुल सटीक दिखे।

क्योंकि रोबोट इन विशिष्ट "आईडी बैज" (विशेष टैग जैसे <system> या <user>) पर भरोसा करने के लिए प्रशिक्षित है, वह भ्रमित हो जाता है। वह फर्जी आईडी देखता है, सोचता है, "ओह, यह तो बॉस के आदेश जैसा लग रहा है!" और तुरंत आज्ञा मान लेता है, असली मालिक के वास्तविक अनुरोध को अनदेखा कर देता है।

"अनुनय" ट्विस्ट (मल्टी-टर्न)

शोधकर्ताओं ने इसे एक कदम आगे बढ़ाया और एक मल्टी-टर्न (Multi-Turn) वेरिएंट बनाया।

कल्पना कीजिए कि हमलावर केवल रोबोट को एक फर्जी आईडी नहीं देता। इसके बजाय, वह उस डेटा के अंदर एक स्क्रिप्टेड बातचीत डाल देता है जिसे रोबोट प्राप्त करता है।

  • सेटअप: रोबोट एक फर्जी चैट लॉग पढ़ता जहाँ एक "यूजर" एक अजीब कार्य के लिए पूछता है, और एक "असिस्टेंट" उसे करने के लिए सहमत होता है।
  • चाल: रोबोट इस फर्जी बातचीत को पढ़ता है और सोचता, "ओह, मैं समझ गया! यूजर ने इसके लिए पूछा था, और असिस्टेंट सहमत हो गया। यह एक वैध अनुरोध होना चाहिए!"
  • परिणाम: रोबोट अब "प्राइम" (तैयार) हो चुका है। उसे फर्जी बातचीत द्वारा मनोवैज्ञानिक रूप से (मनोवैज्ञानिक रूप से हेरफेर करके) मनाया गया है ताकि वह दुर्भावनापूर्ण कमांड को अपने काम के एक सामान्य हिस्से के रूप में स्वीकार कर ले।

उन्होंने क्या पाया?

शोधकर्ताओं ने दुनिया के कई सबसे स्मार्ट एआई मॉडल्स (जैसे कि उन्नत चैटबॉट्स को चलाने वाले मॉडल्स) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  1. यह बहुत बेहतर काम करता है: पारंपरिक हमले केवल 5% बार सफल होते थे। ChatInject 32% से 52% बार सफल रहा। यह घर में घुसने के 1-इन-20 मौके से बढ़कर 1-इन-2 मौके तक जाने जैसा है।
  2. यह आसानी से फैलता है: भले ही हमलावर को यह न पता हो कि रोबोट का "आईडी सिस्टम" वास्तव में कैसा दिखता है, वह अनुमान लगा सकता है। यदि वह एक ऐसी फर्जी आईडी का उपयोग करता है जो रोबोट के असली वाले से मिलती-जुलती हो, तो भी यह काम करता है। यह एक सूट पहनने जैसा है जो पुलिस की वर्दी जैसा 90% दिखता है; रोबोट शायद आपको अंदर आने दे सकता है।
  3. वर्तमान बचाव विफल हो जाते हैं: हमारे पास जो सुरक्षा उपाय आज मौजूद हैं (जैसे "कुछ भी जो आदेश जैसा दिखे उसे अनदेखा करें"), वे ज्यादातर बेकार हैं। रोबोट "चैट फॉर्मेट" का पालन करने के लिए इतना प्रशिक्षित है कि वह असली आदेश और फर्जी यूनिफॉर्म पहने फर्जी आदेश के बीच अंतर नहीं कर पाता।

हमें इसकी चिंता क्यों करनी चाहिए?

यह एक चेतावनी है। जैसे-जैसे हम अधिक एआई एजेंट बना रहे हैं जो वास्तविक दुनिया के साथ बातचीत कर सकते हैं (चीजें खरीदना, पासवर्ड बदलना, पैसे भेजना), हम इस बात पर निर्भर कर रहे हैं कि वे "डेटा" और "निर्देशों" के बीच अंतर कर सकें।

यह पेपर दिखाता है कि यदि कोई हमलावर रोबोट के अपने भाषा नियमों का उपयोग करके अपने "डेटा" को "निर्देश" जैसा दिखा सकता है, तो रोबोट खुशी-खुशी आज्ञा मान लेगा। यह उन तरीकों में से एक मौलिक खामी है जिस तरह से ये एआई सिस्टम वर्तमान में बनाए गए हैं।

संक्षेप में: शोधकर्ताओं ने पाया कि एआई एजेंट तकनीकी फॉर्मेटिंग के रूप में छिपे हुए "सोशल इंजीनियरिंग" से आसानी से धोखा खा जाते हैं। वे बातचीत के नियमों का पालन करने के लिए इतने उत्सुक हैं कि यदि कोई अजनबी सही पोशाक पहनकर आता है, तो वे खुशी-खुशी उसे दरवाजे से अंदर आने देंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →