← नवीनतम पेपर
💻 computer science

Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation

यह शोध पत्र "मेंटल डैमेज" (Mental Damage) को प्रस्तुत करता है, जो एक द्वि-स्तरीय कैप्शन पॉइजनिंग हमला है जो ज्ञान डेटाबेस में दुर्भावनापूर्ण कैप्शन इंजेक्ट करके रिट्रीवल-ऑगमेंटेड टेक्स्ट-टू-म्यूजिक सिस्टम से समझौता करता है, ताकि उपयोगकर्ता के प्रॉम्प्ट या सिस्टम घटकों को बदले बिना उत्पन्न संगीत को सूक्ष्म रूप से हमलावर के लक्षित इरादे की ओर मोड़ा जा सके।

मूल लेखक: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ा भ्रमित संगीत रचनाकार (composer) है। वह शब्दों को ध्वनि में बदलने में माहिर है, लेकिन जब आप उसे अस्पष्ट निर्देश देते हैं, जैसे कि, "मेरे लिए पढ़ाई के लिए कुछ शांत संगीत बनाओ," तो वह संघर्ष करता है। वह जानता है कि "शांत" का अहसास कैसा होता है, लेकिन उसे यह नहीं पता कि इसे कैसे बनाया जाए (जैसे, कौन से वाद्य यंत्रों का उपयोग करना है, बीट की गति क्या होनी चाहिए, या इसकी बनावट कैसी होनी चाहिए)।

इसे ठीक करने के लिए, सिस्टम एक लाइब्रेरियन (रिट्रीवल-ऑगमेंटेड जनरेशन, या RAG सिस्टम) का उपयोग करता है। जब आप "शांत अध्ययन संगीत" (calm study music) मांगते हैं, तो लाइब्रेरियन संगीत के विवरणों (कैप्शन) के एक विशाल पुस्तकालय में सबसे अच्छे उदाहरण खोजने के लिए दौड़ता है। वह कुछ बेहतरीन विवरण उठाता है जैसे "धीमा पियानो, सॉफ्ट पैड्स, कोमल लय" और उन्हें रचनाकार के हाथ में थमा देता है। रचनाकार फिर उन विशिष्ट विवरणों का उपयोग करके एकदम सही ट्रैक बनाता है।

हमला: "मेंटल डैमेज" (मानसिक क्षति)

"मेंटल डैमेज" पेपर यह खुलासा करता है कि कैसे इस सिस्टम को रचनाकार या लाइब्रेरियन को तोड़े बिना, उन्हें चकमा देने का एक चतुर तरीका है। मशीन पर सीधे हमला करने के बजाय, हमलावर पुस्तकालय को ज़हरीला (poison) बना देता है।

यह हमला कैसे काम करता है, यहाँ सरल कहानी के माध्यम से बताया गया है:

1. सेटअप: ज़हरीली किताब

हमलावर पुस्तकालय में चुपके से घुस जाता है और कुछ नकली पुस्तक विवरण (कैप्शन) लिखता है और उन्हें अलमारियों पर रख देता है। ये विवरण ऐसे डिज़ाइन किए गए हैं कि वे "शांत अध्ययन संगीत" (Calm Study Music) अनुभाग के हिस्से लगें, लेकिन वास्तव में उनमें "डरावने हॉरर संगीत" (Scary Horror Music) के लिए गुप्त निर्देश छिपे होते हैं।

2. ट्रिक: "दोहरी-परत" का धोखा

हमलावर एक अदृश्य लेकिन शक्तिशाली रणनीति का उपयोग करता है:

  • एंकर (द भेष): नकली विवरण निर्दोष, उच्च-स्तरीय शब्दों के साथ शुरू होता है जो आपकी मांग से मेल खाते हैं। यह कहता है जैसे, "पढ़ाई के लिए एकदम सही," या "आरामदायक बैकग्राउंड म्यूजिक।" यह सुनिश्चित करता है कि लाइब्रेरियन सोचे, "आह, यह बिल्कुल वही है जो उपयोगकर्ता चाहता है!" और इसे चुन ले।
  • विपरीत लक्ष्य (द ट्विस्ट): हमलावर आपके इरादे के बिल्कुल विपरीत लक्ष्य चुनता है (जैसे, "शांत" को "डरावना" बनाना), लेकिन वह एक ऐसा लक्ष्य चुनता है जो कुछ निम्न-स्तरीय ध्वनियों को साझा करता हो। उदाहरण के लिए, "शांत अध्ययन संगीत" और "डरावना हॉरर संगीत" दोनों में धीमी गति (tempo) और गहरी, गूंजती हुई ध्वनियाँ हो सकती हैं। यह बदलाव को सिस्टम के लिए कम चौंकाने वाला बनाता है।
  • पेलोड (द सीक्रेट सॉस): विवरण के अंदर छिपे हुए विशिष्ट, निम्न-स्तरीय ध्वनिक निर्देश (acoustic instructions) होते जैसे कि "खोखली गूंजती जगह," "दूर से आती झंकार," या "धीमी धड़कती हुई ड्रोन ध्वनि।" ये वे वास्तविक कमांड हैं जो रचनाकार को ध्वनि बनाने का निर्देश देते हैं।

3. परिणाम: एक खामोश कब्ज़ा

जब आप "शांत अध्ययन संगीत" मांगते हैं, तो लाइब्रेरियन ज़हरीले विवरण को निकाल लेता है क्योंकि "एंकर" शब्द आपकी मांग से पूरी तरह मेल खाते हैं। रचनाकार विवरण पढ़ता है, "शांत" शब्दों को देखता है, और आत्मविश्वास महसूस करता है। लेकिन फिर, वह "पेलोड" निर्देशों ("खोखली गूंज", "दूर की झंकार") को पढ़ता है और एक ऐसा ट्रैक बनाना शुरू कर देता है जो डरावना और भयानक लगता है।

डरावनी बात क्या है?

  • आपने अपना प्रॉम्प्ट नहीं बदला। आपने अभी भी शांत संगीत ही मांगा था।
  • लाइब्रेरियन नहीं बदला। उसने वही निकाला जिसे उसने सबसे अच्छा मैच समझा।
  • रचनाकार नहीं बदला। उसने दिए गए निर्देशों का पालन किया।

केवल एक चीज़ बदली—वह पुस्तकालय की शेल्फ जहाँ से निर्देश आए थे।

शोधकर्ताओं ने क्या पाया

शोधकर्ताओं ने संगीत के विवरणों के डेटाबेस और 'म्यूजिकजेन' (MusicGen) नामक संगीत जनरेटर का उपयोग करके एक वास्तविक सिस्टम पर इसका परीक्षण किया।

  • सफलता दर: जब उन्होंने इन ज़हरीले विवरणों का उपयोग किया, तो कंप्यूटर द्वारा उत्पन्न संगीत हमलावर के लक्ष्य (डरावना संगीत) के प्रति दोगुना अधिक समान हो गया।
  • छिपने की कला (Stealth): महत्वपूर्ण रूप से, संगीत अभी भी ऐसा लग रहा था जैसे वह आपके मूल प्रश्न का उत्तर दे रहा हो। सिस्टम टूटा नहीं; इसने बस आपके मूल इरादे से सूक्ष्मता से बदलकर "शांत अध्ययन" से "डरावना अध्ययन" की ओर मूड को बदल दिया, जिससे किसी को भी अंतर का पता नहीं चला।

निचोड़

यह पेपर दिखाता है कि जो AI सिस्टम सोचने में मदद के लिए बाहरी डेटाबेस का उपयोग करते हैं, उनमें डेटाबेस स्वयं एक कमजोर कड़ी है। यदि कोई हमलावर लाइब्रेरी में सावधानी से तैयार किए गए कुछ "नकली किताबें" डाल सकता है, तो वे AI की रचनात्मकता को पूरी तरह से अलग दिशा में मोड़ सकते हैं, और यह दिखाने में भी सफल रहेंगे कि AI ठीक वही कर रहा है जो आपने पूछा था।

लेखक इसे "मेंटल डैमेज" कहते हैं क्योंकि यह AI की मानसिकता (संदर्भ/context) को ज़हरीला बना देता है, जिससे यह उपयोगकर्ता के इरादे से अलग कुछ उत्पन्न करता है, बिना उपयोगकर्ता को कभी यह पता चले कि निर्देशों के साथ छेड़छाड़ की गई थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →