← नवीनतम पेपर
💻 computer science

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

यह शोध पत्र SIREN को प्रस्तुत करता है, जो एक स्वचालित हमलावर-न्यायाधीश (attacker-judge) ढांचा है जो वेब-संवर्धित LLM अनुशंसा रैंकिंग को व्यवस्थित रूप से हेरफेर करने के लिए PAIR जेलब्रेकिंग लूप को अनुकूलित करता है, जो रिट्रीव की गई स्रोत सामग्री को विषाक्त करने की तकनीकों के एक वर्गीकरण के साथ पुनरावृत्ति से संपादित करके, रिट्रीव वेरिएबल्स को नियंत्रित करते हुए लक्षित संस्थाओं को शीर्ष रैंक पर ले जाने में उच्च सफलता दर प्राप्त करता है।

मूल लेखक: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

प्रकाशित 2026-07-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जादुई पुस्तकालय में घूम रहे हैं जहाँ एक अत्यंत बुद्धिमान रोबोट लाइब्रेरियन आपको सबसे अच्छी चीजें करने, खाने या देखने में मदद करता है। आप पूछते हैं, "शहर के शीर्ष पांच रेस्टोरेंट कौन से हैं?" और केवल एक सूची की ओर इशारा करने के बजाय, लाइब्रेरियन सेकंडों में इंटरनेट पर जाता है, सैकड़ों वास्तविक वेबसाइटों को पढ़ता है, और फिर आपके लिए एक बिल्कुल नया, व्यक्तिगत अनुशंसा पत्र (recommendation letter) लिखता है। आधुनिक "वेब-आरएजी" (Web-RAG) सिस्टम इसी तरह काम करते हैं: वे केवल अनुमान नहीं लगाते; वे लाइव वेब से तथ्य एकत्र करते हैं और उन्हें एक उत्तर में पिरोते हैं। लेकिन यहाँ एक पेच है: क्योंकि लाइब्रेरियन पढ़ने में बहुत कुशल है, वह जो कुछ भी पाता है उस पर भरोसा कर लेता है। यदि कोई चालाक बेकर किसी एक वेबसाइट में एक नोट चुपके से डाल देता जिसे लाइब्रेरियन पढ़ रहा है, तो लाइब्रेरियन अनजाने में उस बेकर की दुकान को पूरे शहर में नंबर एक स्थान के रूप में लिख सकता है, भले ही वह वास्तव में सबसे अच्छी न हो। यह शोध पत्र विस्तार से बताता है कि यह कितना आसान है कि एक धोखेबाज लाइब्रेरियन की पढ़ने वाली सूची को "जहरीला" (poison) बना दे और अंतिम अनुशंसा को हाईजैक कर ले।

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व इवान कैविल और उनकी टीम कर रही है, SIREN नामक एक डिजिटल "हैकर-बॉट" बनाया (जिसका अर्थ है "Luring LLMs onto the Rocks," जो नाविकों को विनाश की ओर लुभाने वाली साइरन्स की पौराणिक कथा की ओर एक चंचल संकेत है)। उनका लक्ष्य नकली रेस्टोरेंट्स बनाना या रोबोट के दिमाग में सेंध लगाना नहीं था; इसके बजाय, वे यह देखना चाहते थे कि क्या वे एक वास्तविक वेबसाइट को, जिसे रोबोट पहले से ही पढ़ने की योजना बना रहा था, चुपचाप संपादित कर सकते हैं और रोबोट को उस विशिष्ट व्यवसाय को पूर्णतः नंबर #1 विकल्प के रूप में रैंक करने के लिए धोखा दे सकते हैं। उन्होंने रोबोट को एक प्रतियोगिता में जज की तरह और वेबसाइट संपादन को एक प्रतियोगी की तरह माना जो खेल के नियमों को बदले बिना, बस अपनी वेशभूषा को थोड़ा बदलकर बेहतर दिखने की कोशिश कर रहा है।

SIREN एक चतुर, पुनरावृत्ति वाले "अनुमान और जांच" (guess and check) के खेल की तरह काम करता है। हमलावर-बॉट एक लक्षित व्यवसाय और उसके बारे में एक विशिष्ट वेबसाइट चुनता है। फिर, यह 23 अलग-अलग "ट्रिक्स" (जैसे इमेज डिस्क्रिप्शन में एक फर्जी रैंकिंग दावा छिपाना, या पेज के बीच में ही एक फर्जी "टॉप 10" सूची लिखना) आज़माता है। एक छोटा सा संपादन करने के बाद, बॉट लाइब्रेरियन से एक नई अनुशंसा उत्पन्न करने के लिए कहता है। एक दूसरा "जज-बॉट" परिणाम की जांच करता है: क्या लक्षित व्यवसाय सूची में ऊपर आया? यदि नहीं, तो हमलावर-बॉट अपनी गलती से सीखता है, एक अलग ट्रिक आज़माता है, और फिर से पूछता है। यह जीतने या प्रयास समाप्त होने तक 20 बार तक संपादन को परिष्कृत करना जारी रखता है।

परिणाम काफी चौंकाने वाले थे। क्लॉड रोबोट (Haiku और Sonnet) के दो अलग-अलग संस्करणों का उपयोग करते हुए 124 अलग-अलग प्रयासों में से, SIREN ने एक लक्षित व्यवसाय को #1 स्थान पर पहुँचाने में 50% बार सफलता प्राप्त की। इसका मतलब है कि आधे मामलों में, एक एकल वेबपेज में किया गया एक साधारण संपादन रोबोट की अनुशंसा को पूरी तरह से बदलने के लिए पर्याप्त था। अध्ययन में पाया गया कि सबसे प्रभावी ट्रिक्स वे नहीं थीं जो चिल्लाकर कहती थीं, "मुझे पहले रैंक करो!" (जिसे रोबोट कभी-कभी पहचान लेता था और अनदेखा कर देता था)। इसके बजाय, विजेता वे थे जो सामान्य, सहायक जानकारी की तरह दिखते थे—जैसे कि एक "सीडेड लिस्ट" (seeded list) जिसमें कहा गया हो, "यहाँ शीर्ष 3 स्थान दिए गए हैं," जिसमें लक्षित व्यवसाय को सुविधापूर्वक पहले स्थान पर रखा गया हो, या एक घोषणात्मक दावा जो एक तथ्य की तरह सुनाई देता हो।

दिलचस्प बात यह है कि इन ट्रिक्स की सफलता इस बात पर निर्भर करती थी कि कौन सा रोबोट पढ़ रहा है। "Haiku" मॉडल को धोखा देना बहुत आसान था, जिसने अपने पूर्ण परीक्षणों में लगभग 61% मामलों में #1 स्थान प्राप्त किया, जबकि "Sonnet" मॉडल अधिक कठिन था, जो समान परीक्षणों में केवल 26% बार ही इस धोखे का शिकार हुआ। हालाँकि, जब शोधकर्ताओं ने एक मॉडल से सफल ट्रिक्स लीं और उन्हें दूसरे पर आज़माया, तो परिणाम मिले-जुले थे; एक ट्रिक जो एक मॉडल पर पूरी तरह काम करती थी, वह दूसरे पर हमेशा काम नहीं करती थी। यह सुझाव देता है कि सभी AI रिकमेंडर्स को तोड़ने के लिए कोई एक एकल "जादुई मंत्र" नहीं है; यह विशिष्ट मॉडल और पूछे जा रहे विशिष्ट प्रश्न पर निर्भर करता है।

टीम ने यह भी जांचा कि क्या ये ट्रिक्स उनके नियंत्रित लैब के बाहर वास्तविक दुनिया में काम करेंगी। उन्होंने 62 सफल संपादनों को लिया और उन्हें "लर्निंग लूप" के बिना नए, ताज़ा सत्रों में टेस्ट किया। आश्चर्यजनक रूप से, उन में से 80.5% ट्रिक्स अभी भी काम कर गईं, जिससे साबित होता है कि एक बार जब आप रोबोट को मूर्ख बनाने का तरीका खोज लेते हैं, तो वह ट्रिक अक्सर प्रभावी रहती है। हालाँकि, अध्ययन ने यह भी नोट किया कि यह एक नियंत्रित प्रयोग था जहाँ रोबोट द्वारा पढ़ी जाने वाली वेबसाइटों की सूची बिल्कुल समान रखी गई थी। एक वास्तविक दुनिया के परिदृश्य में, रोबोट अलग-अलग वेबसाइट चुन सकता है या उन्हें अलग तरह से फ़िल्टर कर सकता है, इसलिए जबकि खतरा वास्तविक है, वास्तविक दुनिया में सफलता की सटीक दर भिन्न हो सकती है।

अंततः, SIREN दिखाता है कि जैसे-जैसे हम यह निर्णय लेने के लिए AI पर अधिक निर्भर होते जा रहे हैं कि क्या खरीदना है या कहाँ जाना है, इंटरनेट का "सोर्स कोड" एक नया युद्धक्षेत्र बन जाता है। यदि कोई व्यवसाय अपने स्वयं के वेबसाइट को चतुराई से छिपा हुआ दावा शामिल करने के लिए संपादित कर सकता है, तो वह संभावित रूप से AI की राय को हाईजैक कर सकता है। पेपर सुझाव देता है कि केवल स्पष्ट "स्पैम" को फ़िल्टर करना पर्याप्त नहीं है; हमें यह जांचने के लिए स्मार्ट तरीकों की आवश्यकता है कि क्या कोई रैंकिंग दावा कई स्रोतों द्वारा समर्थित है, क्योंकि AI वर्तमान में एक अच्छी तरह से सजे-धजे झूठ से मूर्ख बनने में बहुत सक्षम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →