← नवीनतम पेपर
🤖 AI

Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

यह शोध पत्र फोर्स्ड डिफ़रल अटैक (FDA) को प्रस्तुत करता है, जो एक प्रतिकूल विधि है जो यूनिवर्सल बॉर्डर ट्रिगर्स के माध्यम से एक कमजोर मॉडल के आत्मविश्वास को कम करके मल्टीमॉडल एलएलएम (LLM) कैस्केड को हेरफेर करती है, जिससे उत्तर की शुद्धता से सीधे समझौता किए बिना महंगे कंप्यूटेशनल रूटिंग को एक मजबूत मॉडल की ओर जाने के लिए मजबूर किया जाता है।

मूल लेखक: Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin

प्रकाशित 2026-06-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक उच्च श्रेणी के रेस्टोरेंट की कल्पना करें जिसमें दो-स्तरीय किचन सिस्टम है।

सेटअप: "फास्ट फूड" बनाम "मास्टर शेफ"
पैसे बचाने के लिए, रेस्टोरेंट एक चतुर प्रणाली का उपयोग करता है। जब कोई ग्राहक किसी व्यंजन का ऑर्डर देता है, तो एक जूनियर कुक (कमजोर मॉडल/Weak Model) पहले उसे बनाने की कोशिश करता है।

  • यदि जूनियर कुक को आत्मविश्वास है कि वह इसे पूरी तरह से बना सकता है, तो वह इसे तुरंत परोस देता है। यह सस्ता और तेज़ है।
  • यदि जूनियर कुक अनिश्चित है या उसे लगता है कि ऑर्डर बहुत कठिन है, तो वह टिकट मास्टर शेफ (मजबूत मॉडल/Strong Model) को सौंप देता है। मास्टर शेफ महंगा और धीमा है, लेकिन वे हमेशा सही काम करते हैं।

नियम सरल है: केवल कठिन ऑर्डर्स ही मास्टर शेफ के पास जाते हैं। यह रेस्टोरेंट को कुशलतापूर्वक चलाने में मदद करता है।

भेद्यता (Vulnerability): "कॉन्फिडेंस हैक"
शोधकर्ताओं ने इस प्रणाली को तोड़ने का एक चालाकी भरा तरीका खोज निकाला है। उन्होंने महसूस किया कि पूरी प्रक्रिया जूनियर कुक के आत्मविश्वास पर निर्भर करती है। यदि जूनियर कुक सोचता है, "मुझे यकीन नहीं है," तो टिकट मास्टर शेफ के पास चला जाता है।

शोधकर्ताओं ने पाया कि हमलावर को मास्टर शेफ को धोखा देने या भोजन को खराब करने की आवश्यकता नहीं है। उन्हें बस जूनियर कुक को असुरक्षित महसूस कराने के लिए बेवकूफ बनाना होगा।

हमला: "कॉन्फिडेंस-फ्लैटनिंग फ्रेम"
शोधकर्ताओं ने एक विशेष, अदृश्य "फ्रेम" (बॉर्डर) बनाया जो किसी भी चित्र के चारों ओर रखा जा सकता है जिसे ग्राहक सबमिट करता है।

  1. ट्रिक: जब जूनियर कुक इस विशेष फ्रेम वाले चित्र को देखता है, तो उसका दिमाग भ्रमित हो जाता है। वह अपने उत्तर के बारे में कम निश्चित महसूस करने लगता है, भले ही चित्र पूरी तरह से स्पष्ट हो।
  2. परिणाम: क्योंकि जूनियर कुक अचानक "अनिश्चित" महसूस करता है, सिस्टम स्वचालित रूप से ऑर्डर को महंगे मास्टर शेफ को पास कर देता है।
  3. आउटकम: हमलावर को मास्टर शेफ से एक उच्च-गुणवत्ता वाला उत्तर मिलता है, लेकिन रेस्टोरेंट के मालिक को हर एक ऑर्डर के लिए उच्च लागत चुकानी पड़ती है, यहाँ तक कि आसान ऑर्डर्स के लिए भी।

उन्होंने यह कैसे किया ( "मैजिक फ्रेम")
चित्र पर इधर-उधर लकीरें खींचने (जो चित्र को खराब कर सकती हैं) के बजाय, उन्होंने एक यूनिवर्सल बॉर्डर को ऑप्टिमाइज़ किया।

  • उन्होंने एक कंप्यूटर को एक विशिष्ट पैटर्न सिखाया जो इमेज के किनारे पर ऐसा होता है जो जूनियर कुक के दिमाग को "फ्लैट" और अनिर्णायक बना दे।
  • उन्होंने जूनियर कुक को गलत उत्तर देने के लिए मजबूर करने की कोशिश नहीं की; उन्होंने बस जूनियर कुक को हिचकिचाने पर मजबूर किया।
  • क्योंकि चित्र का केंद्र अछूता रहता है, मास्टर शेफ अभी भी स्पष्ट चित्र देखता है और एक सटीक उत्तर देता है।

यह क्यों महत्वपूर्ण है
यह पेपर दिखाता है कि यह "कॉन्फिडेंस हैक" कई अलग-अलग प्रकार के AI मॉडल और विभिन्न प्रकार के सवालों पर काम करता है।

  • यह यूनिवर्सल है: वही बॉर्डर लगभग किसी भी इमेज पर काम करता है।
  • यह अदृश्य है: चित्र मनुष्यों के लिए सामान्य दिखता है।
  • यह महंगा है: यह महंगे AI को वह काम करने के लिए मजबूर करता है जो सस्ते AI को संभालना चाहिए था, जिससे प्रदाता के संसाधन खत्म होते हैं।

संक्षेप में:
शोधकर्ताओं ने एक इमेज के किनारे पर एक "कॉन्फिडेंस-सैपिंग" (आत्मविश्वास कम करने वाला) स्टिकर लगाने का तरीका खोजा है। यह स्टिकर चित्र को बदलता नहीं है, लेकिन यह सस्ते AI को अपना काम करने से रोकने के लिए उसे घबरा देता है, जिससे महंगा AI हस्तक्षेप करने के लिए मजबूर हो जाता है। यह उसके आत्म-संदेह को हैक करके उसके बजट में हेरफेर करने का एक तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →