← नवीनतम पेपर
🤖 AI

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

यह शोध पत्र BitHydra प्रस्तुत करता है, जो एक नवीन ढांचा है जो बिट-फ्लिप हमलों को एक प्रतिबंधित अनुकूलन समस्या (constrained optimization problem) के रूप में प्रतिपादित करता है ताकि बड़े भाषा मॉडलों में एंड-ऑफ-सीक्वेंस संभावनाओं को व्यवस्थित रूप से दबाया जा सके, जिससे मात्र 1-4 वेट बिट फ्लिप्स के साथ निरंतर, अनंत पीढ़ी (endless generation) सक्षम हो सके।

मूल लेखक: Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "स्टॉप" बटन को तोड़ना

कल्पना कीजिए कि आपने अपने लिए एक छोटी कहानी लिखने के लिए एक बहुत ही बुद्धिमान, महंगे रोबोट लेखक (एक लार्ज लैंग्वेज मॉडल या LLM) को काम पर रखा है। आप रोबोट को उसके द्वारा लिखे गए हर शब्द के हिसाब से भुगतान करते हैं। आमतौर पर, रोबate को पता होता है कि कब लिखना बंद करना है और वह कहता है, "द एंड" (समाप्त)।

BitHydra एक नए प्रकार का 'हैक' है जो रोबोट को किसी भ्रमित करने वाले सवाल से धोखा नहीं देता। इसके बजाय, यह रोबोट के दिमाग में घुसकर उसकी मेमोरी में एक छोटा सा स्विच (एक "बिट") बदल देता है। यह स्विच रोबोट का आंतरिक "स्टॉप" बटन है। एक बार स्विच बदलने के बाद, रोबोट भूल जाता है कि रुकना कैसे है। वह अनंत काल तक लिखता रहता है, हजारों शब्द का निरर्थक या दोहराव वाला टेक्स्ट बनाता है, जिससे उस कंपनी का भारी बिल बनता है जो उस रोबोट की मालिक है।

पुराने हमलों के साथ समस्या

पहले, हैकर्स इन रोबोटों को भ्रामक सवाल पूछकर पैसे बर्बाद करने के लिए मजबूर करने की कोशिश करते थे।

  • उपमा: कल्पना कीजिए कि एक टैक्सी ड्राइवर को एक भ्रमित करने वाला नक्शा देकर उसे गोल-गोल घुमाने की कोशिश करना।
  • खामी: ऐसा करने के लिए, हैकर को हर बार सवाल पूछने के लिए खुद सवारी का खर्च उठाना पड़ता है। यह हैकर के लिए महंगा है, और टैक्सी कंपनी उस विशिष्ट नक्शे को ब्लॉक कर सकती है।

BitHydra खेल बदल देता है। भ्रमित करने वाला नक्शा देने के बजाय, हैकर टैक्सी के इंजन को खराब कर देता है ताकि वह हमेशा गोल-गोल घूमती रहे, चाहे उसमें कोई भी बैठे। हैकर सवारी का भुगतान नहीं करता है; टैक्सी कंपनी (सेवा प्रदाता) अनंत ईंधन का भुगतान करती है, और हर यात्री को देरी का सामना करना पड़ता है।

BitHydra कैसे काम करता है: "हाइड्रा" रणनीति

शोधकर्ता अपने टूल को BitHydra कहते हैं। क्यों? क्योंकि पौराणिक हाइड्रा की तरह, जिसके एक सिर काटने पर दो नए सिर निकल आते हैं, यह हमला रोकना कठिन है क्योंकि यह मॉडल के मूल तर्क (core logic) को निशाना बनाता है।

यहाँ प्रक्रिया का सरल विवरण दिया गया है:

  1. लक्ष्य (The Target): शोधकर्ताओं ने महसूस किया कि जब भी कोई मॉडल एक वाक्य समाप्त करता है, तो वह <EOS> (एंड ऑफ सीक्वेंस) नामक एक विशेष टोकन की संभावना (probability) की गणना करता है। यह वाक्य के अंत में लगने वाले पूर्ण विराम (period) की तरह है।
  2. गणितीय पहेली (The Math Puzzle): वे रोबोट के दिमाग में उस सटीक छोटे स्विच को खोजना चाहते थे, जिसे बदलकर रोबमान को बार-बार यह सोचने पर मजबूर किया जा सके कि, "ओह, मैं अभी खत्म नहीं हुआ हूँ!"
    • चुनौती: रोबोट के पास अरबों स्विच हैं। एक-एक करके उन्हें चेक करने में सदियों लग जाएंगी।
    • समाधान: उन्होंने ADMM नामक एक उन्नत गणितीय तकनीक का उपयोग किया। इसे एक सुपर-स्मार्ट GPS की तरह समझें जो शहर की हर गली की जांच नहीं करता। इसके बजाय, यह तुरंत "स्टॉप" बटन के स्थान तक पहुँचने का सटीक रास्ता निकाल लेता है, और सभी अप्रासंगिक सड़कों को अनदेखा कर देता है।
  3. स्विच बदलना (The Flip): एक बार जब वे सही स्विच ढूंढ लेते हैं, तो वे उसे बदल देते हैं।
    • परिणाम: रोबोट अंतहीन रूप से टेक्स्ट जेनरेट करने लगता है। वह एक ही पैराग्राफ को बार-बार दोहरा सकता है, देशों के नाम अनंत तक लिख सकता है, या बार-बार "बेस्ट विशेस!" जैसे क्लोजिंग स्टेटमेंट लिख सकता है।
  4. छलावरण (The Stealth): सबसे अच्छी बात? रोबोट अभी भी सामान्य सुनाई देता है। वह तुरंत चिल्लाना या बकवास लिखना शुरू नहीं करता है। वह बस रुकता नहीं है। यह एक ऐसी कार की तरह है जो बिल्कुल ठीक चलती है लेकिन उसका इंजन बंद होने से मना कर देती है।

यह डरावना क्यों है (प्रभाव)

  • उपयोगकर्ता के लिए: आप "मौसम कैसा है?" जैसा सरल सवाल पूछते हैं और बदले में 2,000 शब्दों का एक निबंध मिलता जो कभी खत्म नहीं होता। आप इंतजार करते रह जाते हैं और आपका ऐप फ्रीज हो जाता है।
  • कंपनी के लिए: चूंकि वे टोकन (शब्द) के आधार पर शुल्क लेते हैं, इसलिए कंपनी लाखों बेकार शब्दों का भुगतान कर रही होती है। यदि कोई हैकर एक साथ हजारों उपयोगकर्ताओं के साथ ऐसा करता है, तो कंपनी सर्वर लागत में भारी नुकसान उठा सकती है।
  • "मौन" खतरा: क्योंकि रोबोट अभी भी व्याकरणिक रूप से सही वाक्य लिख रहा है, इसलिए सुरक्षा प्रणालियों के लिए इसे नोटिस करना कठिन है। यह ऐसा दिखता है जैसे रोबोट बस बहुत अधिक बातें कर रहा है, टूटा हुआ नहीं।

"बिट-फ्लिप" का रहस्य

वे बिट को कैसे बदलते हैं? पेपर यह मान लेता है कि हैकर के पास कंप्यूटर की मेमोरी (जैसे एक साझा क्लाउड सर्वर) तक पहुंच है। वे Rowhammer नामक एक हार्डवेयर ट्रिक का उपयोग करके, मेमोरी चिप्स को इतना कंपन (vibrate) करा सकते हैं कि बिना कंप्यूटर को पता चले एक सिंगल 0 को 1 (या इसके विपरीत) में बदला जा सके।

सारांश उपमा

कल्पना कीजिए कि एक वेंडिंग मशीन है जो सोडा बेचती है।

  • पुराना हमला: आप मशीन को हिलाते हैं या नकली सिक्का डालते हैं ताकि मुफ्त सोडा मिल सके। मशीन जाम हो सकती है, लेकिन आपको वहां खड़े होकर यह करना पड़ता है।
  • BitHydra हमला: आप चुपके से अंदर जाते हैं और उस धातु के लीवर को मोड़ देते हैं जो "डिस्पेंस" (निकालने) का काम करता है। अब, जब भी कोई भी पैसे डालता है, मशीन एक के बजाय 50 कैन सोडा बाहर निकाल देती है। मशीन अभी भी काम कर रही है, सोडा भी अच्छा है, लेकिन मालिक हर लेनदेन पर पैसे खो रहा है, और ग्राहक अपनी ड्रिंक के लिए इंतजार कर रहे हैं।

निष्कर्ष: यह पेपर हमें चेतावनी देता है कि भले ही हम कितने भी बेहतरीन AI मॉडल बना लें, यदि हम उन भौतिक मेमोरी चिप्स की रक्षा नहीं करते हैं जिनमें AI का "दिमाग" समाया है, तो एक छोटा सा ग्लिच एक मददगार सहायक को एक अंतहीन, पैसा लुटाने वाले बातूनी रोबोट में बदल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →