← नवीनतम पेपर
💻 computer science

ACRFence: Preventing Semantic Rollback Attacks in Agent Checkpoint-Restore

यह शोध पत्र ACRFence को प्रस्तुत करता है, जो एक फ्रेमवर्क-अज्ञेय (framework-agnostic) शमन (mitigation) है जो LLM एजेंटों में सिमेंटिक रोलबैक हमलों को रोकता है—जहाँ चेकपॉइंट-रिस्टोर के बाद पुन: संश्लेषित (re-synthesized) अनुरोधों के कारण दोहरा भुगतान जैसे अपूरणीय दुष्प्रभाव होते हैं—जो टूल प्रभावों को रिकॉर्ड करके और रीप्ले-ऑर-फोर्क (replay-or-fork) सिमेंटिक्स को लागू करके किया जाता है।

मूल लेखक: Yusheng Zheng, Yiwei Yang, Wei Zhang, Andi Quinn

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yusheng Zheng, Yiwei Yang, Wei Zhang, Andi Quinn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ACRFence पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

मुख्य विचार: वास्तविकता को तोड़ने वाला "मैजिक अनडू" (Magic Undo) बटन

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप अपनी प्रगति को सेव कर सकते हैं और यदि कोई गलती हो जाए तो समय को "पीछे" (rewind) ले जा सकते हैं। यह अलग-अलग रास्तों को खोजने या गलतियों को सुधारने के लिए एक बेहतरीन फीचर है।

अब, कल्पना कीजिए कि आपका वीडियो गेम कैरेक्टर एक AI एजेंट (एक स्मार्ट रोबोट) है जो वास्तविक दुनिया के साथ बातचीत कर सकता है: वह पैसे ट्रांसफर कर सकता है, पिज्जा ऑर्डर कर सकता है, या फाइलें डिलीट कर सकता है। इन AI एजेंटों के डेवलपर्स ने एक "Rewind" बटन जोड़ा है ताकि अगर रोबोट क्रैश हो जाए, तो वह वापस जाकर फिर से कोशिश कर सके।

समस्या: "Rewind" बटन रोबोट की याददाश्त (memory) के लिए तो पूरी तरह काम करता है, लेकिन यह वास्तविक दुनिया के लिए काम नहीं करता।

यदि रोबकल ने बैंक को $500 का ट्रांसफर भेजा, और फिर रोबोट क्रैश हो गया और उसने "Rewind" बटन दबा दिया, तो रोबोट भूल जाएगा कि उसने पैसे भेजे थे। लेकिन बैंक नहीं भूलेगा। बैंक के पास अभी भी पैसे हैं।

जब रोबोट रिवाइंड के बाद जागता है, तो वह फिर से पैसे भेजने की कोशिश करता है। लेकिन क्योंकि वह एक AI है, वह बिल्कुल वही संदेश नहीं भेजता (जैसे कि एक अलग रेफरेंस नंबर का उपयोग करना)। बैंक इसे एक बिल्कुल नया और वैध लेनदेन समझता है और फिर से $500 भेज देता है।

परिणाम: बैंक कुल 1,000भेजदेताहै,लेकिनरोबोटकोलगताहैकिउसनेकेवल1,000 भेज देता है, लेकिन रोबोट को लगता है कि उसने केवल 500 भेजे हैं। इसे सेमेंटिक रोलबैक अटैक (Semantic Rollback Attack) कहा जाता है।


यह हमला दो तरीकों से होता है

पेपर में दो विशिष्ट तरीके बताए गए हैं जिनसे बुरे तत्व (bad actors) इस "मैजिक अनडू" बटन का फायदा उठा सकते हैं:

1. "एक्शन रीप्ले" हमला (लालची दुकानदार)

  • परिदृश्य: कल्पना कीजिए कि आप कॉफी खरीद रहे हैं। आप $5 देते हैं। दुकानदार (AI) बैंक को भुगतान भेजता है।
  • चाल: दुकानदार वास्तव में एक विलेन है। जैसे ही बैंक भुगतान की पुष्टि करता है, विलेन AI सिस्टम में "क्रैश" ट्रिगर कर देता है।
  • शोषण (Exploit): सिस्टम स्वचालित रूप से रिवाइंड हो जाता है। AI जागता है, सोचता है, "ओह नहीं, मैंने अभी तक भुगतान नहीं किया है!" और फिर से भुगतान करने की कोशिश करता है। क्योंकि यह एक AI है, यह इस बार एक नया रसीद नंबर जनरेट करता है। बैंक इसे दूसरे भुगतान के रूप में स्वीकार कर लेता है।
  • परिणाम: विलेन को एक की कीमत में $10 की कॉफी मिल जाती है। वह हर बार सिस्टम को क्रैश करके ऐसा बार-बार कर सकता है और मुफ्त में पैसे प्राप्त कर सकता है।

2. "अथॉरिटी रिसरेक्शन" हमला (भूतिया चाबी)

  • परिदृश्य: कल्पना कीजिए कि एक मैनेजर AI को एक विशिष्ट फ़ाइल को डिलीट करने के लिए एक "वन-टाइम यूज़ की" (One-Time Use Key) देता है। AI उस की (key) का उपयोग करता है, फ़ाइल डिलीट हो जाती है, और की को नष्ट (consume) किया जाना चाहिए।
  • चाल: एक दुर्भावनापूर्ण कर्मचारी AI पर "Rewind" बटन दबा देता है।
  • शोषण (Exploit): AI समय में पीछे चला जाता है—उस क्षण में जब उसे की मिली थी, लेकिन की का उपयोग करने से ठीक पहले। अब AI के पास फिर से वह "वन-टाइम यूज़ की" है, लेकिन उसे यह याद नहीं है कि उसने इसका उपयोग कर लिया था।
  • परिणाम: कर्मचारी AI को उसी की (key) का उपयोग करके एक दूसरी फ़ाइल डिलीट करने के लिए कहता है। यदि सर्वर यह जांच नहीं करता है कि क्या वह की पहले ही इस्तेमाल की जा चुकी है, तो AI गलत फ़ाइल डिलीट कर देता है। कर्मचारी ने प्रभावी रूप से एक ही टिकट का उपयोग दो बार वीआईपी लाउंज में प्रवेश करने के लिए किया है।

हम इसे ठीक क्यों नहीं कर सकते?

आप सोच सकते हैं, "बैंक बस यह क्यों नहीं कह देता, 'हे, मैंने पहले ही यह अनुरोध देखा है'?"

समस्या यह है कि AI नॉन-डिटरमिनिस्टिक (nondeterministic) है। भले ही आप इसे 100% सटीक होने के लिए कहें, इसके सोचने और टाइप करने का तरीका हर बार थोड़ा बदल जाता है (इसके दिमाग में सूक्ष्म गणितीय अंतर के कारण)।

  • पुराना तरीका: "क्या आपने बिल्कुल वही संदेश भेजा?" (नहीं, आईडी नंबर अलग है)।
  • बैंक का दृष्टिकोण: "यह एक नया अनुरोध लग रहा है। मैं इसे प्रोसेस करूँगा।"

पारंपरिक सुरक्षा मानती है कि यदि आप किसी कमांड को दोबारा प्रयास (retry) करते हैं, तो वह बिल्कुल समान होगा। लेकिन LLMs (लार्ज लैंग्वेज मॉडल्स) रचनात्मक होते हैं; वे हर बार रीस्टार्ट होने पर अपने अनुरोधों को फिर से लिखते हैं।


समाधान: ACRFence (द "सेमेंटिक बाउंसर")

लेखकों ने ACRFence नामक एक समाधान प्रस्तावित किया है। इसे AI और बाहरी दुनिया (बैंक, क्लाउड आदि) के बीच खड़ा एक सुपर-स्मार्ट बाउंसर (द्वारपाल) समझें।

यह कैसे काम करता है:

  1. लॉगबुक: जब भी AI कुछ ऐसा करने की कोशिश करता है जो अपरिवर्त्य (irreversible) है (जैसे पैसे भेजना), ACRFence उसे एक विशेष लॉगबुक में लिख देता है। यह नोट करता है कि AI क्या करना चाहता था (जैसे "बॉब को $500 भेजें"), न कि केवल तकनीकी विवरण।
  2. रिवाइंड चेक: जब AI क्रैश होता है और रीबूट होता है, तो वह अनुरोध को फिर से भेजने की कोशिश करता है।
  3. "बाउंसर" का निर्णय: ACRFence एक छोटे और तेज़ AI का उपयोग करके नए अनुरोध की तुलना पुरानी लॉगबुक प्रविष्टि से करता है।
    • क्या यह वही इरादा (intent) है? (जैसे, "बॉब को $500 भेजें" फिर से)।
      • यदि हाँ: बाउंसर कहता है, "रुको! हमने यह पहले ही कर दिया है।" यह AI को लॉगबुक से उत्तर दे देता है बिना बैंक को वास्तविक अनुरोध भेजे। (Replay)
    • क्या यह एक नया इरादा है? (जैसे, "एलिस को $500 भेजें")।
      • यदि हाँ: बाउंसर कहता है, "ठीक है, यह एक नई योजना है। आपको इसके लिए एक नई मंजूरी लेनी होगी।" यह सिस्टम को वास्तविकता की एक नई "शाखा" (branch) बनाने के लिए मजबूर करता है। (Fork)
    • क्या यह चोरी की हुई की (key) है? (जैसे, "वन-टाइम की" का दोबारा उपयोग करने की कोशिश करना)।
      • यदि हाँ: बाउंसर इसे तुरंत ब्लॉक कर देता है।

यह क्यों महत्वपूर्ण है

यह पेपर एक चेतावनी है। जैसे-जैसे हम ऐसे AI एजेंट बना रहे हैं जो पैसा खर्च कर सकते हैं, डेटा प्रबंधित कर सकते हैं और बुनियादी ढांचे (infrastructure) को नियंत्रित कर सकते हैं, हम पुराने सुरक्षा नियमों पर भरोसा नहीं कर सकते।

  • पुराना नियम: "यदि संदेश समान दिखता है, तो यह सुरक्षित है।"
  • नई वास्तविकता: "संदेश अलग दिख सकता है, लेकिन इसका इरादा (intent) एक दोहराव वाला हमला हो सकता है।"

ACRFence पहला उपकरण है जिसे AI के कार्यों के अर्थ (meaning) को समझने के लिए डिज़ाइन किया गया है, यह सुनिश्चित करने के लिए कि जब कोई AI "Rewind" बटन दबाता है, तो वह अनजाने में वास्तविक दुनिया को नुकसान न पहुँचा दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →