← नवीनतम पेपर
💻 computer science

Sequential Behavioral Watermarking for LLM Agents

यह शोध पत्र SeqWM को प्रस्तुत करता है, जो एक अनुक्रमिक व्यवहार संबंधी वॉटरमार्किंग फ्रेमवर्क है जो स्वामित्व संकेतों को इतिहास-सशर्त एजेंट ट्रांज़िशन पैटर्न में एम्बेड करता है ताकि एजेंट उपयोगिता को संरक्षित करते हुए मजबूत, स्थिति-अज्ञेय (position-agnostic) प्रक्षेपवक्र सत्यापन सक्षम किया जा सके, जो मौजूदा विधियों की भंगुरता पर विजय प्राप्त करता है जो कार्यों को स्वतंत्र परीक्षणों के रूप में मानती हैं।

मूल लेखक: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Sequential Behavioral Watermarking for LLM Agents" (SeqWM) का सरल भाषा में अनुवाद दिया गया है:

बड़ी समस्या: "ब्लैक बॉक्स" एजेंट

कल्पना कीजिए कि आपने एक जटिल काम करने के लिए एक बहुत ही कुशल रोबोट सहायक (LLM एजेंट) को काम पर रखा है, जैसे कि किसी यात्रा की योजना बनाना या कोड को ठीक करना। यह रोबोट केवल एक अंतिम रिपोर्ट नहीं लिखता; यह निर्णयों की एक लंबी श्रृंखला बनाता है: "मैं मौसम की जाँच करूँगा," फिर "मैं फ्लाइट बुक करूँगा," फिर "मैं टैक्सी बुलाऊँगा।"

समस्या: यदि आप इन कार्यों की एक सूची देखते हैं, तो आप कैसे जानेंगे कि ये किस रोबोट ने किए हैं?

  • क्या यह आपके रोबोट ने किया?
  • क्या किसी प्रतिस्पर्धी के रोबोट ने किया?
  • क्या किसी हैकर ने आपके रोबोट के "दिमाग" को चुरा लिया और एक ऐसी कॉपी बनाई जो बिल्कुल वैसा ही काम करती है?

वर्तमान में, यह बताना बहुत कठिन है। रोबोट के आंतरिक विचार (जो टेक्स्ट वह जनरेट करता है) अक्सर छिपे होते हैं, और हमें केवल अंतिम कार्य (actions) दिखाई देते हैं। यदि कोई आपके रोबोट के व्यवहार की नकल करता है, तो वे आपकी बौद्धिक संपदा (intellectual property) को बिना आपकी जानकारी के चुरा सकते हैं।

पुराने तरीके क्यों विफल रहे

वैज्ञानिकों ने पहले इस समस्या को हल करने के लिए रोबोट द्वारा लिखे गए शब्दों पर एक "डिजिटल वॉटरमार्क" (जैसे किसी पत्र पर छिपी हुई स्याही का दाग) डालने की कोशिश की थी।

  • खामी: एजेंटों की दुनिया में, शब्दों से अधिक कार्य (action) महत्वपूर्ण होता है। यदि एक रोबोट "टैक्सी बुलाने" का निर्णय लेता है, तो वह इसे हज़ार अलग तरीकों से कह सकता है। शब्दों पर लगाया गया वॉटरमार्क शोर (noise) में खो जाता है।
  • "राउंड नंबर" का जाल: कुछ नए तरीकों ने कार्यों को उनके क्रम (order) के आधार पर टैग करके वॉटरमार्क करने की कोशिश की (जैसे, "पहला कार्य A होना चाहिए, दूसरा B")।
    • उपमा: एक डांस रूटीन की कल्पना करें जहाँ वॉटरमार्क है "स्टेप 1 एक स्पिन है, स्टेप 2 एक जंप है।" यदि दर्शक स्टेप 1 को मिस कर देता है (शायद वीडियो कट गया), तो वे गिनती खो देते हैं। अचानक, स्टेप 2 "स्टेप 1" जैसा दिखने लगता है, और पूरा वॉटरमार्क टूट जाता है। यह सिस्टम बहुत नाजुक है; एक भी गायब स्टेप पूरे प्रमाण को खराब कर देता है।

समाधान: SeqWM (द "कॉन्टेक्स्टुअल डांस" वॉटरमार्क)

लेखक SeqWM का प्रस्ताव करते हैं, जो एजेंटों को वॉटरमार्क करने का एक नया तरीका है जो स्टेप नंबर की परवाह नहीं करता। इसके बजाय, यह मूवमेंट के पैटर्न को देखता है।

1. मुख्य विचार: "इतिहास ही कुंजी है"

स्टेप नंबर पूछने के बजाय ("5वाँ स्टेप क्या है?"), SeqWM पूछता है, "पिछले कुछ स्टेप्स में क्या हुआ था?"

  • उपमा: एक गुप्त हैंडशेक (secret handshake) की कल्पना करें।
    • पुराना तरीका: "यदि आप लाइन में 5वें व्यक्ति हैं, तो हाई-फाइव दें।" (यदि कोई लाइन से बाहर निकल जाता है, तो सभी आगे खिसक जाते हैं, और 5वाँ व्यक्ति अब 4था बन जाता है, इसलिए नियम टूट जाता है)।
    • SeqWM तरीका: "यदि आपसे पहले वाले व्यक्ति ने 'वेव' (wave) किया और उससे पहले वाले ने 'नोड' (nod) किया, तो आपको 'क्लैप' (clap) करना चाहिए।"
    • यह क्यों काम करता है: इससे कोई फर्क नहीं पड़ता कि आप 5वें व्यक्ति हैं या 50वें। जब तक पैटर्न (Wave -> Nod -> Clap) मौजूद है, वॉटरमार्क वहीं है। यदि कोई बीच में एक स्टेप हटा देता है, तो पैटर्न बस थोड़ा सा खिसक जाता है, लेकिन बाकी का डांस अभी भी रहस्य को बनाए रखता है।

2. "मल्टी-चैनल" सुरक्षा जाल

यह सुनिश्चित करने के लिए कि वीडियो के कुछ हिस्सों को काटने पर भी वॉटरमार्क बना रहे, SeqWM मल्टीपल चैनल्स का उपयोग करता है (जैसे एक साथ 8 अलग-अलग गुप्त कोड चलाना)।

  • उपमा: एक कागज पर गुप्त संदेश लिखने के बजाय, आप उसे 8 अलग-अलग कागजों पर लिखते हैं। यदि कोई चोर एक या दो कागजों को जला देता है, तो भी आप शेष छह से संदेश पढ़ सकते हैं।
  • SeqWM में, एजेंट का निर्णय हाल के इतिहास से प्राप्त 8 अलग-अलग "गुप्त कुंजियों" (secret keys) के आधार पर थोड़ा सा बदला (nudge) जाता है। भले ही एजेंट का व्यवहार अव्यवस्थित हो, इन 8 चैनल्स में सांख्यिकीय पैटर्न (statistical pattern) वॉटरमार्क को प्रकट कर देता है।

3. "रैंडम की" जासूस

आप यह कैसे साबित करेंगे कि यह एक वॉटरमार्क है और केवल एक संयोग नहीं?

  • पुराना तरीका: आप गुप्त कोड का अनुमान लगाने की कोशिश करते हैं। यदि आपका अनुमान सही निकलता है, तो आप वॉटरमार्क पा लेते हैं।
  • SeqWM तरीका: जासूस एक्शन सीक्वेंस को लेता है और उसे हजारों गलत गुप्त कुंजियों का उपयोग करके एक "सिम्युलेटर" के माध्यम से चलाता है।
    • यदि सीक्वेंस असली की (real key) के साथ वॉटरमार्क किया गया था, तो स्कोर बहुत अधिक होगा।
    • यदि आप इसे गलत कुंजियों के साथ चलाते हैं, तो स्कोर कम होगा (जैसे बैकग्राउंड शोर)।
    • उपमा: एक विशिष्ट रेडियो स्टेशन खोजने की कोशिश करें। आप 1,000 रैंडम फ्रीक्वेंसी ट्यून करते हैं। अधिकांश में केवल स्टैटिक (static) सुनाई देता है। लेकिन एक फ्रीक्वेंसी (असली की) पर एक स्पष्ट गाना बजता है। यदि गाना स्टैटिक की तुलना में काफी तेज है, तो आप जानते हैं कि यह असली है। यह तरीका गणितीय रूप से सिद्ध है कि यह निष्पक्ष है, भले ही रोबोट का व्यवहार अजीब हो या वीडियो कटा हुआ हो।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने तीन अलग-अलग प्रकार के AI एजेंटों (एक टूल्स के लिए, एक भौतिक कार्यों के लिए, एक सामाजिक सिमुलेशन के लिए) पर विभिन्न AI मॉडलों का उपयोग करके परीक्षण किया।

  1. विश्वसनीयता (Reliability): SeqWM ने लगभग 100% समय एजेंट के व्यवहार के "मालिक" की सफलतापूर्वक पहचान की, जबकि पुराने तरीके अक्सर विफल रहे।
  2. मजबूती (Robustness): जब उन्होंने 10%, 20%, या यहाँ तक कि 50% एक्शन को डिलीट करके (जैसे वीडियो के हिस्से काटकर) "हमलों" का अनुकरण किया, तब भी SeqWM काम करता रहा। पुराने "राउंड-नंबर" तरीके केवल एक भी डिलीशन के बाद तुरंत विफल हो गए।
  3. कोई नुकसान नहीं (No Harm): वॉटरमार्क ने रोबोट को "बेवकूफ" नहीं बनाया या समस्याओं को हल करने की उसकी क्षमता को नहीं बदला। इसने बस विकल्पों को इस तरह से थोड़ा सा बदला जो उपयोगकर्ता के लिए अदृश्य था लेकिन सत्यापनकर्ता (verifier) के लिए पता लगाने योग्य था।

सारांश

SeqWM रोबोट के शब्दों के बजाय उसके डांस मूव्स (नृत्य की चालों) पर वॉटरमार्क लगाने जैसा है। स्टेप गिनने के बजाय (जो एक भी मिस होने पर टूट जाता है), यह मूव्स के बीच के संबंध को देखता है (जैसे, "स्पिन के बाद, जंप आने की संभावना है")। कई गुप्त कोड और एक चतुर सांख्यिकीय परीक्षण का उपयोग करके, यह साबित कर सकता है कि किसने रोबोट का व्यवहार बनाया था, भले ही व्यवहार के कुछ हिस्से गायब हों या छिपे हों। यह AI एजेंटों के रचनाकारों को उनके काम को चोरी होने या कॉपी होने से बचाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →