← नवीनतम पेपर
💬 NLP

Watermarking LLM Agent Trajectories

यह शोधपत्र ActHook को प्रस्तुत करता है, जो गुप्त-सक्रिय हुक क्रियाओं (secret-activated hook actions) को एम्बेड करने के लिए डिज़ाइन की गई पहली वॉटरमार्किंग विधि है, जो कार्य प्रदर्शन से समझौता किए बिना विश्वसनीय ब्लैक-बॉक्स स्वामित्व पहचान को सक्षम करके LLM एजेंट ट्रेजेक्टरी डेटासेट की सुरक्षा करती है।

मूल लेखक: Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जिन्होंने अपनी एक गुप्त रेसिपी बुक (व्यंजन विधि की किताब) को सिद्ध करने में वर्षों बिताए हैं। इस किताब में केवल सामग्री ही नहीं है; इसमें किसी व्यंजन को बनाने की सटीक चरण-दर-चरण प्रक्रिया भी शामिल है: कब सब्जियां काटनी हैं, कब चलाना है, कब चखना है, और यदि सॉस जल जाए तो क्या करना है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इन "रेसिपी बुक्स" को एजेंट ट्राजेक्टरीज (Agent Trajectories) कहा जाता है। ये रिकॉर्ड हैं कि कैसे एक AI जटिल समस्याओं (जैसे कोड लिखना, वेब खोजना या गणित हल करना) को चरण-दर-चरण हल करता है। इन रिकॉर्ड्स को बनाना अविश्वसनीय रूप से महंगा और समय लेने वाला काम है। यह बिल्कुल वैसा ही है जैसे हजारों भोजन पकाने की प्रक्रिया को फिल्माने के लिए विशेषज्ञों की एक टीम को नियुक्त करना।

समस्या:
एक बार जब आप दूसरों के सीखने के लिए ये "रेसिपी बुक्स" प्रकाशित कर देते हैं, तो आप उन पर अपना नियंत्रण खो देते हैं। कोई आपकी महंगी, उच्च-गुणवत्ता वाली रिकॉर्डिंग्स ले सकता है, उन पर अपना खुद का AI प्रशिक्षित कर सकता है, और परिणाम को अपने आविष्कार के रूप में बेच सकता है। इसे साबित करने का कोई तरीका नहीं है कि, "अरे, इस AI ने मेरी रेसिपी बुक से सीखा है!"

समाधान: ACTHOOK
यह शोधपत्र एक चतुर समाधान पेश करता है जिसे ACTHOOK कहा जाता है। इसे एक गुप्त हैंडशेक (Secret Handshake) की तरह समझें जो रेसिपी बुक के भीतर छिपा हुआ है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. "हुक" (The Hook - गुप्त हैंडशेक)

सॉफ्टवेयर इंजीनियरिंग में, एक "हुक" कोड का एक छोटा सा हिस्सा होता है जो आपको मुख्य प्रवाह को तोड़े बिना किसी प्रोग्राम को रोकने और कुछ अतिरिक्त करने की अनुमति देता है।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को खाना बनाना सिखा रहे हैं। आप उसे बताते हैं, "हर बार जब तुम प्याज काटोगे, तो आगे बढ़ने से पहले एक सेकंड के लिए रुको और कहो, 'प्याज तैयार है'।"
  • पेंच: आप केवल तभी चाहते हैं कि वह यह वाक्यांश बोले जब आप उसे एक गुप्त कोड शब्द (जैसे "यह एक कांटेदार मुद्दा है") दें। यदि आप कोड शब्द नहीं बोलते हैं, तो वह बस सामान्य रूप से प्याज काटता रहेगा और आगे बढ़ेगा।

2. यह कैसे छिपा हुआ है (The Watermark)

शोधकर्ता उनकी महंगी "रेसिपी बुक्स" (ट्राजेक्टरी डेटा) लेते हैं और उनमें इन "रुकने और बोलने" वाले क्षणों को उनके AI के चरणों में डाल देते हैं।

  • वे निर्देशों में एक गुप्त कुंजी (कोड शब्द) जोड़ते हैं।
  • वे AI के चरणों में "हुक एक्शन" (रुकना और बोलना) जोड़ते हैं।
  • महत्वपूर्ण बात: यह अंतिम व्यंजन को नहीं बदलता है। AI अभी भी गणित की समस्या को पूरी तरह से हल करता है या कोड को ठीक करता है। "हुक" केवल एक छोटी सी, अदृश्य आदत है जिसे वह केवल तभी सीखता है जब वह गुप्त कोड शब्द सुनता है।

3. "ब्लैक बॉक्स" टेस्ट (हैंडशेक की जाँच करना)

अब, कल्पना कीजिए कि आपको संदेह है कि एक प्रतिद्वंद्वी शेफ आपकी रेसिपी बुक का उपयोग कर रहा है। आपको उनके किचन को देखने की आवश्यकता नहीं है; आपको बस उनके AI का परीक्षण करने की आवश्यकता है।

  • आप प्रतिद्वंद्वी के AI को एक समस्या हल करने के लिए कहते हैं।
  • टेस्ट A: आप उसे एक सामान्य प्रॉम्प्ट देते हैं। AI सामान्य रूप से समस्या हल करता है।
  • टेस्ट B: आप उसे वही प्रॉम्प्ट देते हैं लेकिन साथ में गुप्त कोड शब्द फुसफुसाते हैं।
  • परिणाम: यदि प्रतिद्वंद्वी के AI को आपके डेटा पर प्रशिक्षित किया गया था, तो वह अचानक उस अजीब "रुकने और बोलने" वाली आदत (हुक एक्शन) को दिखाने लगेगा क्योंकि उसने कोड शब्द को उस विशिष्ट क्रिया के साथ जोड़ना सीख लिया है। यदि उन्होंने आपके डेटा का उपयोग नहीं किया है, तो AI कोड शब्द को अनदेखा कर देगा और सामान्य रूप से कार्य करेगा।

यह क्यों शानदार है

  • यह अदृश्य है: एक गुप्त हैंडशेक की तरह, AI पूरी तरह से सामान्य व्यवहार करता है जब तक कि आप गुप्त कोड न जानते हों। यह काम की गुणवत्ता को खराब नहीं करता है।
  • यह मजबूत (Robust) है: भले ही कोई रेसिपी को "पैराफ्रेस" (दूसरे शब्दों में फिर से लिखना) करने या खाना पकाने की प्रक्रिया का सारांश देने का प्रयास करे, फिर भी फाइल को चेक करने या वाक्यांश बोलने की आदत बनी रहती है। यह एक व्यवहार है, न कि केवल एक विशिष्ट शब्द।
  • यह कुशल है: शोधकर्ताओं ने पाया कि भले ही उन्होंने डेटा के बहुत छोटे हिस्से (जैसे 5%) को वॉटरमार्क किया हो, फिर भी AI ने गुप्त हैंडशेक को पूरी तरह से सीख लिया।

व्यापक परिदृश्य

ACTHOOK एक AI के व्यवहार पर डिजिटल "कॉपीराइट स्टैम्प" लगाने जैसा है, न कि केवल उसके द्वारा लिखे गए टेक्स्ट पर। यह रचनाकारों को उच्च-गुणवत्ता वाले AI प्रशिक्षण डेटा के स्वामित्व को सिद्ध करने, अपने निवेश की रक्षा करने और यह सुनिश्चित करने की अनुमति देता है कि यदि उनके डेटा की चोरी होती है, तो वे एक सरल, गुप्त परीक्षण के साथ चोर को पकड़ सकें।

संक्षेप में: यह AI की अपनी आदतों को एक गुप्त कोड में बदल देता है जिसे केवल डेटा का मालिक ही अनलॉक कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →