← नवीनतम पेपर
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

यह शोधपत्र TRACE को प्रस्तुत करता है, जो LLM-एजेंट प्रक्षेपवक्र (trajectories) के लिए एक नवीन दो-चैनल सुदृढ़ एट्रिब्यूशन वॉटरमार्क है, जो एक कंटेंट-कीड (content-keyed) चयन चैनल और एक पोजीशन-कीड (position-keyed) टैली चैनल को सुपरपोज़ करके विरूपण-मुक्त क्रिया चयन और अटूट उत्पत्ति ट्रैकिंग सुनिश्चित करता है, जिससे यह पुनर्विक्रेताओं द्वारा किए जाने वाले प्रतिकूल विलोपन और पुनर्लेखन के प्रयासों से बच जाता है।

मूल लेखक: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

प्रकाशित 2026-07-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो उड़ानें बुक कर सकता है, पिज्जा ऑर्डर कर सकता है और आपके वाई-फाई को ठीक कर सकता है। आप इस रोबोट को एक बिचौलिए (एक "रीसेलर") को बेचते हैं जो फिर इसे ग्राहकों को किराए पर देता है। समस्या क्या है? बिचौलिया एक सस्ता रोबोट छिपाने की कोशिश कर सकता है, दावा कर सकता है कि उसने इसे खुद बनाया है, या अपने कदमों के निशान छिपाने के लिए लॉग्स (logs) के साथ छेड़छाड़ कर सकता है।

आमतौर पर, यह साबित करने के लिए कि रोबोट के निर्णय किसने लिए, हम उसके "डायरी" यानी उसके द्वारा उपयोग किए गए हर टूल और उसके द्वारा की गई हर क्रिया के लॉग को देखते हैं। लेकिन यदि बिचौलिया डायरी का मालिक है, तो वह पन्ने मिटा सकता है या कहानी को फिर से लिख सकता है ताकि यह दिखाया जा सके कि काम उसने किया था। मौजूदा वॉटरमार्क्स डायरी के पन्नों पर लिखी अदृश्य स्याही की तरह हैं; यदि बिचौलिया टेक्स्ट को फिर से लिखता है, तो स्याही गायब हो जाती है।

यहाँ TRACE आता है, जो एक नया प्रकार का डिजिटल फिंगरप्रिंट है जिसे इस तरह डिज़ाइन किया गया है कि वह तब भी जीवित रहे जब डायरी का मालिक उसे साफ करने की कोशिश करे। TRACE केवल पन्नों पर नहीं लिखता; यह दो चतुर, अदृश्य तरीकों से कहानी को बदल देता है जो इसे वापस न लौटाने के लिए असंभव हैं।

दो-चैनल वाला जादू का खेल (The Two-Channel Magic Trick)

TRACE सबूत को छिपाने के लिए दो अलग-अलग "चैनलों" का उपयोग करता है, जैसे कि एक जासूस दो अलग-अलग कोडों का उपयोग करता है जो एक-दूसरे की रक्षा करते हैं।

1. "चॉइस" चैनल (The Invisible Hand - अदृश्य हाथ)
कल्पना कीजिए कि रोबोट को एक दरवाजा चुनने के लिए जाना है। पाँच दरवाजे हैं, लेकिन केवल एक ही खजाने की ओर ले जाता है। एक सामान्य रोबोट अपने तर्क के आधार पर दरवाजा चुनता है। TRACE का "चॉइस" चैनल एक जादुई, अदृश्य हाथ की तरह काम करता है जो सफलता की संभावनाओं को बदले बिना, रोबोट को एक विशिष्ट दरवाजा चुनने के लिए धीरे से प्रेरित करता है।

  • यह कैसे काम करता है: यह एक गुप्त कुंजी (key) का उपयोग करता है जो अब तक की कहानी (कंटेंट) पर आधारित होती है, यह तय करने के लिए कि कौन सा दरवाजा चुनना है।
  • इसकी महाशक्ति: यदि बिचौलिया डायरी से एक पन्ना हटा देता है (एक "डिलीशन अटैक"), तो कहानी उछल जाती है, लेकिन अदृश्य हाथ अगले पन्ने के लिए तुरंत खुद को पुनर्गठित (recalibrate) कर लेता है। यह एक GPS की तरह है जो रास्ता भटकने पर तुरंत नया रास्ता बना लेता है। सबूत इसलिए बच जाता है क्योंकि यह विकल्पों के कंटेंट से जुड़ा होता है, न कि पेज नंबर से।
  • इसकी कमी: यदि बिचौलिया कहानी को फिर से लिखता है (जैसे "दरवाजा A" को बदलकर "नीला दरवाजा" कर देना), तो यह चैनल टूट जाता है। अदृश्य हाथ "दरवाजा A" की तलाश में था, और अब वह भ्रमित है।

2. "काउंट" चैनल (The Skeleton Key - कंकाल की चाबी)
अब, कल्पना कीजिए कि रोबोट की डायरी समूहों में व्यवस्थित है: एक निर्णय, उसके बाद कुछ अवलोकन। TRACE का "काउंट" चैनल शब्दों की परवाह नहीं करता; उसे संरचना (स्ट्रक्चर) की परवाह है। यह गुप्त रूप से कुछ समूहों में एक "घोस्ट रिकॉर्ड" (एक अतिरिक्त नोट) जोड़ देता है, जिससे उनके पास एक के बजाय दो नोट हो जाते हैं।

  • यह कैसे काम करता है: यह डायरी के ढांचे (स्केलेटन) के स्थान (पोजीशन) पर आधारित एक गुप्त कुंजी का उपयोग करता है। यह तय करता है: "ग्रुप 1 को एक घोस्ट नोट मिलेगा, ग्रुप 2 को नहीं।"
  • इसकी महाशक्ति: यदि बिचौलिया टेक्स्ट को फिर से लिखता है (जैसे "दरवाजा A" को बदलकर "नीला दरवाजा" करना), तो समूह में नोट्स की संख्या वैसी ही रहती है। संरचना अछूती रहती है। यह दोबारा लिखने (rewriting) के खिलाफ अटूट है क्योंकि बिचौलिया डायरी के फॉर्मेट को तोड़े बिना नोट्स की संख्या नहीं बदल सकता।
  • इसकी कमी: यदि बिचौलिया पन्ने हटा देता है, तो काउंट बदल जाता है, और यह चैनल भ्रमित हो जाता है।

"डबल-ब्लाइंड" रक्षा (The "Double-Blind" Defense)

यहाँ असली प्रतिभा है: बिचौलिया जीत नहीं सकता।

  • यदि वे "चॉइस" चैनल को छिपाने के लिए पन्ने मिटाने (delete) की कोशिश करते हैं, तो "काउंट" चैनल (जो संरचना पर निर्भर है) एकदम सही रहता है।
  • यदि वे "काउंट" चैनल को छिपाने के लिए टेक्स्ट को फिर से लिखने (rewrite) की कोशिश करते हैं, तो "चॉइस" चैनल (जो कंटेंट पर निर्भर है) एकदम सही रहता है।
  • दोनों को मिटाने के लिए, बिचौलिये को डायरी का 70% हिस्सा हटाना होगा और लगभग बाकी सब कुछ फिर से लिखना होगा। लेकिन यदि वे ऐसा करते हैं, तो डायरी इतनी खराब हो जाएगी कि वह बेकार हो जाएगी। उन्होंने उसी उत्पाद को नष्ट कर दिया जिसे वे बेचने की कोशिश कर रहे थे!

आंकड़े क्या कहते हैं

शोधकर्ताओं ने इसका परीक्षण दो वास्तविक दुनिया की रोबोट चुनौतियों पर किया: ToolBench (छोटे कार्य, लगभग 1.4 निर्णय चरण प्रति कार्य) और ALFWorld (लंबे कार्य, लगभग 23 से 25 निर्णय चरण)।

  • रोबोट को कोई नुकसान नहीं: TRACE "डिस्टॉर्शन-फ्री" (विकृति-मुक्त) है। आपका रोबोट बिना वॉटरमार्क वाले रोबोट की तरह ही अपने कार्यों में सफल होता है। वास्तव में, ALFWorld पर, बिना वॉटरमार्क वाला रोबोट 82.4% बार सफल रहा, और TRACE 83.6% बार सफल रहा। अन्य वॉटरमार्क्स जिन्होंने जबरदस्ती विकल्प थोपने की कोशिश की, उन्होंने सफलता दर में 8.1 अंकों की गिरावट दर्ज की!
  • डिटेक्शन स्कोर: लंबे कार्यों (ALFWorld) पर, "चॉइस" चैनल ने z = 100 का डिटेक्शन स्कोर प्राप्त किया। यह एक अविश्वसनीय रूप से मजबूत संकेत है। यदि बिचौलिया चरणों का 70% हिस्सा हटा भी देता है, तो भी स्कोर डिटेक्शन लाइन से ऊपर रहता है।
  • रीराइट टेस्ट: जब एक सुपर-स्मार्ट AI ("LLM rewriter") ने वॉटरमार्क छिपाने के लिए डायरी को फिर से लिखने की कोशिश की, तो "काउंट" चैनल बिल्कुल वैसा ही रहा। इसका स्कोर टस से मस नहीं हुआ। वहीं, पुराने वॉटरमार्क्स (जैसे "रेड-ग्रीन" विधि) लगभग शून्य पर गिर गए।
  • धोखाधड़ी की लागत: दोनों चैनलों को एक साथ चुप कराने के लिए, हमलावर को क्रियाओं (actions) के एक निरंतर अंश को भ्रष्ट करना होगा। यह पेपर गणितीय रूप से सिद्ध करता है कि आप केवल "एडिट" करके इससे बाहर नहीं निकल सकते; आपको सेवा को ही नष्ट करना होगा।

TRACE किन चीजों को खारिज करता है

यह पेपर बहुत स्पष्ट है कि यह क्या नहीं करता है:

  • यह उस बिचौलिए के खिलाफ कोई जादुई ढाल नहीं है जो बस आपके रोबोट को पूरी तरह से किसी दूसरे मॉडल से बदल देता है। यदि वे आपके रोबोट का उपयोग करना ही बंद कर देते हैं, तो खोजने के लिए कोई वॉटरमार्क नहीं बचेगा।
  • यह केवल एक उदाहरण होने पर छोटे कार्यों के लिए समाधान नहीं है। ToolBench (छोटे कार्य) पर, एक मजबूत संकेत पाने के लिए आपको लगभग 10 ट्राजेक्टरीज (trajectories) को एक साथ जोड़ने की आवश्यकता होती है क्योंकि एक अकेले छोटे कार्य में पर्याप्त "डिसीजन एंट्रॉपी" (यानी अनिश्चितता/रैंडमनेस) नहीं होती है।
  • यह इस बात पर निर्भर नहीं करता कि बिचौलिया ईमानदार है या नहीं। सिस्टम को विशेष रूप से उस परिदृश्य के लिए डिज़ाइन किया गया है जहाँ सबूत रखने वाला व्यक्ति ही दुश्मन है।

निष्कर्ष (The Bottom Line)

TRACE पहला ऐसा सिस्टम है जो यह साबित कर सकता है कि रोबोट के कार्य उसके निर्माता के हैं, भले ही उस व्यक्ति के पास लॉग्स का पूरा एक्सेस हो और वह उन्हें हटाने या फिर से लिखने की कोशिश करे। यह प्रमाण को दो भागों में विभाजित करके काम करता है: एक जो डिलीशन से बचता है और दूसरा जो रीराइट से बचता है। गणित बताता है कि इसे हराने के लिए, हमलावर को उस सेवा को ही नष्ट करना होगा जिसे वह बेचने की कोशिश कर रहा है। यह एक मजबूत, डिस्टॉर्शन-फ्री तरीका है जो सच्चाई को डायरी में सुरक्षित रखता है, चाहे पेन किसके हाथ में भी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →