← नवीनतम पेपर
💻 computer science

PuzzleMark: Implicit Jigsaw Learning for Robust Code Dataset Watermarking in Neural Code Completion Models

पज़लमार्क (PuzzleMark) न्यूरल कोड कंप्लीशन मॉडल्स के लिए एक सुदृढ़ और अदृश्य वॉटरमार्किंग फ्रेमवर्क है जो डेटासेट की बौद्धिक संपदा की सुरक्षा करने के लिए कोड जटिलता-आधारित कैरियर चयन और एक नवीन वेरिएबल नेम कॉनकैटिनेशन पैटर्न का लाभ उठाता है, जबकि पूर्ण सत्यापन सटीकता प्राप्त करता है और मौजूदा डिटेक्शन विधियों से बचता है।

मूल लेखक: Haocheng Huang, Yuchen Chen, Weisong Sun, Peizhuo Lv, Yuan Xiao, Chunrong Fang, Yang Liu, Xiaofang Zhang

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haocheng Huang, Yuchen Chen, Weisong Sun, Peizhuo Lv, Yuan Xiao, Chunrong Fang, Yang Liu, Xiaofang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ PuzzleMark पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "सीक्रेट सॉस" की चोरी

कल्पना कीजिए कि आप एक शेफ हैं जिसने दुनिया की सबसे अच्छी रेसिपीज़ इकट्ठा करने, उन्हें टेस्ट करने और उन्हें एक विशाल, बेहतरीन कुकबुक (पाक-कला की पुस्तक) में व्यवस्थित करने में वर्षों बिताए हैं। यह कुकबुक आपकी सबसे मूल्यवान संपत्ति है।

अब, कल्पना कीजिए कि कोई व्यक्ति आपको भुगतान किए बिना आपकी कुकबुक का उपयोग करके एक रेस्टोरेंट खोलना चाहता है। वे आपकी किताब की फोटोकॉपी नहीं कर सकते (क्योंकि वह बहुत स्पष्ट होगा), इसलिए वे आपकी किताब को पढ़ने और खाना बनाना सीखने के लिए एक रोबोट को काम पर रखते हैं। एक बार जब रोबोट सीख जाता है, तो वे आपको नौकरी से निकाल देते हैं और अपना खुद का रेस्टोरेंट खोल लेते हैं। आपके पास यह साबित करने का कोई तरीका नहीं है कि रोबोट ने आपकी ही किताब से सीखा है, क्योंकि रोबोट का खाना बनाना बिल्कुल सामान्य खाना बनाने जैसा ही दिखता है।

कंप्यूटर कोड की दुनिया में, यह "कुकबुक" एक कोड डेटासेट (code dataset) है, और "रोबोट" एक AI कोडिंग असिस्टेंट (जैसे GitHub Copilot) है। इन डेटासेट्स को बनाना महंगा और कठिन काम है। लेकिन अभी, यदि कोई आपके विशिष्ट डेटासेट को चुरा लेता है, तो यह साबित करने का कोई अच्छा तरीका नहीं है कि AI को आपके डेटा पर प्रशिक्षित किया गया था।

पुराना समाधान: "स्टिकी नोट" (और यह क्यों विफल हुआ)

पिछले शोधकर्ताओं ने कोड में "वॉटरमार्क" छिपाकर इसे हल करने की कोशिश की। इसे इस तरह सोचें जैसे आप हर 10वें पन्ने में एक स्टिकी नोट चिपका देते हैं जिस पर लिखा होता है, "यह किताब शेफ X की है।"

  • खामी: ये पुराने स्टिकी नोट्स बहुत स्पष्ट थे। यदि कोई चोर किताब को देखता, तो वे आसानी से अजीब नोट्स को पहचान सकते थे, उन्हें फाड़ सकते थे और पन्नों को फेंक सकते थे। या, वे बस किताब को स्कैन कर सकते थे, अजीब पैटर्न को ढूंढ सकते थे और अपने रोबोट को प्रशिक्षित करने से पहले उन्हें हटा सकते थे। "स्टिकी नोट्स" को पहचानना और हटाना बहुत आसान था।

नया समाधान: PuzzleMark

इस पेपर के लेखक PuzzleMark नामक एक नई विधि का प्रस्ताव करते हैं। एक स्टिकी नोट के बजाय, वे कोड को ही एक सूक्ष्म, अदृश्य पहेली में बदल देते हैं।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. सही "छिपाने की जगह" चुनना (Carrier Selection)

कल्पना कीजिए कि आप एक लाइब्रेरी में एक गुप्त संदेश छिपाने की कोशिश कर रहे हैं।

  • गलती: यदि आप संदेश को ऐसी किताब में छिपाते हैं जो पहले से ही अजीब, फटी हुई या किसी अजीब भाषा में लिखी हुई है, तो लोग तुरंत संदेह करेंगे।
  • PuzzleMark का समाधान: सिस्टम पूरी लाइब्रेरी को स्कैन करता है और एक "जटिलता मीटर" (complexity meter) का उपयोग करके उन किताबों को ढूंढता है जो पूरी तरह से सामान्य, अच्छी तरह से लिखी गई और आम हैं। यह संदेश छिपाने के लिए पहले से ही अस्त-व्यस्त या संदिग्ध दिखने वाली किताबों में संदेश छिपाने से मना कर देता है। केवल सबसे "प्राकृतिक" दिखने वाले कोड स्निपेट्स को चुनने से, वॉटरमार्क को पहचानना बहुत कठिन हो जाता है।

2. "जिग्सॉ पहेली" का तरीका (Concatenation Pattern)

पुराने वॉटरमार्क एक सरल पैटर्न पर निर्भर थे: "यदि आप key शब्द देखते हैं, तो अगला शब्द value होना चाहिए।" यह एक कोड की तरह है जो कहता है: "यदि आप एक लाल कार देखते हैं, तो उसके बगल में एक नीली कार होनी चाहिए।" चोर इस पैटर्न को आसानी से देख सकते हैं और इसे तोड़ सकते हैं।

PuzzleMark एक "जिग्सॉ पहेली" (Jigsaw Puzzle) दृष्टिकोण का उपयोग करता है:

  • एक निश्चित नियम के बजाय, यह कोड में मौजूद दो मौजूदा वेरिएबल नामों (जैसे key और iterator) को लेता है और उन्हें आपस में मिलाकर एक नया, थोड़ा असामान्य नाम बनाता है (जैसे key_iterator)।
  • यह दो सामान्य पहेली के टुकड़ों को लेकर उन्हें एक नए टुकड़े के रूप में जोड़ने जैसा है जो ऐसा दिखता है जैसे कि वह वहीं का हिस्सा हो, लेकिन केवल तभी जब आप उस "गुप्त गोंद" (secret glue) को जानते हों।
  • क्योंकि कोड काफी हद तक सामान्य दिखता है, और "गोंद" विशिष्ट कोड स्निपेट के आधार पर बदलता रहता है, इसलिए चोर के लिए बिना कोड को तोड़े इसे ढूंढना और हटाना अविश्वसनीय रूप से कठिन है।

3. "ब्लैक बॉक्स" परीक्षण (Verification)

आप कैसे साबित करेंगे कि AI ने आपकी किताब से सीखा है?

  • आपको AI के दिमाग के अंदर देखने की ज़रूरत नहीं है। आपको बस एक विशिष्ट "ट्रिगर" (छिपे हुए पहेली टुकड़ों वाला एक विशिष्ट कोड स्निपेट) देना होगा।
  • यदि AI को आपके वॉटरमार्क किए गए डेटासेट पर प्रशिक्षित किया गया था, तो वह स्वाभाविक रूप से आपके द्वारा बनाए गए "गोंद वाले" नाम के साथ कोड को पूरा करेगा।
  • यदि इसे आपके डेटा पर प्रशिक्षित नहीं किया गया था, तो यह केवल एक सामान्य नाम का अनुमान लगाएगा।
  • लेखक एक सांख्यिकीय परीक्षण (Fisher's exact test) का उपयोग करते हैं ताकि यह देखा जा सके कि क्या AI का सही अनुमान लगाना महज एक संयोग से कहीं अधिक है। यदि गणित कहता है "हाँ," तो आपके पास प्रमाण है।

यह बेहतर क्यों है? (परिणाम)

पेपर ने पुराने तरीकों के मुकाबले PuzzleMark का परीक्षण किया और पाया कि:

  • यह अदृश्य है: मानव डेवलपर्स और स्वचालित टूल वॉटरमार्क किए गए कोड और सामान्य कोड के बीच अंतर नहीं कर सके। यह एक भूत की तरह अदृश्य था।
  • यह मजबूत है: भले ही चोरों ने संदिग्ध दिखने वाले कोड को हटाने के लिए डेटासेट को "साफ" करने की कोशिश की, वॉटरमार्क बना रहा। भले ही उन्होंने लाखों अन्य साफ कोड फाइलों को मिलाकर इसे "पतला" (dilute) करने की कोशिश की, वॉटरमार्क फिर भी पता लगाने योग्य था।
  • यह कुछ भी खराब नहीं करता: वॉटरमार्क किए गए कोड पर प्रशिक्षित AI मॉडल, साफ कोड पर प्रशिक्षित मॉडलों के समान ही अच्छा प्रदर्शन करते हैं। "गोंद" ने रेसिपी को खराब नहीं किया।

निष्कर्ष

PuzzleMark कोड डेटासेट्स की बौद्धिक संपदा (intellectual property) की रक्षा करने का एक नया, मजबूत तरीका है। स्पष्ट "स्टिकी नोट्स" छोड़ने के बजाय, जो चोर आसानी से फाड़ सकते हैं, यह स्वामित्व के प्रमाण को कोड के प्राकृतिक प्रवाह के भीतर छिपा देता है, जैसे कि एक गुप्त रेसिपी का घटक जो केवल तभी प्रकट होता है जब आप व्यंजन बनाने की कोशिश करते हैं। यह सुनिश्चित करता है कि यदि कोई आपके डेटा को AI को प्रशिक्षित करने के लिए चुराता है, तो आप अदालत में इसे साबित कर सकते हैं, भले ही उन्होंने अपने पदचिह्नों को छिपाने की कोशिश की हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →