← नवीनतम पेपर
🤖 machine learning

Robust Spectral Watermark for Synthetic Tabular Data

यह शोध पत्र TAB-DRW को प्रस्तुत करता है, जो एक कुशल और सुदृढ़ पोस्ट-एडिटिंग वॉटरमार्किंग योजना है जो सिंथेटिक सारणीबद्ध डेटा (tabular data) के फ्रीक्वेंसी डोमेन में संकेतों को एम्बेड करती है ताकि डेटा की शुद्धता बनाए रखते हुए और मिश्रित फीचर प्रकारों का समर्थन करते हुए ट्रैसेबिलिटी सुनिश्चित की जा सके और हमलों का प्रतिरोध किया जा सके।

मूल लेखक: Yizhou Zhao, Xiang Li, Peter Song, Qi Long, Weijie Su

प्रकाशित 2026-05-12
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yizhou Zhao, Xiang Li, Peter Song, Qi Long, Weijie Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जिसने एक नई डिश के लिए एक स्वादिष्ट, उच्च-गुणवत्ता वाली रेसिपी बनाई है। आप इस रेसिपी को दुनिया के साथ साझा करना चाहते हैं ताकि अन्य लोग इससे सीख सकें या इसे बना सकें। हालाँकि, आपको डर है: क्या होगा अगर कोई आपकी रेसिपी ले ले, दावा करे कि इसका आविष्कार उन्होंने किया है, या इसका उपयोग किसी हानिकारक संस्करण को बनाने के लिए करे? आपको एक ऐसे तरीके की आवश्यकता है जिससे आप यह साबित कर सकें, "यह मेरी रेसिपी है," बिना स्वाद को खराब किए या सामग्री को इतना बदले बिना कि वह मूल डिश न रहे।

यह ठीक वही समस्या है जिसे Tab-Drw हल करता है, लेकिन यहाँ रेसिपी के बजाय, यह सिंथेटिक टैबुलर डेटा (जैसे कि रोगी के रिकॉर्ड, वित्तीय लेनदेन, या ग्राहकों की जानकारी वाली स्प्रेडशीट्स) से संबंधित है जिसे आर्टिफिशियल इंटेलिजेंस द्वारा बनाया गया है।

यहाँ यह पेपर इस समाधान को सरल उपमाओं का उपयोग करके समझाता है:

1. समस्या: अदृश्य स्याही जिसकी गंध आती है

वर्तमान में, जब AI नकली डेटा बनाता है, तो यह पहचानना कठिन होता है कि वह असली है या नकली, या उसे किसने बनाया है। मौजूदा "वॉटरमार्क" (डिजिटल हस्ताक्षर) एक गीले कागज पर स्टैम्प लगाने की कोशिश करने जैसा है:

  • बहुत भारी: कुछ विधियों के लिए आवश्यक है कि AI एक जटिल, धीमा "अनडू" (undo) प्रोसेस चलाए ताकि डेटा पर स्टैम्प लगाया जा सके, जो गणनात्मक रूप से बहुत महंगा है (जैसे कि एक पत्र पर हस्ताक्षर करने के लिए एक विशाल मशीन की आवश्यकता होना)।
  • नाजुक: यदि कोई पंक्तियों (rows) को इधर-उधर कर देता है, थोड़ा शोर (noise) जोड़ देता है, या कुछ कॉलम हटा देता है (जैसे कि किसी ने आपकी रेसिपी पर कॉफी गिरा दी हो), तो वॉटरमार्क गायब हो जाता है।
  • असंगत: कुछ विधियाँ केवल संख्याओं पर काम करती हैं, और वे डेटा विफल हो जाती हैं जिसमें संख्या और श्रेणियों (जैसे "आयु" और "लिंग") का मिश्रण हो।

2. समाधान: Tab-Drw (द "फ्रीक्वेंसी डोमेन" स्टैम्प)

लेखक Tab-Drw का प्रस्ताव करते हैं, जो एक हल्के वजन वाले तरीके के रूप में कार्य करता है जो एक चतुर, अदृश्य स्टैम्प की तरह है। यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

चरण A: "स्मूदी" रूपांतरण (Preprocessing)

सबसे पहले, डेटा अव्यवस्थित है। कुछ कॉलम बड़े नंबर (आय) हैं, कुछ बहुत छोटे (आयु), और कुछ श्रेणियां (लिंग) हैं।

  • उपमा: कल्पना करें कि आप साबुत सेब, पत्थर और पानी के साथ स्मूदी मिलाने की कोशिश कर रहे हैं। यह अच्छी तरह से नहीं घुलेगा।
  • समाधान: Tab-Drw एक गणितीय उपकरण जिसका नाम Yeo-Johnson Transformation है, का उपयोग करके सब कुछ एक "स्मूदी" की तरह समान रूप से मिलाने के लिए करता है। यह सभी अलग-अलग पैमानों को एक मानक "स्मूदी" में बदल देता है जहाँ हर सामग्री एक ही स्तर पर होती है।

चरण B: "ध्वनि तरंग" का दृश्य (Frequency Domain)

डेटा को संख्याओं की सूची (पंक्तियों और कॉलम) के रूप में देखने के बजाय, Tab-Drw इसे एक ध्वनि तरंग (sound wave) या एक संगीत के स्वर (musical chord) के रूप में देखता है।

  • उपमा: यदि आप एक गाने को नोट्स की सूची के रूप में देखते हैं, तो इसमें रहस्य छिपाना कठिन है। लेकिन यदि आप गाने की ध्वनि तरंग को देखते हैं, तो आप इसके "काल्पनिक भाग" (imaginary parts - वे अदृश्य कंपन जो ध्वनि बनाते हैं) देख सकते हैं।
  • तरीका: यह विधि Discrete Fourier Transform (DFT) का उपयोग करके डेटा को इस "ध्वनि तरंग" वाले दृश्य में बदल देती है।

चरण C: "गुप्त कोड" (Embedding)

अब, यहाँ जादू है। सिस्टम 0 और 1 का एक गुप्त, यादृच्छिक पैटर्न (जैसे एक गुप्त कोड) बनाता है।

  • उपमा: कल्पना करें कि ध्वनि तरंग में "काल्पनिक कंपन" हैं। सिस्टम इन कंपनों को धीरे से इस तरह बदलता है कि वे गुप्त कोड से मेल खाएं।
  • "कोमल" स्पर्श: यह एक कठोर बदलाव नहीं करता (जो स्मूदी को खराब कर देगा)। इसके बजाय, यह एक "सॉफ्ट" समायोजन का उपयोग करता है। यदि कंपन पहले से ही कोड के करीब है, तो यह उसे वैसे ही छोड़ देता है। यदि यह दूर है, तो यह इसे धीरे से करीब खींच लेता है। यह सुनिश्चित करता है कि डेटा अभी भी बिल्कुल वैसा ही दिखे और व्यवहार करे जैसा मूल था।

चरण D: "रिवर्स स्मूदी" (Reconstruction)

अंत में, यह ध्वनि तरंग को वापस मूल स्प्रेडशीट प्रारूप में बदल देता है।

  • परिणाम: स्प्रेडशीट इंसान या कंप्यूटर प्रोग्राम को बिल्कुल वैसी ही दिखती है। "वॉटरमार्क" अदृश्य गणितीय संरचना के भीतर छिपा हुआ है, न कि दृश्य संख्याओं में।

3. आप गुप्त कोड कैसे ढूंढते हैं? (Detection)

जब कोई यह जांचना चाहता है कि कोई स्प्रेडशीट वॉटरमार्क वाली है या नहीं, तो उन्हें मूल AI मॉडल की आवश्यकता नहीं होती है। उन्हें बस गुप्त कुंजी (secret key) की आवश्यकता होती है।

  • उपमा: कल्पना करें कि आपके पास एक विशेष "ट्यूनिंग फोर्क" (tuning fork) है (चाबी)। आप स्प्रेडशीट को थपथपाते हैं, और यदि यह वॉटरमार्क वाला है, तो ट्यूनिंग फोर्क उस गुप्त कोड के साथ पूर्ण सामंजस्य में कंपन करेगा जो इसके अंदर छिपा है। यदि यह वॉटरमार्क वाला नहीं है, तो कंपन कमजोर या अराजक होगा।
  • "रैंक" का तरीका: यह सुनिश्चित करने के लिए कि गुप्त कोड पंक्तियों को हटाने या शोर जोड़ने पर भी बना रहे, सिस्टम डेटा पंक्तियों के रैंकिंग (जैसे, "यह पंक्ति 50वीं सबसे बड़ी है") के आधार पर कोड उत्पन्न करता है। रैंकिंग बहुत स्थिर होती है; भले ही आप थोड़ा शोर जोड़ दें, 50वीं सबसे बड़ी पंक्ति अभी भी लगभग 50वीं सबसे बड़ी ही रहती है। यह वॉटरमार्क को अविश्वसनीय रूप से कठिन बना देता है।

4. यह बेहतर क्यों है?

पेपर का दावा है कि Tab-Drw चार मोर्चों पर जीतता है:

  1. गति: यह तेज़ है। इसे फिर से चलाने के लिए भारी AI मॉडल की आवश्यकता नहीं है; यह बस तैयार डेटा को संपादित करता है।
  2. मजबूती (Robustness): यह "हमलों" से बच जाता है। यदि कोई पंक्तियाँ हटाने, क्रम बदलने या यादृच्छिक शोर जोड़ने (जैसे कॉफी गिराना) की कोशिश करता है, तो भी वॉटरमार्क पता लगाने योग्य रहता है।
  3. बहुमुखी प्रतिभा: यह बिना खराब हुए मिश्रित डेटा (संख्या और श्रेणियां) पर काम करता है।
  4. शुद्धता (Fidelity): डेटा उच्च गुणवत्ता का बना रहता है। "स्मूदी" का स्वाद बिल्कुल वैसा ही रहता है; गुप्त कोड बस अदृश्य है।

5. "प्राइवेसी" अपग्रेड

लेखक एक "प्राइवेसी-एन्हांस्ड" संस्करण का भी उल्लेख करते हैं।

  • उपमा: कल्पना करें कि आपके पास ताश की एक गड्डी है। वॉटरमार्क लगाने से पहले, आप एक गुप्त कुंजी का उपयोग करके गड्डी को फेंटते हैं। स्टैम्प लगाने के बाद, आप उन्हें मूल क्रम में वापस अन-शफल (un-shuffle) करते हैं।
  • क्यों? इसका मतलब है कि भले ही कोई डेटा चुरा ले, वे गुप्त कोड का पता नहीं लगा सकते जब तक कि उन्हें यह पता न हो कि आपने अपनी गड्डी को ठीक कैसे फेंटा था। यह "स्पूफिंग" (वॉटरमार्क की नकल करना) को रोकता है और विभिन्न संगठनों को एक ही प्रकार के डेटा पर अलग-अलग कुंजियों का उपयोग करने की अनुमति देता है बिना एक-दूसरे को भ्रमित किए।

सारांश

Tab-Drw AI-जनरेटेड स्प्रेडशीट्स के लिए एक हाई-टेक, अदृश्य स्टैम्प की तरह है। यह डेटा को "ध्वनि तरंग" में बदल देता है, अदृश्य कंपनों में एक गुप्त कोड छिपा देता है, और फिर इसे वापस मूल रूप में बदल देता है। परिणाम एक ऐसा डेटासेट है जो पूरी तरह से सामान्य दिखता और व्यवहार करता है, लेकिन इसमें एक छिपा हुआ, अटूट हस्ताक्षर होता है जो इसके उद्गम को सिद्ध करता है, भले ही कोई इसके साथ छेड़छाड़ करने की कोशिश करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →