Position: No Retroactive Cure for Infringement during Training
यह शोध पत्र तर्क देता है कि मशीन अनलर्निंग जैसी पोस्ट-हॉक शमन रणनीतियाँ जनरेटिव एआई में कॉपीराइट उल्लंघन के लिए उत्तरदायित्व को पूर्वव्यापी रूप से ठीक नहीं कर सकती हैं क्योंकि कानूनी जिम्मेदारी अंतिम आउटपुट के बजाय अनधिकृत अधिग्रहण और प्रशिक्षण प्रक्रिया पर टिकी होती है, जो सत्यापन योग्य एक्स-एंटे (ex-ante) अनुपालन की ओर बदलाव को आवश्यक बनाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य संदेश: आप केक को "अन-बेक" (बनाकर वापस पहले जैसा) नहीं कर सकते
कल्पना कीजिए कि एक बेकर ने अपने पड़ोसी से आटा, चीनी और अंडे चुराए ताकि वह एक विशाल, स्वादिष्ट केक बना सके। फिर बेकर उस केक को बेच देता है। बाद में, पड़ोसी मुकदमा करता है। बेकर कहता है, "चिंता न करें! मैंने केक पर एक विशेष फ़िल्टर लगाया है ताकि आप चोरी की गई सामग्री का स्वाद न ले सकें, और मैंने अपनी रेसिपी बुक को फेंक देने का वादा भी किया है।"
यह पेपर तर्क देता है कि यह बचाव काम नहीं करता।
कानूनी समस्या केक (AI का आउटपुट) नहीं थी; समस्या चोरी (ट्रेनिंग डेटा) थी। एक बार जब बेकर ने सामग्री चुराई और उन्हें बैटर में मिला दिया, तो अपराध पहले ही हो चुका था। आप बाद में केक का स्वाद बदलकर सामग्री को "अन-स्टील" (चोरी से वापस लाना) नहीं कर सकते।
तीन मुख्य तर्क
1. "पूर्ण कार्य" का नियम (The Completed Act)
उपमा: कॉपीराइट उल्लंघन को एक बैंक डकैती की तरह समझें।
यदि कोई लुटेरा बैंक में घुसकर $1 मिलियन चुरा लेता है, तो अपराध उसी क्षण पूरा हो जाता है जब पैसा तिजोरी से बाहर निकलता है। इससे कोई फर्क नहीं पड़ता कि लुटेरा बाद में पछतावा करता है, पैसा वापस कर देता है, या बैंक को अलग दिखाने के लिए उसे पेंट कर देता है। डकैती तो हो चुकी है।
पेपर का बिंदु:
AI डेवलपर्स अक्सर तर्क देते हैं कि यदि वे चोरी किए गए डेटा को "अनलर्न" (भूलना) कर सकते हैं या AI के जवाबों को फ़िल्टर कर सकते हैं, तो वे सुरक्षित हैं। लेखक कहते हैं—नहीं।
- चोरी का क्षण: जब एक AI किसी किताब या छवि को डाउनलोड और कॉपी करता है ताकि उस पर ट्रेनिंग ली जा सके, तो वही "डकैती" है।
- कोई पूर्वव्यापी उपचार नहीं: बाद में फ़ाइल को डिलीट करना या AI के आउटपुट को फ़िल्टर करना, मुकदमे के शुरू होने के बाद लुटेरे द्वारा पैसा वापस करने जैसा है। यह जुर्माने को कम कर सकता है, लेकिन यह इस तथ्य को नहीं मिटाता कि चोरी हुई थी। दायित्व (Liability) उस क्षण "लॉक" हो जाता है जब डेटा को कॉपी किया गया था।
2. "मशीन में भूत" (मॉडल वेट्स)
उपमा: कल्पना कीजिए कि आपने एक बार पढ़कर एक गुप्त रेसिपी याद कर ली। भले ही आप भौतिक कागज को जला दें (डेटा डिलीट कर दें), रेसिपी अभी भी आपके दिमाग में मौजूद है (AI के वेट्स)।
यदि आप एक ऐसे शेफ हैं जिसने चोरी की हुई रेसिपी याद की है, तो आप यह नहीं कह सकते, "मैंने कागज जला दिया, इसलिए मैंने रेसिपी नहीं चुराई।" ज्ञान अभी भी आपके अंदर है।
पेपर का बिंदु:
भले ही AI को "अनलर्न" या फ़िल्टर किया गया हो, चोरी किए गए डेटा का "भूत" मॉडल की गणितीय संरचना (इसके वेट्स) में बना रहता है।
- स्थिर प्रतियां (Fixed Copies): कानून कहता है कि एक "कॉपी" तब मौजूद होती है जब वह एक स्थिर स्थान (जैसे हार्ड ड्राइव) पर संग्रहीत होती है और मशीन द्वारा पढ़ी जा सकती है। AI का मस्तिष्क वही "स्थिर स्थान" है।
- रिकवरेबल (Recoverable): भले ही AI किसी विशिष्ट उपयोगकर्ता को "नमस्ते" कहने से मना कर दे, एक हैकर विशेष उपकरणों का उपयोग करके AI के मस्तिष्क से चोरी की गई जानकारी को निकालने में सक्षम हो सकता है। क्योंकि जानकारी तकनीकी रूप से अभी भी "वहाँ" है, इसलिए उल्लंघन वास्तव में समाप्त नहीं हुआ है।
3. "कॉन्ट्रैक्ट ट्रैप" (यह केवल कॉपीराइट के बारे में नहीं है)
उपमा: कल्पना कीजिए कि आप एक निजी क्लब में प्रवेश करते हैं। दरवाजे पर बोर्ड लगा है, "फोटो लेना मना है।" आप फिर भी फोटो खींच लेते हैं। बाद में, आप कहते हैं, "लेकिन फोटो कॉपीराइट नहीं है, इसलिए मैं ठीक हूँ!"
क्लब का मालिक कहता है, "आपने प्रवेश करके और संकेत को अनदेखा करके अनुबंध (Contract) तोड़ दिया है।"
पेपर का बिंदु:
भले ही डेटा कॉपीराइट नहीं है (या यदि "फेयर यूज़" लागू हो सकता है), डेवलपर्स अनुबंध तोड़ने के लिए भी मुकदमे का सामना कर सकते हैं।
- सेवा की शर्तें (Terms of Service): कई वेबसाइटें कहती हैं, "हमारे कंटेंट का उपयोग AI ट्रेनिंग के लिए न करें।" यदि कोई AI इसे अनदेखा करता है और डेटा को स्क्रैप करता है, तो यह अनुबंध का उल्लंघन है।
- अनुचित प्रतिस्पर्धा (Unfair Competition): यदि कोई कंपनी एक विशेष डेटासेट तैयार करने में लाखों खर्च करती है, और एक AI प्रतिस्पर्धी उत्पाद बनाने के लिए उसे मुफ्त में चुरा लेता है, तो यह "फ्री-राइडिंग" है। यह वैसा ही है जैसे कोई आपकी ब्लूप्रिंट चुराकर बगल में एक सस्ता घर बना ले। आप इसके लिए भी मुकदमा झेल सकते हैं भले ही ब्लूप्रिंट स्वयं कॉपीराइट नहीं हों।
"हेड स्टार्ट" की समस्या
उपमा: एक दौड़ की कल्पना करें। एक धावक निजी खेत के माध्यम से शॉर्टकट लेकर धोखाधड़ी करता है। वह फिनिश लाइन पर 10 मिनट पहले पहुँच जाता है।
बाद में, जज कहता है, "ठीक है, आपको वापस शुरुआती रेखा तक जाना होगा और उस मैप को डिलीट करना होगा जिसका आपने उपयोग किया था।"
क्या इससे ठीक हो जाएगा? नहीं। धावक के पास अभी भी शॉर्टकट की याद और जल्दी खत्म करने का लाभ है। उनके पास अभी भी "हेड स्टार्ट" है।
पेपर का बिंदु:
AI कंपनियाँ चोरी किए गए डेटा पर ट्रेनिंग करके भारी लाभ प्राप्त करती हैं। वे लाखों डॉलर और महीनों का समय बचा लेती हैं।
- अनुचित संवर्धन (Unjust Enrichment): कानून कहता है कि आप धोखाधड़ी से कमाया गया लाभ नहीं रख सकते।
- उपचार (Remedy): कभी-कभी, एकमात्र उचित दंड यह होता है कि कंपनी को पूरा AI मॉडल फेंक देने (ताकि "हेड स्टार्ट" खत्म हो जाए) और नए सिरे से शुरू करने के लिए मजबूर किया जाए। केवल सोर्स फाइलों को डिलीट करना पर्याप्त नहीं है क्योंकि AI पहले ही शॉर्टकट सीख चुका है।
समाधान: "एक्स-एंटी" अनुपालन (बनाने से पहले जांचें)
पेपर निष्कर्ष निकालता है कि हमें AI बनने के बाद गड़बड़ी को "ठीक" करने की कोशिश करने के बजाय, हमें बेकिंग शुरू करने से पहले सामग्री की जांच करने की आवश्यकता है।
इंजीनियरों के लिए (शेफ):
- ग्लास पाइपलाइन: एक ब्लैक बॉक्स के बजाय, ऐसे AI सिस्टम बनाएं जहां आप साबित कर सकें कि हर सामग्री कहाँ से आई है। डिजिटल टैग (जैसे रसीद) का उपयोग करें जिससे पता चले कि आपके पास हर डेटा के लिए अनुमति है।
- मॉडेल्स के लिए Git: यदि आप गलती से किसी चोरी की गई सामग्री का उपयोग करते हैं, तो उसे "अनलर्न" करने की कोशिश न करें। इसके बजाय, उस मॉडल के वर्जन पर वापस जाएं जो उस सामग्री को जोड़ने से पहले का था और वहां से नए सिरे से शुरुआत करें।
नीति निर्माताओं के लिए (क्लब के मालिक):
- डेटा ट्रस्ट: एक केंद्रीय "सुपर-मार्केट" बनाएं जहाँ AI कंपनियाм आसानी से डेटा लाइसेंस खरीद सकें, बजाय इसके कि वे लाखों व्यक्तिगत कलाकारों से अनुमति मांगने की कोशिश करें।
- ऑप्ट-इन, न कि ऑप्ट-आउट: वर्तमान में, कलाकारों को "ना" कहना पड़ता है। पेपर सुझाव देता है कि डिफ़ॉल्ट रूप से "ना" होना चाहिए जब तक कि कलाकार स्पष्ट रूप से "हाँ" न कहे। यह जिम्मेदारी AI कंपनी पर डालता है कि वह पूछे, न कि कलाकार पर कि वह उनके पीछे जाए।
निचोड़
"सच्चा अनुपालन इस बारे में नहीं है कि एक मॉडल क्या कहता है, बल्कि इस बारे में है कि वह कैसे जानता है।"
आप दीवारों को पेंट करके गंदे आधार को साफ नहीं कर सकते। यदि AI को चोरी किए गए डेटा पर प्रशिक्षित किया गया था, तो मॉडल स्वयं "दूषित" है। एकमात्र तरीका यह सुनिश्चित करना है कि मॉडल को प्रशिक्षित करने से पहले आपके पास डेटा का उपयोग करने का अधिकार हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।