← नवीनतम पेपर
🤖 machine learning

Generative AI Training and Copyright Law

यह शोध पत्र यह तर्क देता है कि जनरेटिव एआई प्रशिक्षण के लिए वर्तमान कानूनी औचित्य, जैसे कि अमेरिका में "फेयर यूज़" और यूरोप में "टेक्स्ट एंड डेटा माइनिंग" अपवाद, मौलिक रूप से त्रुटिपूर्ण हैं क्योंकि एआई प्रशिक्षण टीडीएम (TDM) से भिन्न है और डेटा मेमोराइजेशन के माध्यम से स्वतंत्र कॉपीराइट जोखिमों को शामिल करता है, और साथ ही सभी हितधारकों के लिए निष्पक्ष प्रथाओं को स्थापित करने में ISMIR की भूमिका का प्रस्ताव भी देता है।

मूल लेखक: Sebastian Stober, Tim W. Dornis

प्रकाशित 2026-03-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sebastian Stober, Tim W. Dornis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "जेनरेटिव एआई ट्रेनिंग और कॉपीराइट कानून" (Generative AI Training and Copyright Law) के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: महान एआई भोज (The Great AI Feast)

कल्पना कीजिए कि संगीत, कला और लेखन की दुनिया एक विशाल, अंतहीन बुफे (buffet) की तरह है। दशकों से, शेफ (मानव रचनाकार) स्वादिष्ट व्यंजन बना रहे हैं।

अब, एक नए प्रकार का शेफ आया है: जेनरेटिव एआई (Generative AI)। यह रोबोट शेफ सीखना चाहता है कि खाना कैसे बनाया जाता है। इसे करने के लिए, यह केवल कुछ निवाले नहीं चखता; यह पूरे बुफे को एक साथ निगल जाता है। यह मानव रचनात्मकता के "स्वाद" को समझने के लिए लाखों गीतों, पुस्तकों और पेंटिंग्स को खा जाता है।

यह पेपर एक बहुत ही गंभीर सवाल पूछता है: क्या रोबोट के लिए मूल शेफों से अनुमति लिए बिना पूरा बुफे खाना कानूनी है?

लेखक, सेबस्टियन स्टोबर और टिम डब्ल्यू. डोर्निस कहते हैं: "शायद नहीं।" उनका तर्क है कि रोबोट केवल भोजन का "अध्ययन" नहीं कर रहा है; यह एक नकलची शेफ बनने की कोशिश कर रहा है जो ऐसे व्यंजन परोस सके जिनका स्वाद बिल्कुल मूल व्यंजनों जैसा हो।


1. "स्टडी हॉल" बनाम "नकलची रसोई" (The "Study Hall" vs. The "Copycat Kitchen")

लंबे समय से, एआई बनाने वाली कंपनियाँ तर्क दे रही हैं: "हम चोरी नहीं कर रहे हैं; हम केवल अध्ययन कर रहे हैं। हम 'टेक्स्ट एंड डेटा माइनिंग' (TDM) कर रहे हैं।"

  • पुरानी उपमा (TDM): कल्पना कीजिए कि एक छात्र पुस्तकालय में है। वह यह जानने के लिए एक किताब पढ़ता है कि "प्रेम" शब्द कितनी बार आता है, या वाक्य संरचना का विश्लेषण करता है। वह नोट्स लेता है, लेकिन वह मूल के जैसा दिखने वाली नई किताब नहीं लिखता। यह आमतौर पर कानून द्वारा अनुमत है।
  • नई वास्तविकता (GenAI): एआई केवल नोट्स नहीं ले रहा है। यह पूरी किताब, पूरी धुन और पूरी शैली को याद कर रहा है, ताकि वह एक नया गाना लिख सके जो मूल कलाकार जैसा ही सुनाई दे।

लेखकों का तर्क: कानून के पास "अध्ययन" (TDM) और "फेयर यूज़" (जैसे पैरोडी या आलोचना) के लिए अपवाद हैं। लेकिन लेखक तर्क देते हैं कि एआई को नई सामग्री बनाने (generate) के लिए प्रशिक्षित करना, अध्ययन करने से अलग है। यह एक छात्र द्वारा गणित का टेस्ट देने (विश्लेषण) और एक जालसाज द्वारा पिकासो की पेंटिंग की इतनी सटीक नकल करने के बीच के अंतर जैसा है कि वह गैलरी को भी धोखा दे दे (निर्माण)। कानून इस नए प्रकार के "जालसाजी" को कवर नहीं कर सकता है।

2. "फोटोग्राफिक मेमोरी" की समस्या (The "Photographic Memory" Problem)

यहाँ सबसे डरावना हिस्सा है। भले ही एआई संगीत के नियमों को "सीख" रहा हो, लेकिन उसकी एक बुरी आदत है: उसकी फोटोग्राफिक मेमोरी है।

  • उपमा: कल्पना कीजिए कि आप एक तोते को लाखों किताबें पढ़कर बोलना सिखाते हैं। अंततः, तोता केवल यह नहीं सीखता कि कैसे बोलना है; वह उन किताबों के विशिष्ट वाक्यों को शब्द-दर-शब्द बोलने लगता है।
  • कानूनी जोखिम: यदि आप एआई से "कलाकार X की शैली में एक गाना लिखें" कहते हैं, तो यह गलती से कलाकार X के वास्तविक गाने के 90% समान गाना उगल सकता है।
  • यह क्यों महत्वपूर्ण है: लेखक बताते हैं कि यह "याद रखना" (memorization) अपने आप में एक कानूनी समस्या है। भले ही एआई को सीखने के लिए डेटा "खाने" की अनुमति दी गई हो, यदि वह एक कॉपीराइट वाले गाने को वापस "उगल" (regurgitate) देता है, तो वह कॉपीराइट उल्लंघन है।

वास्तविक उदाहरण: पेपर में एक मुकदमे का उल्लेख है जहाँ एक म्यूजिक कंपनी ने एआई पर मुकदमा किया क्योंकि एआई वास्तविक गानों के लगभग समान बोल गा रहा था। जर्मनी की एक अदालत ने हाल ही में कहा: "हाँ, एआई ने बोलों को याद कर लिया था, और यह अवैध है।"

3. "रेसिपी बुक" की दुविधा (The "Recipe Book" Dilemma)

तो, हम क्या करें? लेखक डॉक्यूमेंटेशन (Documentation) नामक एक नए तरीके का सुझाव देते हैं।

  • वर्तमान स्थिति: एआई कंपनियाँ अक्सर कहती हैं, "हमने इंटरनेट से डेटा निकाला (scraped)।" यह एक शेफ के कहने जैसा है, "मैंने हर जगह से सामग्री ली, लेकिन मुझे नहीं पता कि टमाटर किस खेत से आए थे।"
  • प्रस्तावित समाधान: लेखक चाहते हैं कि एआई डेवलपर्स द्वारा बनाए गए प्रत्येक मॉडल के लिए एक विस्तृत रेसिपी कार्ड रखा जाए।
    • बुनियादी स्तर: "हमने इन वेबसाइटों का उपयोग किया।"
    • मध्यवर्ती स्तर: "हमने इन विशिष्ट गीतों (ID नंबरों के साथ) का उपयोग किया।"
    • उन्नत स्तर: "हमने हर ऑडियो क्लिप को उसके मूल मालिक से मिलाने के लिए फिंगरप्रिंटिंग तकनीक का उपयोग किया।"

यह कैसे मदद करता है:

  1. कलाकारों के लिए: वे रेसिपी कार्ड देख सकते हैं और कह सकते हैं, "हे, आपने मेरे गाने का उपयोग किया! मैंने इसके लिए सहमति नहीं दी थी। इसे बाहर निकालो!"
  2. एआई कंपनियों के लिए: यदि उनके पास एक साफ रेसिपी कार्ड है, तो वे साबित कर सकते हैं कि उन्होंने निष्पक्ष होने का प्रयास किया।
  3. शोधकर्ताओं के लिए: यह "ब्लैक बॉक्स" के रहस्य को रोकता है। हम अंततः देख सकते हैं कि एआई ने वास्तव में क्या सीखा है।

4. "म्यूजिक रिसर्च" की सुपरपावर (The "Music Research" Superpower)

यह पेपर MIR (Music Information Retrieval) समुदाय के लिए लिखा गया है। ये वे वैज्ञानिक हैं जो गानों को पहचानने, समान धुनों को खोजने और संगीत पुस्तकालयों को व्यवस्थित करने वाले उपकरण बनाते हैं।

कार्य के लिए आह्वान (Call to Action):
लेखक कहते हैं, "आप लोग घास के ढेर में सुई खोजने के विशेषज्ञ हैं!"

  • एआई कंपनियों को अंधाधुंध संगीत स्क्रैप करने देने के बजाय, संगीत अनुसंधान समुदाय को डेटा को फिंगरप्रिंट करने के उपकरण बनाने चाहिए।
  • उन्हें एक ऐसी प्रणाली बनानी चाहिए जहाँ एआई प्रशिक्षण में उपयोग किए गए प्रत्येक डेटासेट को मालिक के नाम और अनुमति की स्थिति के साथ टैग किया जाए।
  • उन्हें उन कंपनियों के साथ काम करने से इनकार करना चाहिए जो इन नियमों का पालन नहीं करती हैं, ठीक वैसे ही जैसे एक शेफ जो बिना लाइसेंस वाले आपूर्तिकर्ता से सामग्री लेने से मना कर देता है।

सारांश: तीन मुख्य बातें (Summary: The Three Takeaways)

  1. "फेयर यूज़" का बचाव कमजोर है: केवल इसलिए कि एक एआई "सीख" रहा है, इसका मतलब यह नहीं है कि बिना अनुमति के सभी के कॉपीराइट वाले काम का उपयोग करना स्वतः ही कानूनी है।
  2. याद रखना (Memorization) खतरनाक है: भले ही प्रशिक्षण कानूनी हो, यदि एआई गलती से एक कॉपीराइट वाला गाना उगल देता है, तो कंपनी मुसीबत में पड़ सकती है।
  3. पारदर्शिता ही कुंजी है: हमें यह अनुमान लगाना बंद करना होगा कि एआई किस डेटा का उपयोग करता है। हमें एआई मॉडल के लिए एक "पोषण लेबल" (nutrition label) की आवश्यकता है जो यह सूचीबद्ध करे कि उसने वास्तव में क्या खाया है, ताकि कलाकार अपने काम की रक्षा कर सकें और शोधकर्ता बेहतर, सुरक्षित सिस्टम बना सकें।

निष्कर्ष:
जेनरेटिव एआई एक शक्तिशाली उपकरण है, लेकिन यह मुफ्त में दुनिया की रचनात्मकता को खा नहीं सकता। संगीत और कला के भविष्य को स्वस्थ रखने के लिए, हमें मूल रचनाकारों के प्रति सम्मान दिखाना होगा, यह जानना होगा कि वास्तव में किस डेटा का उपयोग किया जा रहा है, और ऐसे सिस्टम बनाने होंगे जो अनजाने में शो चोरी न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →