← नवीनतम पेपर
💻 computer science

How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets

यह शोध पत्र डेटाकम्प (DataComp), जो कि एक विशाल विजन-लैंग्वेज डेटासेट है, की जांच करता है ताकि यह प्रकट किया जा सके कि इसकी वेब-स्क्रेप्ड सामग्री का एक महत्वपूर्ण हिस्सा कॉपीराइट नोटिस, प्रतिबंधात्मक सेवा की शर्तों और वॉटरमार्क के माध्यम से डेटा स्वामियों की सहमति का उल्लंघन करता है, जिससे वर्तमान एआई डेटा संग्रह प्रथाओं में गंभीर अंतराल और एक एकीकृत सहमति ढांचे की तत्काल आवश्यकता उजागर होती है।

मूल लेखक: Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chung Peng Lee, Rachel Hong, Harry H. Jiang, Aster Plotnik, William Agnew, Jamie Morgenstern

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, वैश्विक पुस्तकालय (library) है जहाँ कोई भी आकर शेल्फ से किताब उठा सकता है। हाल के वर्षों में, आर्टिफिशियल इंटेलिजेंस (AI) कंपनियाँ इन अरबों किताबों (छवियों और टेक्स्ट) को एक साथ पढ़कर "सुपर-ब्रेन" बनाने की कोशिश कर रही हैं। वे इस प्रक्रिया को "स्क्रैपिंग" (scraping) कहती हैं।

यह शोध पत्र एक जासूसी रिपोर्ट की तरह है जो यह जांच रहा है कि क्या उन लोगों ने (डेटा मालिकों ने), जिन्होंने वे किताबें लिखी थीं, वास्तव में यह कहा था कि, "आप मेरा रोबोट बनाने के लिए मेरी किताब पढ़ सकते हैं।"

यहाँ उस कहानी का विवरण दिया गया है जो शोधकर्ताओं ने खोजा है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. बड़ी लाइब्रेरी बनाम AI की रेसिपी बुक

शोधकर्ताओं ने डेटा के एक विशिष्ट, विशाल संग्रह को देखा जिसे CommonPool कहा जाता है। इसे फोटो के डिब्बे के रूप में नहीं, बल्कि एक विशाल रेसिपी कार्ड के रूप में समझें जो केवल उस पते (URL) को सूचीबद्ध करता है जहाँ एक फोटो संग्रहीत है, साथ ही एक संक्षिप्त विवरण भी।

  • समस्या: AI निर्माता इस रेसिपी कार्ड को डाउनलोड करते हैं। उनके पास अभी वास्तविक फोटो नहीं हैं। फोटो प्राप्त करने के लिए, उन्हें इंटरनेट के उन पतों पर वापस जाना होगा जो कार्ड पर सूचीबद्ध हैं और उन्हें खुद डाउनलोड करना होगा।
  • उपमा: कल्पना कीजिए कि एक लाइब्रेरियन आपको घरों के 12 अरब पतों की एक सूची देता है। लाइब्रेरियन कहता है, "यहाँ घरों की एक सूची है; जाओ और घरों के दरवाज़े खटखटाओ और देखो कि अंदर क्या है, फिर उसकी तस्वीर ले लो।" लाइब्रेरियन ने यह नहीं पूछा कि घर मालिकों ने इसकी अनुमति दी है या नहीं; उसने बस आपको सूची दे दी।

2. "डिस्टर्ब न करें" के संकेत (डेटा सहमति/Data Consent)

शोधकर्ताओं ने पूछा: "घर मालिक AI को रोकने के लिए कैसे बताते हैं?" उन्होंने तीन प्रकार के संकेतों की तलाश की:

  • कॉपीराइट नोटिस (© का संकेत): जैसे किसी किताब में कॉपीराइट पेज होता है, वैसे ही कई छवियों पर एक छोटा "©" प्रतीक या वॉटरमार्क होता है जो कहता है "जेन डो की संपत्ति है।"
    • निष्कर्ष: उन्होंने पाया कि इस विशाल लाइब्रेरी में लगभग 122 मिलियन छवियों में ये संकेत मौजूद हैं। AI निर्माता अक्सर इन्हें अनदेखा कर देते हैं।
  • वॉटरमार्क (अदृश्य स्याही): कई कलाकार अपनी कला को साबित करने के लिए उस पर अदृश्य या दृश्य वॉटरमार्क लगाते हैं।
    • निष्कर्ष: AI के वर्तमान उपकरण इन्हें पहचानने में बहुत खराब हैं। यह आँखों पर पट्टी बांधकर घास के ढेर में सुई खोजने जैसा है। AI सोचता है कि वह छवि का उपयोग करना सुरक्षित है, लेकिन वास्तव में वह चोरी की गई है।
  • "प्रवेश निषेध" की बाड़ (Robots.txt और सेवा की शर्तें/Terms of Service): हर वेबसाइट की एक डिजिटल बाड़ होती है। कुछ कहती हैं, "आप देख सकते हैं, लेकिन कुछ भी ले न जाएँ।" अन्य कहती हैं, "आप फोटो ले सकते हैं, लेकिन केवल तभी जब आप एक छात्र या शोधकर्ता हों, रोबोट नहीं।"
    • निष्कर्ष: उन्होंने सबसे अधिक छवियां प्रदान करने वाली शीर्ष 50 वेबसाइटों की जाँच की। उनमें से 60% के पास ऐसी बाड़ थी जो कहती थी, "स्क्रैपिंग की अनुमति नहीं है!" फिर भी, AI निर्माता उस बाड़ के ऊपर से सीधे निकल गए।

3. "अंधा" डिलीवरी ट्रक

यहाँ वह पेचीदा हिस्सा है जो इसे एक कानूनी और नैतिक दुःस्वप्न बनाता है।

AI निर्माता कहते हैं, "हमने फोटो चोरी नहीं किए; हमने केवल एक सार्वजनिक संग्रह (CommonCrawl) से पतों की एक सूची डाउनलोड की।"

  • उपमा: कल्पना कीजिए कि एक डिलीवरी ट्रक ड्राइवर एक निर्माण दल को पतों की एक सूची गिरा देता है। निर्माण दल उन घरों में जाता है और ईंटें लेना शुरू कर देता है।
  • वास्तविकता: डिलीवरी ट्रक ड्राइवर (डेटासेट क्यूरेटर) दावा करता है, "मैंने ईंटें नहीं लीं; मैंने केवल सूची दी थी।" लेकिन निर्माण दल (AI उपयोगकर्ता) वह है जो वास्तव में घरों में घुसपैठ कर रहा है।
  • गड़बड़ी (Glitch): क्योंकि सूची केवल फोटो का पता देती है (जो Amazon के क्लाउड जैसे सामान्य सर्वर पर हो सकता है), AI निर्माता अक्सर असली घर के मालिक का "प्रवेश निषेध" का संकेत नहीं देख पाते। वे गलत दरवाजे को देख रहे होते हैं।

4. "फेयर यूज़" (Fair Use) का लूपहोल

कुछ AI कंपनियाँ तर्क देती हैं, "हम केवल किताबों से सीख रहे हैं; यह फेयर यूज़ है।"

  • प्रति-तर्क: शोध पत्र बताता है कि भले ही "सीखना" ठीक हो, लेकिन आप किताबें कैसे प्राप्त करते हैं, यह मायने रखता है। यदि आप उस लाइब्रेरी से किताबें चुराते हैं जो कहती है "फोटोकॉपी न करें," तो आपकी "सीखने" की प्रक्रिया एक झूठ पर आधारित है।
  • अदालती मामले: पेपर उल्लेख करता है कि अदालतें वर्तमान में तय कर रही हैं कि क्या यह ठीक है। कुछ न्यायाधीश कह रहे हैं, "शायद पढ़ना फेयर यूज़ है, लेकिन अगर लाइब्रेरी स्पष्ट रूप से कहती है कि 'नहीं', तो किताबें चुराना फेयर यूज़ नहीं हो सकता।"

5. समाधान: एक एकीकृत "सहमति भाषा" (Unified Consent Language)

अभी, इंटरनेट अलग-अलग भाषाओं का एक मिश्रण है जिससे "ना" कहा जाता है।

  • कुछ लोग छवि पर "ना" लिखते हैं (वॉटरमार्क)।
  • कुछ वेबसाइट पर संकेत लगाते हैं (सेवा की शर्तें)।
  • कुछ गेट पर संकेत लगाते हैं (Robots.txt)।
  • कुछ मेटाडेटा में संकेत लगाते हैं (EXIF डेटा)।

AI निर्माता केवल एक भाषा सुन रहे हैं और बाकी को अनदेखा कर रहे हैं।

शोध पत्र की सिफारिश:
हमें एक सार्वभौमिक "प्रवेश निषेध" का संकेत चाहिए जिस पर सभी सहमत हों।

  • निर्माताओं के लिए: एक सरल, स्पष्ट तरीका यह कहने का कि, "मेरी कला को AI प्रशिक्षण के लिए उपयोग न करें।"
  • AI निर्माताओं के लिए: एक नियम कि, "यदि आप यह संकेत देखते हैं, तो आपको रुकना होगा। कोई बहाना नहीं चलेगा।"
  • "ऑप्ट-इन" (Opt-In) का विचार: यह मानने के बजाय कि हर कोई अपने डेटा का उपयोग करने देना चाहता है जब तक कि वे "ना" न कहें (Opt-Out), पेपर सुझाव देता है कि हमें यह मानना चाहिए कि लोग अपने डेटा का उपयोग नहीं चाहते हैं जब तक कि वे स्पष्ट रूप से "हाँ" न कहें (Opt-In)।

निचोड़ (The Bottom Line)

आधुनिक AI बनाने के लिए इंटरनेट मुख्य सामग्री बन गया है। लेकिन शोधकर्ताओं ने पाया कि उन सामग्रियों का एक बड़ा हिस्सा रचनाकारों (मालिकों) से बिना पूछे लिया गया था।

वर्तमान प्रणाली एक ऐसे शेफ की तरह है जो एक पड़ोस में जाता है, लोगों के फ्रिज से सामग्रियां उठा लेता है क्योंकि उन्होंने स्पष्ट रूप से अपने दरवाजे लॉक नहीं किए थे, और फिर दावा करता है, "मैंने चोरी नहीं की; मैंने बस जो उपलब्ध था उसे लिया।" यह शोध पत्र तर्क देता है कि हमें खाना बनाना शुरू करने से पहले अनुमति मांगनी चाहिए और रुकना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →