Quality Assessment of Public Summary of Training Content for GPAI models required by AI Act Article 53(1)(d)
यह शोध-आधारित ढांचा ईयू (EU) एआई अधिनियम द्वारा जनरल-पर्पज एआई मॉडलों के लिए आवश्यक सार्वजनिक प्रशिक्षण सारांशों की पारदर्शिता और उपयोगिता का मूल्यांकन करने हेतु प्रस्तुत करता है, जिसे पांच मौजूदा सारांशों पर लागू करके समस्याओं की पहचान की गई है और प्रदाताओं एवं अधिकारियों को उच्च-गुणवत्ता वाले खुलासों की ओर निर्देशित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी एक शानदार नया ब्लेंडर खरीदा है। इसके डिब्बे पर लिखा है कि यह एक "जनरल पर्पस ब्लेंडर" है, लेकिन आपको पता ही नहीं है कि इसने जो स्मूदी बनाई है, उसमें कौन सी सामग्री डाली गई है। क्या इसमें जैविक स्ट्रॉबेरी (organic strawberries) का उपयोग किया गया था? क्या इसमें गलती से एक प्लास्टिक का चम्मच भी ब्लेंड हो गया? क्या इसमें ऐसे फल का उपयोग किया गया जो पड़ोसी के बगीचे से चुराया गया था?
AI की दुनिया में, "ब्लेंडर" AI मॉडल है, और "सामग्री" वह डेटा है जिसका उपयोग इसे प्रशिक्षित (train) करने के लिए किया गया है।
यूरोपीय संघ का AI एक्ट नियमों का एक नया समूह है जिसे यह सुनिश्चित करने के लिए बनाया गया है कि ये ब्लेंडर सुरक्षित और निष्पक्ष हों। एक विशिष्ट नियम (अनुच्छेद 53) कहता है: "AI कंपनियों को अपनी सामग्रियों का 'सार्वजनिक सारांश' (Public Summary) प्रकाशित करना होगा।" उन्हें एक विशिष्ट फॉर्म (टेम्प्लेट) भरना होगा जिसमें वे सबको विस्तार से बताएंगे कि उन्होंने वास्तव में किस डेटा का उपयोग किया है।
हालाँकि, सिर्फ इसलिए कि किसी कंपनी ने एक फॉर्म भरा है, इसका मतलब यह नहीं है कि उन्होंने अच्छा काम किया है। वे लिख सकते हैं "हमने फल का उपयोग किया" (बहुत अस्पष्ट), या वे इस बात को छिपा सकते हैं कि उन्होंने प्लास्टिक के चम्मचों का उपयोग किया (दुर्भावनापूर्ण)।
यह शोध पत्र उन सामग्री सूचियों के लिए एक "क्वालिटी कंट्रोल इंस्पेक्टर" की तरह है। लेखकों ने यह ग्रेड देने के लिए एक "रिपोर्ट कार्ड" प्रणाली बनाई है कि AI कंपनियां नियमों का कितनी अच्छी तरह से पालन कर रही हैं।
🕵️♂️ समस्या: AI का "ब्लैक बॉक्स"
अभी, कई बड़ी AI कंपनियां अपने प्रशिक्षण डेटा (training data) को गुप्त रख रही हैं। EU इसे बदलना चाहता है ताकि:
- कलाकार और लेखक यह देख सकें कि क्या उनके काम का बिना अनुमति के उपयोग किया गया है।
- आम लोग समझ सकें कि AI कैसे काम करता है।
- वकील अधिकारों को लागू कर सकें यदि कुछ अवैध हुआ हो।
लेकिन एक पेच है: EU ने कंपनियों को एक टेम्प्लेट दिया है जिसे उन्हें भरना है, लेकिन उन्होंने यह नहीं बताया कि यह कैसे जांचा जाए कि उत्तर वास्तव में अच्छे हैं या नहीं। यह एक छात्र को टेस्ट शीट देने जैसा है लेकिन बिना उत्तर कुंजी (answer key) के।
📝 समाधान: "रिपोर्ट कार्ड" ढांचा
लेखकों (ट्रिनिटी कॉलेज डबलिन और मोज़िला के शोधकर्ताओं) ने एक "क्वालिटी असेसमेंट फ्रेमवर्क" बनाया है। इसे एक विशाल चेकलिस्ट की तरह समझें जिसमें 242 विशिष्ट प्रश्न हैं।
वे AI कंपनियों के सारांशों को दो मुख्य चीजों पर परखते हैं:
पारदर्शिता (The "Flashlight" Test - टॉर्च वाला परीक्षण):
- क्या जानकारी स्पष्ट है?
- क्या यह पूर्ण है, या इसमें कमियां हैं?
- क्या यह सुसंगत है (क्या बीच में कहानी बदल जाती है)?
- उपमा: यदि आप दस्तावेज़ पर टॉर्च की रोशनी डालते हैं, तो क्या आप सब कुछ स्पष्ट रूप से देख सकते हैं, या यह धुंधला और अस्पष्ट है?
उपयोगिता (The "Tool" Test - औज़ार वाला परीक्षण):
- क्या एक सामान्य व्यक्ति यह जानने के लिए इस जानकारी का वास्तव में उपयोग कर सकता है कि क्या उसकी कला चोरी हुई है?
- क्या दस्तावेज़ ढूंढना और पढ़ना आसान है?
- उपमा: क्या यह दस्तावेज़ एक काम करने वाला पेचकश (screwdriver) है, या यह प्लास्टिक का एक टुकड़ा है जो पेचकश जैसा दिखता है लेकिन पेच नहीं घुमाता?
📊 परिणाम: कौन पास हुआ? कौन फेल हुआ?
शोधकर्ताओं ने 5 AI मॉडल का परीक्षण किया जिन्होंने ये सारांश प्रकाशित किए थे (2026 की शुरुआत तक)। यहाँ बताया गया है कि उन्होंने कैसा प्रदर्शन किया:
- 🏆 ए-ग्रेड वाले छात्र (Apertus और Bria): इन कंपनियों ने फॉर्म लगभग पूरी तरह से भरा। वे स्पष्ट, ईमानदार और समझने में आसान थे। उनके "रिपोर्ट कार्ड" को A या A+ मिला।
- 👍 बी-ग्रेड वाले छात्र (SmolLM और Bielik): ये अच्छे थे, लेकिन इनमें कुछ विवरण गायब थे या लिखावट बिखरी हुई थी। उन्हें B+ मिला। उन्होंने काम किया, लेकिन वे और अधिक सटीक हो सकते थे।
- 📉 एफ-ग्रेड वाला छात्र (Microsoft का Phi-4): यह एक आपदा थी। दस्तावेज़ बहुत अस्पष्ट था, इसमें बड़े हिस्से गायब थे, और इसमें "हम कानून का पालन करते हैं" जैसे उत्तर दिए गए थे बजाय इसके कि वास्तव में डेटा की सूची दी जाए। पारदर्शिता के लिए इसे D और उपयोगिता के लिए F मिला। यह एक खाली कागज जमा करने जैसा था जिस पर एक स्टिकी नोट लगा हो: "हम पर भरोसा करें।"
- 🚫 गायब छात्र: सबसे बड़े AI दिग्गज (Google, OpenAI, Meta) ने अभी तक कोई भी सारांश प्रकाशित नहीं किया था। वे प्रभावी रूप रूप से क्लास छोड़ रहे थे।
🛠️ यह क्यों मायने रखता है
लेखकों का तर्क है कि यदि हमारे पास उच्च गुणवत्ता वाले सारांश नहीं हैं, तो पूरा कानून बेकार है।
- यदि सारांश खराब है, तो कॉपीराइट वकील यह साबित नहीं कर पाएंगे कि AI ने उनके क्लाइंट के काम को चुराया है।
- यदि सारांश छिपा हुआ है, तो एक नागरिक यह नहीं जान पाएगा कि उसके डेटा का उपयोग किया गया था या नहीं।
💡 मुख्य निष्कर्ष
यह शोध पत्र केवल होमवर्क को ग्रेड नहीं दे रहा है; यह सिस्टम को ठीक करने की कोशिश कर रहा है।
- AI कंपनियों के लिए: "आलसी होना बंद करो! फॉर्म को ठीक से भरो, अन्यथा तुम्हें खराब ग्रेड मिलेगा और शायद जुर्माना भी देना पड़ेगा।"
- EU के लिए: "टेम्प्लेट अधिक स्पष्ट होना चाहिए, और शायद आपके पास एक केंद्रीय वेबसाइट होनी चाहिए जहाँ ये सभी सारांश मौजूद हों, ताकि लोगों को इनके लिए खजाने की तरह खोज न करना पड़े।"
- आपके लिए: "हमने एक सार्वजनिक वेबसाइट बनाई है जहाँ आप ये ग्रेड देख सकते हैं। यदि आप जानना चाहते हैं कि कोई AI भरोसेमंद है या नहीं, तो पहले उसका रिपोर्ट कार्ड देखें।"
संक्षेप में: यह शोध पत्र AI प्रशिक्षण डेटा के लिए "कंज्यूमर रिपोर्ट्स" है। यह यह सुनिश्चित करने के लिए है कि AI कंपनियां केवल पारदर्शी होने का दिखावा न करें, बल्कि अपने डिजिटल स्मूदी में मौजूद सामग्रियों के बारे में वास्तव में ईमानदार रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।