← नवीनतम पेपर
🤖 AI

From Hugging Face to GitHub: Tracing License Drift in the Open-Source AI Ecosystem

यह शोध पत्र ओपन-सोर्स एआई इकोसिस्टम के पहले बड़े पैमाने के ऑडिट को प्रस्तुत करता है, जो यह प्रकट करता है कि 35.5% मॉडल-टू-एप्लीकेशन ट्रांज़िशन प्रतिबंधात्मक क्लॉज़ को हटाकर लाइसेंस ड्रिफ्ट (license drift) में शामिल होते हैं, और महत्वपूर्ण गवर्नेंस चुनौतियों को संबोधित करने के लिए ऐसे संघर्षों का 86.4% पता लगाने में सक्षम एक रूल इंजन पेश करता है।

मूल लेखक: James Jewitt, Hao Li, Bram Adams, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Jewitt, Hao Li, Bram Adams, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी रसोई के रूप में करें जहाँ शेफ अब तक की सबसे स्मार्ट रेसिपी तैयार कर रहे हैं। इस रसोई में, "सामग्री" (ingredients) डेटा के विशाल ढेर हैं (जैसे फोटो या टेक्स्ट), "रेसिपी" वे कंप्यूटर मॉडल हैं जिन्हें उस डेटा पर प्रशिक्षित किया गया है, और "तैयार व्यंजन" (final dishes) वे ऐप्स और टूल्स हैं जिन्हें लोग वास्तव में उपयोग करते हैं। लेकिन इसमें एक पेच है: हर सामग्री और रेसिपी के साथ नियमों का एक विशिष्ट सेट आता है, जैसे कि एक गुप्त अनुबंध। कुछ नियम कहते हैं, "आप इसे किसी भी तरह से पका सकते हैं!" (परमिसिव/अनुमति देने वाला), जबकि अन्य कहते हैं, "यदि आप व्यंजन बेचते हैं तो आपको अपनी नई रेसिपी साझा करनी होगी," या "आप इसका उपयोग सैन्य उद्देश्यों के लिए नहीं कर सकते" (प्रतिबंधात्मक)।

समस्या यह है कि अद्भुत व्यंजन बनाने की इस होड़ में, कई शेफ इन अनुबंधों को नहीं पढ़ रहे हैं। वे एक अत्यंत सख्त सामग्री ले सकते हैं, उसके नियमों को अनदेखा कर सकते हैं, और उसे ऐसे व्यंजन के रूप में परोस सकते हैं जो सभी के लिए मुफ्त होने का दावा करता है। यह एक कानूनी जाल पैदा करता है जहाँ मूल रचनाकारों पर मुकदमा चलाया जा सकता है, और भोजन खाने वाले लोग बिना यह जाने मुसीबत में पड़ सकते हैं। वैज्ञानिक इसे "लाइसेंस ड्रिफ्ट" (license drift) कहते हैं, जहाँ सामग्री के पेंट्री से प्लेट तक पहुँचने के दौरान नियमों को हटा दिया जाता है। वैज्ञानिकों की एक टीम ने यह जांच करने का निर्णय लिया कि यह रसोई वास्तव में कितनी अव्यवस्थित है।

शोधकर्ता जेम्स जेविट और उनकी टीम ने क्वीन यूनिवर्सिटी से इस AI रसोई का एक विशाल, एंड-टू-एंड ऑडिट करने का निर्णय लिया। उन्होंने केवल कुछ अलमारियों को नहीं देखा; उन्होंने चौंका देने वाले 364,917 डेटासेट्स (कच्ची सामग्री), 1.6 मिलियन मॉडल (रेसिपी), और 140,000 GitHub प्रोजेक्ट्स (अंतिम व्यंजन) को स्कैन किया। वे यह देखना चाहते थे कि क्या नियमों का पालन किया जा रहा है जब सामग्री डेटा चरण से, मॉडल चरण में, और अंततः उन अनुप्रयोगों (applications) में जाती है जिन्हें लोग रोज़ाना उपयोग करते हैं।

उन्हें ऐसा लगा जैसे यह पता चलना कि अधिकांश शेफ अपनी सामग्रियों पर लगे "बिक्री निषेध" (Do Not Sell) के संकेतों को अनदेखा कर रहे हैं। उनके अध्ययन ने "लाइसेंस ड्रिफ्ट" के एक बड़े पैटर्न का खुलासा किया, जहाँ प्रतिबंधात्मक नियमों को व्यवस्थित रूप से मिटा दिया जाता है। विशेष रूप से, उन्होंने पाया कि 35.5% बार, जब एक मॉडल को सॉफ्टवेयर एप्लिकेशन में बदला जाता है, तो नया ऐप मूल मॉडल के प्रतिबंधात्मक नियमों को छोड़ देता है और उसे "परमिसिव" (सबके लिए मुफ्त) के रूप में पुन: लेबल कर देता है। यह वैसा ही है जैसे किसी शेफ ने एक दुर्लभ, संरक्षित मसाले को लिया, जो केवल घरेलू खाना पकाने के लिए अनुमत था, उसे एक रेस्टोरेंट मेनू में डाला, और दावा किया कि पूरा व्यंजन नकल करने के लिए किसी के लिए भी मुफ्त है।

सबसे चौंकाने वाला हिस्सा इस "ड्रिफ्ट" का बिल्कुल अंत में होता है। जब विशिष्ट "मशीन लर्निंग" लाइसेंस वाले मॉडलों (जिनमें अक्सर उपयोग के बारे में विशेष नियम होते हैं) को अनुप्रयोगों में बदला जाता है, तो 99.6% उन विशेष नियमों का अस्तित्व समाप्त हो जाता है। केवल 0.4% अंतिम अनुप्रयोगों ने मूल प्रतिबंधों को बनाए रखा। ऐसा लगता है कि डेवलपर्स इन जटिल, नियम-भारी मॉडलों के साथ साधारण, मुफ्त सॉफ्टवेयर लाइब्रेरी की तरह व्यवहार कर रहे हैं, और बारीक विवरणों को पूरी तरह से भूल जाते हैं।

हालाँकि, टीम ने केवल गड़बड़ी की ओर इशारा नहीं किया; उन्होंने इसे साफ करने के लिए एक उपकरण बनाया। उन्होंने LicenseRec नामक एक प्रोटोटाइप इंजन बनाया। इसे एक सुपर-स्मार्ट किचन इंस्पेक्टर की तरह समझें जो उन सभी भ्रमित करने वाले अनुबंधों को पढ़ सकता है और तुरंत बता सकता है कि क्या कोई व्यंजन कानूनी है। उन्होंने इस टूल का परीक्षण किया और पाया कि यह सॉफ्टवेयर अनुप्रयोगों में लाइसेंस के 86.4% संघर्षों को हल कर सकता है। इससे पता चलता है कि अधिकांश कानूनी समस्या इसलिए नहीं है क्योंकि सामग्रियों को मिलाना असंभव है, बल्कि इसलिए है क्योंकि लोग अपने व्यंजनों के लिए गलत लेबल चुन रहे हैं।

लेकिन एक उपकरण की एक सीमा होती है। शोधकर्ताओं ने पाया कि लगभग 14.2% संघर्ष "अनेहलनीय" (unresolvable) थे। ये ऐसे हैं जैसे "मांस वर्जित" सामग्री को "मांस का उपयोग करना अनिवार्य है" वाली रेसिपी के साथ मिलाने की कोशिश करना; कोई भी पुन: लेबलिंग इसे ठीक नहीं कर सकती। यदि मूल सामग्री व्यावसायिक उपयोग के लिए सख्त रूप से वर्जित थी, तो आप अंतिम व्यंजन पर केवल "व्यवसाय के लिए मुफ्त" का स्टिकर लगाकर उसे ठीक नहीं कर सकते। ऐसे मामलों में, एकमात्र समाधान यह है कि वापस जाकर एक अलग सामग्री चुनी जाए।

संक्षेप में, यह अध्ययन दिखाता है कि हालांकि हमारे पास AI की दुनिया में होने वाली अधिकांश आकस्मिक कानूनी गलतियों को ठीक करने के उपकरण हैं, लेकिन हम उन्हें ठीक नहीं कर सकते जो सामग्री में शुरू से ही पके हुए हैं। शोधकर्ताओं का निष्कर्ष है कि जबकि LicenseRec जैसे स्वचालित उपकरण एक बड़ा कदम हैं, डेवलपर्स को अभी भी सतर्क जासूस बनने की आवश्यकता है, जो खाना शुरू करने से पहले प्रत्येक सामग्री के नियमों की जांच करें। उस मानवीय तत्परता के बिना, AI रसोई एक जोखिम भरी जगह बनी रहती है जहाँ नियमों को लगातार भुला दिया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →