← नवीनतम पेपर
💻 computer science

Scalable Black-Box Model Attribution for Images

यह शोध पत्र RPA (रॉ-पैच एट्रिब्यूशन) प्रस्तुत करता है, जो एक हल्का और सुदृढ़ ब्लैक-बॉक्स तरीका है जो जनरेटिव इमेज मॉडल्स की पहचान करने में जटिल मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करता है और बिना पुन: प्रशिक्षण के अनसुपरवाइज्ड ग्रुपिंग और फ्यू-शॉट अनुकूलन के लिए बहुमुखी क्षमताएं प्रदान करता है।

मूल लेखक: Asaf Livne, Amir Jevnisek, Shai Avidan

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Asaf Livne, Amir Jevnisek, Shai Avidan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

पिछले कुछ वर्षों में, एक नए प्रकार के कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) ने हमारे चित्र बनाने के तरीके को बदल दिया है। ये प्रणालियाँ, जिन्हें जनरेटिव मॉडल (generative models) के रूप में जाना जाता है, साधारण टेक्स्ट विवरणों को शानदार, फोटोरियलिस्टिक चित्रों में बदल सकती हैं। वे इतने आम हो गए हैं कि अब वे आधुनिक मीडिया उत्पादन और रचनात्मक कार्यों के एक बड़े हिस्से का आधार बन गए हैं। हालाँकि, इस तीव्र प्रसार ने एक महत्वपूर्ण समस्या पैदा कर दी है: जब आप कोई चित्र देखते हैं, तो अक्सर यह बताना असंभव होता है कि उसे किस विशिष्ट मशीन ने बनाया है। यह अनिश्चितता कई कारणों से मायने रखती है, जिसमें एक कलाकार की बौद्धिक संपदा की रक्षा करने से लेकर भ्रामक सामग्री के मूल स्रोत का पता लगाने तक शामिल है। चुनौती केवल यह पहचानना नहीं है कि चित्र नकली है, बल्कि यह पहचानना है कि किस विशिष्ट AI इंजन ने इसे बनाया है। यह कार्य, जिसे 'मॉडल एट्रीब्यूशन' (model attribution) कहा जाता है, कठिन है क्योंकि ये मशीनें लगातार विकसित हो रही हैं, और उनके आउटपुट अक्सर मानवीय आंखों को लगभग एक जैसे दिखाई देते हैं। इसके अलावा, उपलब्ध मॉडलों की विशाल संख्या, जिसमें हजारों अनुकूलित संस्करण भी शामिल हैं, उन्हें ट्रैक करने के कार्य को अत्यधिक कठिन बना देती है।

तेल अवीव विश्वविद्यालय के शोधकर्ताओं ने इस जटिल समस्या का एक आश्चर्यजनक रूप से सरल समाधान खोज निकाला है। जनरेटर की जटिलता से मेल खाने के लिए एक विशाल, जटिल प्रणाली बनाने के बजाय, उन्होंने एक हल्का उपकरण विकसित किया है जो एक बुनियादी क्लासिफायर (classifier) की तरह काम करता है। उनका दृष्टिकोण, जिसे RPA कहा जाता है, सबसे सख्त "ब्लैक-बॉक्स" सेटिंग में काम करता है, जिसका अर्थ है कि यह केवल अंतिम चित्र को देखता है और इसे उस AI के आंतरिक कोड, वेट्स (weights), या गुप्त सेटिंग्स तक पहुँच की आवश्यकता नहीं होती जिसने इसे बनाया है। यह विधि एक चित्र को छोटे वर्गों में विभाजित करती है और प्रत्येक में कच्चे रंग पैटर्न (raw color patterns) का विश्लेषण करती है। विभिन्न मॉडलों के बीच छवियों की दृश्य समानता के बावजूद, शोधकर्ताओं ने पाया कि प्रत्येक जनरेटर पिक्सेल की बनावट (texture) में एक अद्वितीय, निम्न-स्तरीय फिंगरप्रिंट छोड़ जाता है। इन सूक्ष्म पैटर्न को पहचानने के लिए एक छोटे न्यूरल नेटवर्क को प्रशिक्षित करके, यह प्रणाली उल्लेखनीय सटीकता के साथ किसी चित्र के स्रोत की पहचान कर सकती है। पच्चीस अलग-अलग मॉडलों के एक टेस्ट सेट पर, इस उपकरण ने 98.0 प्रतिशत की सटीकता प्राप्त की, और एक अधिक अराजक, वास्तविक दुनिया के सत्ताईस मॉडलों के सेट पर, इसने 92.9 प्रतिशत तक पहुँच बनाई।

यह निष्कर्ष विशेष रूप से इसलिए उल्लेखनीय है कि यह उपकरण इंटरनेट की अव्यवस्थित वास्तविकता को कैसे संभालता है। इंटरनेट पर मौजूद चित्र शायद ही कभी शुद्ध होते हैं; सोशल मीडिया और समाचार साइटों पर यात्रा करते समय उन्हें अक्सर कंप्रेस (compress), धुंधला या रीसाइज (resize) किया जाता है। कई पिछले तरीके इन सामान्य परिवर्तनों के सामने विफल रहे। हालाँकि, नया सिस्टम मजबूत बना रहता है। जब शोधकर्ताओं ने इसका परीक्षण अत्यधिक कंप्रेस या रीसाइज किए गए चित्रों के विरुद्ध किया, तो सटीकता में केवल थोड़ी सी गिरावट आई, जिससे यह सिद्ध हुआ कि जिस फिंगरप्रिंट का यह पता लगाता है वह एक क्षणिक प्रभाव के बजाय एक मौलिक संरचनात्मक विशेषता है। यह प्रणाली अविश्वसनीय रूप से कुशल भी है। अन्य दृष्टिकोणों के विपरीत, जिनमें एक-एक करके प्रत्येक संभावित उम्मीदवार मॉडल के साथ चित्र की तुलना करने की आवश्यकता होती है—एक ऐसी प्रक्रिया जो मॉडलों की संख्या बढ़ने के साथ धीमी हो जाती है—यह उपकरण एक ही पास (single pass) में चित्र का मूल्यांकन करता है। स्रोत की पहचान करने में लगने वाला समय तब भी नहीं बढ़ता है जब ज्ञात मॉडलों का डेटाबेस कुछ दर्जन से बढ़कर कुछ हजार हो जाता है।

केवल ज्ञात मॉडलों की पहचान करने से परे, शोधकर्ताओं ने पाया कि इस उपकरण के पास एक गहरी, अधिक बहुमुखी बुद्धिमत्ता है। जब यह किसी ऐसे जनरेटर के चित्र का सामना करता है जिसे इसने पहले कभी नहीं देखा है, तो यह बिना गलत अनुमान लगाए, उसे विश्वसनीय रूप से 'अज्ञात' के रूप में चिह्नित कर सकता है। अज्ञात को पहचानने की यह क्षमता उस क्षेत्र के लिए महत्वपूर्ण है जहाँ प्रतिदिन नए मॉडल आते हैं। इसके अलावा, यह प्रणाली लगभग तुरंत इन नए मॉडलों के अनुकूल हो सकती है। एक लंबी पुन: प्रशिक्षण (retraining) प्रक्रिया की आवश्यकता के बजाय, शोधकर्ता मौजूदा नेटवर्क में एक छोटा, सरल लेयर जोड़कर एक नया मॉडल बस कुछ ही मिनटों में जोड़ सकते हैं। यह लचीलापन यह दर्शाता है कि उपकरण ने इन मशीनों के काम करने के तरीके का एक सामान्य मानचित्र सीख लिया है, न कि केवल विशिष्ट उदाहरणों की एक सूची को याद किया है।

शोधकर्ताओं ने इस सीखे हुए ज्ञान का उपयोग मॉडलों के बीच के संबंधों को समझने के लिए भी किया। इस उपकरण द्वारा निर्णय लेने के लिए उपयोग किए जाने वाले आंतरिक फीचर्स का विश्लेषण करके, वे आर्किटेक्चरल समानताओं के आधार पर विभिन्न जनरेटरों को परिवारों में वर्गीकृत करने में सक्षम थे, भले ही उन्हें यह न बताया गया हो कि कौन से मॉडल संबंधित हैं। सिस्टम ने सही ढंग से पहचाना कि कुछ मॉडलों का एक साझा वंश या आधार तकनीक है, और उन्हें उनके विकास के ज्ञात तथ्यों के अनुरूप क्लस्टर (cluster) किया। यह क्षमता अनदेखे जनरेटरों के चित्रों तक भी विस्तृत है, जिससे यह उपकरण बिना किसी पूर्व प्रशिक्षण के उनके वास्तविक स्रोत के आधार पर उन्हें समूहित कर सकता है। यह अध्ययन प्रदर्शित करता है कि एक सरल, सीधा दृष्टिकोण डिजिटल उत्पत्ति का पता लगाने के कार्य में जटिल, भारी मशीनरी से बेहतर प्रदर्शन कर सकता है। यह सुझाव देता है कि इन जटिल प्रणालियों को समझने की कुंजी अधिक जटिल डिटेक्टर बनाने में नहीं, बल्कि उन सूक्ष्म, निरंतर हस्ताक्षरों को पहचानने में है जो हर मशीन द्वारा बनाए गए चित्रों में छोड़े जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →