SurrogateSHAP: Training-Free Contributor Attribution for Text-to-Image (T2I) Models
SurrogateSHAP एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो टेक्स्ट-टू-इमेज मॉडल्स में डेटा योगदानों के श्रेय निर्धारण के लिए शैप्ली मानों (Shapley values) को कुशलतापूर्वक अनुमानित करता है, जो पारंपरिक पुन:प्रशिक्षण-आधारित विधियों की कम्प्यूटेशनल बाधाओं को दूर करने के लिए एक पूर्व-प्रशिक्षित मॉडल और एक ग्रेडिएंट-बूस्टेड ट्री का लाभ उठाता है, जिससे निष्पक्ष मुआवजा, स्केलेबल ऑडिटिंग और स्पूरियस सहसंबंधों (spurious correlations) की पहचान सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप और आपके दोस्तों का एक समूह मिलकर एक विशाल, अविश्वसनीय रूप से विस्तृत लेगो (LEGO) महल बनाने का निर्णय लेते हैं। आप सभी अलग-अलग बक्सों में ईंटें लेकर आते हैं: कुछ लाल ईंटें लाते हैं, कुछ नीली, कुछ छोटी खिड़कियाँ, और अन्य दुर्लभ सुनहरे टुकड़े। एक बार जब महल बन जाता है, तो यह अद्भुत दिखता है। लेकिन अब, कोई पूछता है: "सबसे अधिक श्रेय किसे मिलना चाहिए? सबसे मूल्यवान ईंटें कौन लाया?"
आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से टेक्स्ट-टू-इमेज (T2I) मॉडल्स (जैसे Stable Diffusion या FLUX), "ईंटें" उन लाखों छवियों और टेक्स्ट विवरणों को दर्शाती हैं जिनका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है। "महल" वह अंतिम AI है जो आपके शब्दों से चित्र बना सकता है।
समस्या यह है कि यह पता लगाना कि किसने सबसे अच्छी ईंटें दीं, अत्यंत कठिन है। यही कारण है कि यह समस्या है, और इस पेपर के लेखकों ने SurrogateSHAP के माध्यम से इसे कैसे हल किया।
समस्या: "रीट्रेनिंग" (पुनः प्रशिक्षण) का दुस्वप्न
यह जानने के लिए कि किसी विशिष्ट समूह (एक "योगदानकर्ता") ने वास्तव में कितना योगदान दिया, पारंपरिक तरीका "क्या होगा अगर?" का खेल खेलना है।
- क्या होगा यदि हम लाल ईंटों के बिना महल बनाते?
- क्या होगा यदि हम नीली ईंटों के बिना बनाते?
- क्या होगा यदि हम खिड़कियों के बिना बनाते?
एक सटीक उत्तर प्राप्त करने के लिए, आपको गायब ईंटों के हर एक संयोजन के लिए पूरे महल को फिर से शून्य से बनाना होगा। चूंकि ऐसे लाखों संयोजन हैं, इसमें ब्रह्मांड की आयु से भी अधिक समय लग जाएगा। यह बहुत महंगा और धीमा है।
समाधान: SurrogateSHAP
लेखकों ने एक चतुर शॉर्टकट बनाया जिसे SurrogateSHAP कहा जाता है। इसे एक "जादुई सिम्युलेटर" के रूप में सोचें जो आपको ईंटों को हटाए बिना उनके परिणाम देखने की अनुमति देता है।
उन्होंने यह दो मुख्य चरणों में किया:
1. "जादुई मिश्रण" (प्रशिक्षण-मुक्त प्रॉक्सी)
महल को फिर से बनाने के बजाय, उन्होंने महसूस किया कि वे केवल उपलब्ध ईंटों के निर्देशों को मिश्रित कर सकते हैं।
- कल्पना कीजिए कि AI एक शेफ है जो एक विशिष्ट रेसिपी का उपयोग करके एक आदर्श भोजन बनाना जानता है।
- हर संभव सामग्रियों के संयोजन के लिए नया भोजन पकाने के बजाय, लेखकों ने महसूस किया कि वे शेफ को बस यह बता सकते हैं: "कल्पना करें कि आप एक ऐसा भोजन बना रहे हैं जो 'लाल ईंट' की रेसिपी और 'नीली ईंट' की रेसिपी का 50/50 मिश्रण है।"
- शेफ वास्तव में खाना बनाए बिना तुरंत सिम्युलेट कर सकता है कि वह मिश्रित भोजन कैसा स्वाद देगा।
- पेपर के शब्दों में: वे AI के मौजूदा ज्ञान का उपयोग यह सिम्युलेट करने के लिए करते हैं कि मॉडल कैसा दिखेगा यदि इसे केवल डेटा के एक विशिष्ट उपसमुच्चय (subset) पर प्रशिक्षित किया गया होता, जिससे महंगे प्रशिक्षण प्रक्रिया को पूरी तरह से छोड़ दिया जाता है।
2. "स्मार्ट गेसिंग ट्री" (TreeSHAP)
"जादुई मिश्रण" के साथ भी, अभी भी बहुत सारे संयोजन हैं जिन्हें एक-एक करके जांचना होगा। इसलिए, उन्होंने एक दूसरा तरीका अपनाया।
- उन्होंने जादुई सिम्युलेटर से कुछ सौ प्रश्न पूछे (जैसे, "क्या होगा यदि हम लाल ईंटें हटा दें?" "क्या होगा यदि हम नीली ईंटें हटा दें?")।
- फिर उन्होंने एक स्मार्ट डिसीजन ट्री (एक प्रकार का कंप्यूटर प्रोग्राम जो फ्लोचार्ट जैसा दिखता है) को उन उत्तरों के पैटर्न को सीखने के लिए प्रशिक्षित किया।
- एक बार जब पेड़ ने पैटर्न सीख लिया, तो वह सिम्युलेटर से और कोई सवाल पूछे बिना तुरंत प्रत्येक योगदानकर्ता के सटीक मूल्य की गणना कर सकता था। यह एक खेल के नियम सीखने जैसा है, जिसमें कुछ राउंड खेलने के बाद, आप भविष्य के किसी भी गेम के परिणाम की भविष्यवाणी तुरंत कर सकते हैं।
यह क्यों मायने रखता है (परिणाम)
लेखकों ने इस पद्धति का परीक्षण तीन अलग-अलग "निर्माण परियोजनाओं" पर किया:
- CIFAR-20: एक मानक इमेज डेटासेट (जैसे खिलौना कारों और जानवरों को छाँटना)।
- ArtBench: पोस्ट-इंप्रेशनिस्ट पेंटिंग्स का एक संग्रह (जैसे वैन गॉग और मोनेट)।
- Fashion-Product: विभिन्न ब्रांडों के कपड़ों की छवियां।
निष्कर्ष स्पष्ट थे:
- गति: उनकी विधि पिछले उन तरीकों की तुलना में 2 से 23 गुना तेज़ थी जो उत्तर का अनुमान लगाने के लिए आंशिक रिट्रेनिंग करने का प्रयास करते थे।
- सटीकता: यह वास्तव में यह पहचानने में बहुत बेहतर था कि अंतिम छवि में किसका योगदान था। उदाहरण के लिए, आर्ट डेटासेट में, इसने सही ढंग से पहचाना कि किन कलाकारों की शैलियाँ सबसे प्रभावशाली थीं, जबकि अन्य तरीके भ्रमित हो गए या नकारात्मक स्कोर दे रहे थे।
- निष्पक्षता: इसने "बुरे तत्वों" (bad actors) की सफलतापूर्वक पहचान की। स्किन कैंसर की छवियों से जुड़े एक क्लिनिकल केस स्टडी में, इस पद्धति ने ठीक से पहचाना कि किस अस्पताल के डेटा के कारण AI एक मरीज के लिंग और उसकी बीमारी के बीच एक अजीब, गलत संबंध बना रहा था। केवल उस एक अस्पताल के डेटा को हटाकर, AI अधिक निष्पक्ष हो गया।
निष्कर्ष
SurrogateSHAP एक ऐसा उपकरण है जो हमें AI आर्ट जनरेटर के लिए डेटा प्रदान करने वाले लोगों को निष्पक्ष रूप से भुगतान और श्रेय देने में मदद करता है। यह एक सिमुलेशन ट्रिक (AI को फिर से बनाने से बचने के लिए) और एक स्मार्ट पैटर्न-फाइंडिंग ट्री (स्कोर की गणना तुरंत करने के लिए) का उपयोग करके ऐसा करता है।
यह एक ऐसे कार्य को जो पहले कंप्यूटिंग पावर के वर्षों का काम था, मिनटों में किए जाने योग्य कार्य में बदल देता है, जिससे यह सुनिश्चित होता है कि सही लोगों को AI के व्यवहार के लिए श्रेय (या दोष) मिले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।