← नवीनतम पेपर
🤖 machine learning

SurrogateSHAP: Training-Free Contributor Attribution for Text-to-Image (T2I) Models

SurrogateSHAP एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो टेक्स्ट-टू-इमेज मॉडल्स में डेटा योगदानों के श्रेय निर्धारण के लिए शैप्ली मानों (Shapley values) को कुशलतापूर्वक अनुमानित करता है, जो पारंपरिक पुन:प्रशिक्षण-आधारित विधियों की कम्प्यूटेशनल बाधाओं को दूर करने के लिए एक पूर्व-प्रशिक्षित मॉडल और एक ग्रेडिएंट-बूस्टेड ट्री का लाभ उठाता है, जिससे निष्पक्ष मुआवजा, स्केलेबल ऑडिटिंग और स्पूरियस सहसंबंधों (spurious correlations) की पहचान सक्षम होती है।

मूल लेखक: Mingyu Lu, Soham Gadgil, Chris Lin, Chanwoo Kim, Su-In Lee

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyu Lu, Soham Gadgil, Chris Lin, Chanwoo Kim, Su-In Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप और आपके दोस्तों का एक समूह मिलकर एक विशाल, अविश्वसनीय रूप से विस्तृत लेगो (LEGO) महल बनाने का निर्णय लेते हैं। आप सभी अलग-अलग बक्सों में ईंटें लेकर आते हैं: कुछ लाल ईंटें लाते हैं, कुछ नीली, कुछ छोटी खिड़कियाँ, और अन्य दुर्लभ सुनहरे टुकड़े। एक बार जब महल बन जाता है, तो यह अद्भुत दिखता है। लेकिन अब, कोई पूछता है: "सबसे अधिक श्रेय किसे मिलना चाहिए? सबसे मूल्यवान ईंटें कौन लाया?"

आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से टेक्स्ट-टू-इमेज (T2I) मॉडल्स (जैसे Stable Diffusion या FLUX), "ईंटें" उन लाखों छवियों और टेक्स्ट विवरणों को दर्शाती हैं जिनका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है। "महल" वह अंतिम AI है जो आपके शब्दों से चित्र बना सकता है।

समस्या यह है कि यह पता लगाना कि किसने सबसे अच्छी ईंटें दीं, अत्यंत कठिन है। यही कारण है कि यह समस्या है, और इस पेपर के लेखकों ने SurrogateSHAP के माध्यम से इसे कैसे हल किया।

समस्या: "रीट्रेनिंग" (पुनः प्रशिक्षण) का दुस्वप्न

यह जानने के लिए कि किसी विशिष्ट समूह (एक "योगदानकर्ता") ने वास्तव में कितना योगदान दिया, पारंपरिक तरीका "क्या होगा अगर?" का खेल खेलना है।

  • क्या होगा यदि हम लाल ईंटों के बिना महल बनाते?
  • क्या होगा यदि हम नीली ईंटों के बिना बनाते?
  • क्या होगा यदि हम खिड़कियों के बिना बनाते?

एक सटीक उत्तर प्राप्त करने के लिए, आपको गायब ईंटों के हर एक संयोजन के लिए पूरे महल को फिर से शून्य से बनाना होगा। चूंकि ऐसे लाखों संयोजन हैं, इसमें ब्रह्मांड की आयु से भी अधिक समय लग जाएगा। यह बहुत महंगा और धीमा है।

समाधान: SurrogateSHAP

लेखकों ने एक चतुर शॉर्टकट बनाया जिसे SurrogateSHAP कहा जाता है। इसे एक "जादुई सिम्युलेटर" के रूप में सोचें जो आपको ईंटों को हटाए बिना उनके परिणाम देखने की अनुमति देता है।

उन्होंने यह दो मुख्य चरणों में किया:

1. "जादुई मिश्रण" (प्रशिक्षण-मुक्त प्रॉक्सी)

महल को फिर से बनाने के बजाय, उन्होंने महसूस किया कि वे केवल उपलब्ध ईंटों के निर्देशों को मिश्रित कर सकते हैं।

  • कल्पना कीजिए कि AI एक शेफ है जो एक विशिष्ट रेसिपी का उपयोग करके एक आदर्श भोजन बनाना जानता है।
  • हर संभव सामग्रियों के संयोजन के लिए नया भोजन पकाने के बजाय, लेखकों ने महसूस किया कि वे शेफ को बस यह बता सकते हैं: "कल्पना करें कि आप एक ऐसा भोजन बना रहे हैं जो 'लाल ईंट' की रेसिपी और 'नीली ईंट' की रेसिपी का 50/50 मिश्रण है।"
  • शेफ वास्तव में खाना बनाए बिना तुरंत सिम्युलेट कर सकता है कि वह मिश्रित भोजन कैसा स्वाद देगा।
  • पेपर के शब्दों में: वे AI के मौजूदा ज्ञान का उपयोग यह सिम्युलेट करने के लिए करते हैं कि मॉडल कैसा दिखेगा यदि इसे केवल डेटा के एक विशिष्ट उपसमुच्चय (subset) पर प्रशिक्षित किया गया होता, जिससे महंगे प्रशिक्षण प्रक्रिया को पूरी तरह से छोड़ दिया जाता है।

2. "स्मार्ट गेसिंग ट्री" (TreeSHAP)

"जादुई मिश्रण" के साथ भी, अभी भी बहुत सारे संयोजन हैं जिन्हें एक-एक करके जांचना होगा। इसलिए, उन्होंने एक दूसरा तरीका अपनाया।

  • उन्होंने जादुई सिम्युलेटर से कुछ सौ प्रश्न पूछे (जैसे, "क्या होगा यदि हम लाल ईंटें हटा दें?" "क्या होगा यदि हम नीली ईंटें हटा दें?")।
  • फिर उन्होंने एक स्मार्ट डिसीजन ट्री (एक प्रकार का कंप्यूटर प्रोग्राम जो फ्लोचार्ट जैसा दिखता है) को उन उत्तरों के पैटर्न को सीखने के लिए प्रशिक्षित किया।
  • एक बार जब पेड़ ने पैटर्न सीख लिया, तो वह सिम्युलेटर से और कोई सवाल पूछे बिना तुरंत प्रत्येक योगदानकर्ता के सटीक मूल्य की गणना कर सकता था। यह एक खेल के नियम सीखने जैसा है, जिसमें कुछ राउंड खेलने के बाद, आप भविष्य के किसी भी गेम के परिणाम की भविष्यवाणी तुरंत कर सकते हैं।

यह क्यों मायने रखता है (परिणाम)

लेखकों ने इस पद्धति का परीक्षण तीन अलग-अलग "निर्माण परियोजनाओं" पर किया:

  1. CIFAR-20: एक मानक इमेज डेटासेट (जैसे खिलौना कारों और जानवरों को छाँटना)।
  2. ArtBench: पोस्ट-इंप्रेशनिस्ट पेंटिंग्स का एक संग्रह (जैसे वैन गॉग और मोनेट)।
  3. Fashion-Product: विभिन्न ब्रांडों के कपड़ों की छवियां।

निष्कर्ष स्पष्ट थे:

  • गति: उनकी विधि पिछले उन तरीकों की तुलना में 2 से 23 गुना तेज़ थी जो उत्तर का अनुमान लगाने के लिए आंशिक रिट्रेनिंग करने का प्रयास करते थे।
  • सटीकता: यह वास्तव में यह पहचानने में बहुत बेहतर था कि अंतिम छवि में किसका योगदान था। उदाहरण के लिए, आर्ट डेटासेट में, इसने सही ढंग से पहचाना कि किन कलाकारों की शैलियाँ सबसे प्रभावशाली थीं, जबकि अन्य तरीके भ्रमित हो गए या नकारात्मक स्कोर दे रहे थे।
  • निष्पक्षता: इसने "बुरे तत्वों" (bad actors) की सफलतापूर्वक पहचान की। स्किन कैंसर की छवियों से जुड़े एक क्लिनिकल केस स्टडी में, इस पद्धति ने ठीक से पहचाना कि किस अस्पताल के डेटा के कारण AI एक मरीज के लिंग और उसकी बीमारी के बीच एक अजीब, गलत संबंध बना रहा था। केवल उस एक अस्पताल के डेटा को हटाकर, AI अधिक निष्पक्ष हो गया।

निष्कर्ष

SurrogateSHAP एक ऐसा उपकरण है जो हमें AI आर्ट जनरेटर के लिए डेटा प्रदान करने वाले लोगों को निष्पक्ष रूप से भुगतान और श्रेय देने में मदद करता है। यह एक सिमुलेशन ट्रिक (AI को फिर से बनाने से बचने के लिए) और एक स्मार्ट पैटर्न-फाइंडिंग ट्री (स्कोर की गणना तुरंत करने के लिए) का उपयोग करके ऐसा करता है।

यह एक ऐसे कार्य को जो पहले कंप्यूटिंग पावर के वर्षों का काम था, मिनटों में किए जाने योग्य कार्य में बदल देता है, जिससे यह सुनिश्चित होता है कि सही लोगों को AI के व्यवहार के लिए श्रेय (या दोष) मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →