← नवीनतम पेपर
💻 computer science

DMin: Scalable Training Data Influence Estimation for Diffusion Models

यह शोध पत्र DMin को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो उच्च सटीकता बनाए रखते हुए स्टोरेज आवश्यकताओं और रिट्रीवल समय को नाटकीय रूप से कम करने के लिए ग्रेडिएंट कम्प्रेशन का लाभ उठाकर अरबों-पैरामीटर वाले डिफ्यूजन मॉडल्स के लिए कुशल इन्फ्लुएंस एस्टीमेशन को सक्षम बनाता है।

मूल लेखक: Huawei Lin, Yingjie Lao, Weijie Zhao

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huawei Lin, Yingjie Lao, Weijie Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास डिफ्यूजन (Diffusion) नाम का एक जादुई कलाकार है। यह कलाकार आपकी हर मांग को पेंट कर सकता है: जैसे कि एक "प्यारा रोएँदार बेबी जिराफ-शेर," एक "कॉस्मिक हॉरर कथुलु (Cthulhu)," या "पतझड़ में मेपल का जंगल।"

लेकिन रहस्य यह है: इस कलाकार को अपने विचार कहाँ से मिलते हैं?

इस कलाकार को इंटरनेट से लाखों छवियों और विवरणों वाली एक विशाल लाइब्रेरी पर प्रशिक्षित किया गया था। जब आप उससे कोई विशिष्ट पेंटिंग बनाने के लिए कहते हैं, तो वह केवल शेल्फ से एक अकेली छवि नहीं निकालता; बल्कि वह कुछ नई चीज़ बनाने के लिए हजारों अलग-अलग प्रशिक्षण उदाहरणों के कॉन्सेप्ट्स को आपस में मिला देता है।

समस्या:
यदि आप जानना चाहते हैं कि उस विशिष्ट पेंटिंग को प्रेरित करने वाली वास्तव में कौन सी तस्वीरें उस विशाल लाइब्रेरी से ली गई थीं, तो यह एक समुद्र तट पर रेत के एक अकेले कण को खोजने जैसा है।

  • पुराना तरीका: पिछले तरीकों ने इसे हल करने की कोशिश की जिसमें लाइब्रेरी के हर एक पन्ने की एक "फोटोकॉपी" ली जाती थी, कलाकार ने जो भी शब्द पढ़े थे उन्हें हाइलाइट किया जाता था, और फिर उन फोटोकॉCopies की आपकी नई पेंटिंग से तुलना की जाती थी।
  • चुनौती: एक आधुनिक, सुपर-स्मार्ट कलाकार (जैसे स्टेबल डिफ्यूजन 3) के लिए, केवल एक प्रशिक्षण छवि की "फोटोकॉपी" भी बहुत बड़ी होती है। यदि आप उन सभी छवियों की फोटोकॉपी रखना चाहें जिन्हें कलाकार ने सीखा है, तो आपको सैकड़ों टेराबाइट्स (Terabytes) हार्ड ड्राइव स्पेस की आवश्यकता होगी। यह एक गोदाम को कागज से भरने जैसा है, सिर्फ थोड़ी सी गणित करने के लिए। यह सामान्य कंप्यूटरों के लिए असंभव है।

समाधान: DMin (डिफ्यूजन मॉडल इन्फ्लुएंस)
लेखकों ने एक नया टूल बनाया है जिसे DMin कहा जाता है। इसे एक सुपर-स्मार्ट, अत्यंत संक्षिप्त लाइब्रेरियन के रूप में समझें।

DMin कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "फोटो" के बजाय "फिंगरप्रिंट"

हर प्रशिक्षण छवि की एक विशाल, हाई-रिज़ॉल्यूशन फोटो रखने के बजाय (जिसमें बहुत जगह लगती है), DMin उस छवि के प्रति कलाकार की प्रतिक्रिया का एक फिंगरप्रिंट लेता है।

  • पुराना तरीका: "यहाँ वह पूरी किताब है जो कलाकार ने पढ़ी।" (बहुत बड़ी!)
  • DMin का तरीका: "यहाँ 1KB का एक छोटा सा नोट है जो बताता है कि इस छवि को देखते समय कलाकार का मस्तिष्क ठीक कैसे बदला।"

2. "मैजिक कंप्रेशन" (जादुई संपीड़न) का कमाल

वे एक विशाल फिंगरप्रिंट को एक छोटे से नोट में कैसे सिकोड़ते हैं? वे एक चतुर ट्रिक का उपयोग करते हैं जिसे ग्रेडिएंट कंप्रेशन (Gradient Compression) कहा जाता है।
कल्पना कीजिए कि आपके पास लेगो ब्रिक्स (Lego bricks) का एक विशाल, बिखरा हुआ ढेर (डेटा) है।

  • चरण 1: आप ढेर को हिलाते हैं ताकि ईंटें एक रैंडम क्रम में आ जाएं (परम्यूटेशन/Permutation)।
  • चरण 2: फिर आप एक दोस्त से हर ईंट के लिए सिक्का उछालने को कहते हैं। यदि हेड आता है, तो आप ईंट को रखते हैं; यदि टेल आता है, तो आप उसे उल्टा कर देते हैं (रैंडम प्रोजेक्शन/Random Projection)।
  • चरण 3: आप ईंटों को छोटे बकेटों में समूहबद्ध करते हैं और बस गिनते हैं कि प्रत्येक बकेट में कितनी ईंटें हैं (ग्रुप एडिशन/Group Addition)।

परिणाम? आपके पास मूल ईंटें नहीं हैं, लेकिन आपके पास संख्याओं की एक छोटी सूची है जो अभी भी आपको ढेर के आकार के बारे में सब कुछ बताती है। यह स्टोरेज को गीगाबाइट्स से किलोबाइट्स में सिकोड़ देता है।

3. "तेज़ खोज" (KNN)

एक बार जब लाइब्रेरियन के पास लाखों छवियों के ये छोटे फिंगरप्रिंट होते हैं, तो वे आपके प्रश्न का उत्तर तुरंत दे सकते हैं।

  • प्रश्न: "किस प्रशिक्षण छवियों ने इस 'कॉस्मिक हॉरर कथुलु' को प्रेरित किया?"
  • खोज: लाइब्रेरियन आपके नए कथुलु का फिंगरप्रिंट लेता है और डेटाबेस में मौजूद छोटे फिंगरप्रिंट के साथ एक सुपर-फास्ट "मैच" चलाता है।
  • परिणाम: एक सेकंड से भी कम समय में, लाइब्रेरियन उन शीर्ष 25 छवियों की ओर इशारा करता है जो सबसे अधिक प्रभावशाली थीं।

यह क्यों महत्वपूर्ण है

  • पारदर्शिता: यदि कोई कलाकार गलती से कुछ आपत्तिजनक या पक्षपाती पेंट करता है, तो हम अब उस विशिष्ट खराब छवि तक वापस जा सकते हैं जिसने प्रशिक्षण डेटा में उस प्रभाव को पैदा किया।
  • दक्षता: हम यह दुनिया के सबसे बड़े, सबसे शक्तिशाली AI मॉडल के साथ कर सकते हैं बिना किसी शहर जितने बड़े सुपरकंप्यूटर की आवश्यकता के।
  • सुरक्षा: यह हमें AI की "यादों" को समझने और उन्हें ठीक करने में मदद करता है, जिससे वे अधिक सुरक्षित और विश्वसनीय बनते हैं।

संक्षेप में:
पहले, AI के विचार के स्रोत को खोजना घास के ढेर में सुई खोजने जैसा था, जबकि वह घास का ढेर आग की लपटों में घिरा था और आपके पास ऑक्सीजन खत्म हो रही थी। DMin उस घास के ढेर को एक छोटी, व्यवस्थित कार्ड कैटलॉग में बदलने जैसा है, जिससे आप पलक झपकते ही सुई को ढूंढ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →