← नवीनतम पेपर
💻 computer science

LatentDiff: Scaling Semantic Dataset Comparison to Millions of Images

यह शोध पत्र LatentDiff को प्रस्तुत करता है, जो एक स्केलेबल और कुशल फ्रेमवर्क है जो विशाल डेटासेट्स के बीच व्याख्या योग्य (interpretable) अर्थपूर्ण अंतरों की पहचान करने के लिए प्रीट्रेंड विजन एनकोडर्स और डेंसिटी रेशियो एस्टीमेशन का लाभ उठाता है, और तब भी सटीकता एवं मजबूती में मौजूदा तरीकों से बेहतर प्रदर्शन करता है जब केवल छवियों का एक बहुत छोटा हिस्सा ही भिन्न होता है।

मूल लेखक: James Flora, Kowshik Thopalli, Akshay R. Kulkarni, Weng-Keen Wong, Shusen Liu

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Flora, Kowshik Thopalli, Akshay R. Kulkarni, Weng-Keen Wong, Shusen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दो विशाल फोटो एल्बम हैं, जिनमें लाखों तस्वीरें हैं। आपका काम यह पता लगाना है: "एल्बम A के पास ऐसी कौन सी एक चीज़ है जो एल्बम B में मौजूद नहीं है, और इसके विपरीत भी?"

आमतौर पर, यदि आप हर एक फोटो का विवरण पढ़ने की कोशिश करेंगे, तो इसमें बहुत समय लगेगा और बहुत अधिक खर्च आएगा। यदि आप केवल यादृच्छिक (randomly) रूप से फोटो देखेंगे, तो आप उन छोटी, महत्वपूर्ण अंतरों को मिस कर सकते हैं जो बहुत दुर्लभ हैं।

यह पेपर LatentDiff को पेश करता है, जो इस पहेली को सुलझाने का एक स्मार्ट, तेज़ और सस्ता तरीका है। यह कैसे काम करता है, यहाँ सरल विचारों में दिया गया है:

1. समस्या: "भूसे के ढेर में सुई" (The Needle in a Haystack)

फोटो एल्बम की तुलना करने वाले अधिकांश मौजूदा तरीके यह मान लेते हैं कि अंतर हर जगह मौजूद है (जैसे कि यदि एल्बम A पूरी तरह बिल्लियों का था और एल्बम B पूरी तरह कुत्तों का)। लेकिन वास्तविक दुनिया में, अंतर बहुत सूक्ष्म होते हैं। शायद एल्बम A में सर्फबोर्ड पर कुत्तों की 100 तस्वीरें हैं, जबकि एल्बम B में शून्य हैं। बाकी के लाखों फोटो बिल्कुल समान हैं।

इन दुर्लभ "मिसिंग मोड्स" (missing modes) को खोजने की कोशिश करना भूसे के ढेर में सुई खोजने जैसा है। यदि आप बस भूसे की एक मुट्ठी पकड़कर देखते हैं, तो आप शायद सुई नहीं ढूंढ पाएंगे।

2. समाधान: दो महाशक्तियाँ (Two Superpowers)

LatentDiff इन सुइयों को खोजने के लिए दो अलग-अलग "महाशक्तियों" का उपयोग करता है, जो एक जासूसी टीम की तरह मिलकर काम करती हैं।

महाशक्ति A: "फीचर डिक्शनरी" (SAE)

कंप्यूटर के दिमाग (एक प्री-ट्रेन्ड विज़न एनकोडर) को एक विशाल पुस्तकालय के रूप में सोचें जहाँ हर फोटो को सामग्रियों की एक सूची (जैसे "कुत्ता," "समुद्र तट," "धूप वाला") में बदल दिया जाता है।

  • यह कैसे काम करता है: LatentDiff एक टूल का उपयोग करता है जिसे स्पार्स ऑटोएनकोडर (Sparse Autoencoder - SAE) कहा जाता है, ताकि इन सामग्रियों को एक व्यवस्थित डिक्शनरी में व्यवस्थित किया जा सके। यह तस्वीरों को बहुत विशिष्ट, एकल-अर्थ वाले कॉन्सेप्ट्स (monosemantic features) में तोड़ देता है।
  • ट्रिक: यह बस यह गिनता है कि एल्बम A बनाम एल्बम B में प्रत्येक "सामग्री" कितनी बार आती है। यदि "सर्फबोर्ड" एल्बम A में 500 बार आता है और एल्बम B में 0 बार, तो सिस्टम इसे तुरंत चिह्नित कर देता है।
  • सीमा: यह केवल उन्हीं चीजों को खोज सकता है जो पहले से ही इसकी डिक्शनरी में हैं। यदि गायब कॉन्सेप्ट कुछ अजीब या नया है जिसे डिक्शनरी नहीं जानती, तो यह उसे मिस कर सकता है।

महाशक्ति B: "स्पॉटलाइट" (DRE)

यह उस समय के लिए बैकअप प्लान है जब डिक्शनरी विफल हो जाती है।

  • यह कैसे काम करता है: सामग्रियों को गिनने के बजाय, यह तरीका एक स्पॉटलाइट की तरह काम करता है। यह दोनों एल्बमों को स्कैन करता है और पूछता है, "कौन सी तस्वीरें दूसरे एल्बम से सबसे अधिक अलग दिखती हैं?"
  • ट्रिक: यह उन शीर्ष 10 या 20 तस्वीरों को ढूंढता है जो "सबसे अलग" (odd ones out) हैं। एक बार जब यह इन दुर्लभ तस्वीरों को ढूंढ लेता है, तो यह केवल उन कुछ तस्वीरों के लिए एक बहुत ही महंगे और धीमे AI (एक लैंग्वेज मॉडल) को बुलाता है ताकि उनका विवरण लिखा जा सके।
  • लाभ: यह लाखों सामान्य तस्वीरों का वर्णन करने में समय बर्बाद नहीं करता है। यह केवल अजीब तस्वीरों का वर्णन करता है, जिससे बहुत अधिक समय और पैसा बचता है।

3. टीमवर्क (Ensembling)

पेपर तर्क देता है कि केवल एक तरीके का उपयोग करना पर्याप्त नहीं है।

  • यदि आप केवल डिक्शनरी का उपयोग करते हैं, तो आप नए या अजीब कॉन्सेप्ट्स को मिस कर सकते हैं।
  • यदि आप केवल स्पॉटलाइट का उपयोग करते हैं, तो आप उन स्पष्ट अंतरों को मिस कर सकते हैं जो फैले हुए तो हैं लेकिन इतने "अत्यधिक" (extreme) नहीं हैं कि वे टॉप आउटलायर्स बन सकें।

LatentDiff इन दोनों को जोड़ता है। यह डिक्शनरी द्वारा पाए गए अंतरों की सूची लेता है और स्पॉटलाइट द्वारा पाए गए विवरणों को जोड़ देता है। यह एक "दोनों तरफ का सर्वश्रेष्ठ" (best of both worlds) परिणाम देता है जो लगभग सब कुछ पकड़ लेता है, सामान्य अंतरों से लेकर दुर्लभ और अजीब अंतरों तक।

4. "नोइज़ी-डिफ़" टेस्ट (The "Noisy-Diff" Test)

यह साबित करने के लिए कि यह काम करता है, लेखकों ने एक नया टेस्ट बनाया जिसे Noisy-Diff कहा जाता है।

  • पुराने टेस्ट: सेब के डिब्बे की तुलना संतरे के डिब्बे से करने जैसे थे। अंतर स्पष्ट था और हर जगह था।
  • Noisy-Diff: 1,000 सेबों के डिब्बे में चुपके से केवल 10 नाशपाती (pears) बदलने जैसा है। यह एक "भूसे के ढेर में सुई" वाला टेस्ट है।
  • परिणाम: पुराने तरीके (जैसे VisDiff) भ्रमित हो गए और नाशपाती को मिस कर गए क्योंकि वे रैंडम अनुमान पर निर्भर थे। LatDefit ने नाशपाती को हर बार खोज निकाला, भले ही वे डेटा का 1% से भी कम हिस्सा थीं।

5. यह क्यों एक बड़ी बात है (स्केल)

पेपर दिखाता है कि LatDefit लाखों छवियों (जैसे कि पूरी ImageNet डेटासेट) को कुछ घंटों में संभाल सकता है।

  • पुराना तरीका: लाखों फोटो की तुलना करने के लिए, आपको हर एक का वर्णन करना होगा। इसमें हफ्तों लग जाएंगे और बहुत अधिक कंप्यूटिंग पावर खर्च होगी।
  • LatDefit तरीका: यह पूरी लाइब्रेरी का एक त्वरित "स्कैन" करता है (जिसमें कुछ घंटे लगते हैं) और फिर केवल बहुत कम तस्वीरों पर महंगा "विवरण" वाला काम करता है। यह एक लाइब्रेरी को हर किताब के कवर को ऊपर से नीचे तक पढ़ने के बजाय मेटल डिटेक्टर से स्कैन करने जैसा है।

सारांश

LatDefit एक नया टूल है जो बड़ी इमेज कलेक्शंस की तुलना करता है ताकि यह पता लगाया जा सके कि क्या गायब है। यह सामान्य अंतरों को पहचानने के लिए एक डिक्शनरी का उपयोग करता है और दुर्लभ, अजीब अंतरों का पीछा करने के लिए एक स्पॉटलाइट का उपयोग करता है। इन दोनों को मिलाकर, यह उन "भूसे के ढेर में सुइयों" को ढूंढ निकालता है जिन्हें अन्य तरीके मिस कर देते हैं, और यह सब करते हुए यह तेज़, सस्ता और एक साथ लाखों फोटो संभालने में सक्षम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →