← नवीनतम पेपर
🤖 machine learning

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

यह शोध पत्र CroVCA को प्रस्तुत करता है, जो क्रॉस-व्यू कोड अलाइनमेंट और कोडिंग-रेट मैक्सिमाइजेशन के माध्यम से कॉम्पैक्ट बाइनरी कोड सीखने के लिए एक सरल और कुशल फ्रेमवर्क है, जो न्यूनतम प्रशिक्षण समय और कम्प्यूटेशनल लागत के साथ बड़े पैमाने पर इमेज रिट्रीवल में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास लाखों किताबों (छवियों) का एक विशाल पुस्तकालय है। आप एक विशिष्ट पुस्तक, या एक ऐसी पुस्तक के समान पुस्तकें खोजना चाहते हैं जिसे आपने हाथ में पकड़ा हुआ है, और वह भी एक सेकंड के भीतर।

समस्या यह है कि आधुनिक AI (जिसे फाउंडेशन मॉडल्स कहा जाता है) द्वारा दी गई इन किताबों के "विवरण" अविश्वसनीय रूप से विस्तृत लेकिन भी बहुत लंबे हैं। वे हर छवि के लिए 768-पृष्ठों के सारांश की तरह हैं। लाखों 768-पृष्ठों के सारांशों को खोजना धीमा, महंगा और बहुत अधिक स्टोरेज स्पेस की मांग करने वाला काम है।

हैशिंग (Hashing) इसका समाधान है: यह उस 768-पृष्ठों के सारांश को एक छोटे, 16-अंकों के पिन कोड (PIN code) में कंप्रेस करने जैसा है। यदि दो छवियां समान हैं, तो उनके पिन कोड भी समान होने चाहिए। यह खोज को तत्काल बना देता है और स्टोरेज को सस्ता कर देता है।

हालाँकि, ये पिन कोड बनाना कठिन रहा है। मौजूदा तरीके एक जटिल, बहु-चरणीय मैनुअल (manual) वाले पिन जनरेटर बनाने की कोशिश करने जैसे हैं, जिसे सीखने में घंटों लगते हैं और जो अक्सर खराब कोड उत्पन्न करते हैं।

यह पेपर CroVCA (क्रॉस-व्यू कोड एलाइनमेंट) और एक टूल HashCoder पेश करता है। यह कैसे काम करता है, इसे सरल उपमाओं के साथ समझाया गया है:

1. मूल विचार: "जुड़वां परीक्षण" (The "Twin Test")

कल्पना कीजिए कि आपके पास जुड़वां बच्चे हैं (एक ही बिल्ली की दो थोड़ी अलग तस्वीरें, या एक ही श्रेणी की बिल्लियों की दो तस्वीरें)।

  • पुराना तरीका: आप जुड़वा बच्चों को जटिल नियमों और कई शिक्षकों का उपयोग करके एक विशिष्ट पिन कोड याद करने के लिए मजबूर करेंगे।
  • CroVCA का तरीका: आप बस जुड़वा बच्चों से पूछते हैं, "क्या आप पिन पर सहमत हैं?"
    • आप जुड़वा A को एक फोटो दिखाते हैं और उससे एक पिन कोड जेनरेट करने के लिए कहते हैं।
    • आप जुड़वा B को उसी बिल्ली की एक थोड़ी अलग फोटो दिखाते हैं और उससे अनुमान लगाने को कहते हैं कि जुड़वा A का पिन क्या होना चाहिए
    • यदि वे असहमत हैं, तो आप उन्हें सहमत होने के लिए प्रेरित करते हैं।
    • यदि वे सहमत हैं, तो आप उन्हें पुरस्कृत करते हैं।

यह "सहमति" की प्रक्रिया क्रॉस-व्यू कोड एलाइनमेंट (Cross-View Code Alignment) कहलाती है। यह इतना सरल है कि यह दो अलग-अलग दुनियाओं को एकीकृत करता है:

  • अनसुपरवाइज्ड (Unsupervised): जुड़वा बनाने के लिए केवल रैंडम फोटो फिल्टर्स (augmentations) का उपयोग करना।
  • सुपरवाइज्ड (Supervised): इस तथ्य का उपयोग करना कि दो तस्वीरें दोनों "कुत्ते" हैं ताकि जुड़वा बनाए जा सकें।
    ये दोनों एक ही सरल नियम के साथ काम करते हैं: पिनों को मेल खाना चाहिए।

2. गुप्त नुस्खा: "संतुलित पासा" (The "Balanced Dice")

एक समस्या है। यदि आप केवल AI को यह कहते हैं कि "पिनों को मेल खाना चाहिए," तो वह आलसी हो सकता है और यह तय कर सकता है कि हर छवि को पिन 0000000000000000 दे दिया जाए। इसे "कोलैप्स" (collapse) कहा जाता है। यह आसान है, लेकिन बेकार है क्योंकि आप छवियों के बीच अंतर नहीं कर पाएंगे।

इसे रोकने के लिए, CroVCA एक ट्रिक का उपयोग करता है जिसे कोडिंग-रेट मैक्सिमाइजेशन (Coding-Rate Maximization) कहा जाता है।

  • सोचिए कि पिन के बिट्स (bits) 16 पासों (dice) का एक सेट हैं।
  • AI को इन पासों को इस तरह से फेंकने के लिए मजबूर किया जाता है कि वे हर नंबर (0 और 1) का समान रूप से उपयोग करें।
  • यह एक शिक्षक की तरह है जो छात्र से कहता है: "तुम्हें संख्या 1 का उपयोग ठीक आधी बार और संख्या 0 का उपयोग ठीक आधी बार करना होगा, अन्यथा तुम फेल हो जाओगे।"
  • यह AI को विविध, अद्वितीय पिन बनाने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि पुस्तकालय खोजने योग्य बना रहे।

3. टूल: HashCoder

पेपर एक छोटा, हल्का न्यूरल नेटवर्क HashCoder पेश करता है।

  • फाउंडेशन मॉडल (बड़ा AI) को एक मास्टर शेफ के रूप में समझें जो भोजन के बारे में सब कुछ जानता है लेकिन सरल रेसिपी लिखने के लिए बहुत व्यस्त है।
  • HashCoder एक जूनियर sous-chef है।
  • मास्टर शेफ व्यंजन का एक जटिल विवरण (इमेज एम्बेडिंग) देता है।
  • जूनियर sous-chef का एकमात्र काम उस जटिल विवरण को एक सरल, 16-अंकों के पिन कोड में अनुवादित करना है।
  • क्योंकि Sous-Chef छोटा और तेज़ है, यह केवल 5 मिनट (5 ट्रेनिंग इपोक) में इस अनुवाद को सीख सकता है, जबकि अन्य तरीकों में कई दिन लग सकते हैं।

4. यह गेम चेंजर क्यों है?

  • गति: यह 768-पृष्ठों के सारांश को 2 मिनट से कम समय में 16-अंकों के पिन में बदल देता है।
  • गुणवत्ता: इतने छोटे पिन (16 बिट्स) के बावजूद, यह छवि की "आत्मा" को याद रखता है। यदि आप "जेब्रा" खोजते हैं, तो यह केवल एक ब्लैक-एंड-व्हाइट धारीदार शर्ट नहीं ढूंढेगा; यह वास्तविक जेब्रा ढूंढेगा, भले ही वे एक-दूसरे से अलग दिखते हों।
  • बहुमुखी प्रतिभा: आप इसे एक बड़े डेटासेट (जैसे ImageNet) पर एक बार प्रशिक्षित कर सकते हैं, और फिर उसी "पिन जनरेटर" का उपयोग पूरी तरह से अलग कार्यों (जैसे विशिष्ट पौधों या जानवरों को खोजने) के लिए बिना पुन: प्रशिक्षण के कर सकते हैं। यह एक सार्वभौमिक भाषा सीखने जैसा है जो हर जगह काम करती है।

सारांश

CroVCA जटिल AI इमेज विवरणों को छोटे, खोजने योग्य पिन कोड में बदलने का एक नया, अत्यंत कुशल तरीका है। एक जटिल बहु-चरणीय रेसिपी के बजाय, यह सुनिश्चित करने के लिए कि कोड मेल खाते हैं, यह एक सरल "जुड़वां परीक्षण" का उपयोग करता है, और यह सुनिश्चित करने के लिए कि वे अद्वितीय हैं, एक "संतुलित पासा" नियम का उपयोग करता है। परिणाम एक ऐसा सिस्टम है जो तेज़, सस्ता और अविश्वसनीय रूप से स्मार्ट है, जो लाखों की भीड़ में लगभग तुरंत सही छवि खोजने में सक्षम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →