← नवीनतम पेपर
💻 computer science

From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification

यह अध्ययन एक मल्टीमॉडल पशु पहचान ढांचे को प्रस्तुत करता है जो 1.9 मिलियन छवियों के विशाल डेटासेट और सिंथेटिक पाठ्य विवरणों का लाभ उठाकर 84.28% टॉप-1 सटीकता प्राप्त करता है, जो एनकोडर्स के व्यवस्थित एब्लेशन और एक इष्टतम गेटेड फ्यूजन रणनीति के माध्यम से यूनिमोडल बेसलाइन की तुलना में 11% सुधार का प्रतिनिधित्व करता है।

मूल लेखक: Vasiliy Kudryavtsev, Kirill Borodin, German Berezin, Kirill Bubenchikov, Grach Mkrtchian, Alexander Ryzhkov

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vasiliy Kudryavtsev, Kirill Borodin, German Berezin, Kirill Bubenchikov, Grach Mkrtchian, Alexander Ryzhkov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 7,00,000 अलग-अलग कुत्तों वाले एक विशाल, शोर-शराबे वाले डॉग पार्क में हैं। आप अपने पालतू जानवर, "बस्टर" को ढूंढ रहे हैं, लेकिन वह हजारों अन्य गोल्डन रिट्रीवर्स जैसा ही दिखता है। अब, कल्पना कीजिए कि आप उसे 19 लाख तस्वीरों की भीड़ में ढूंढ रहे हैं जहाँ रोशनी खराब है, कुछ कुत्ते सो रहे हैं, और कुछ दौड़ रहे हैं। यह वही चुनौती है जिसका यह शोध पत्र समाधान करता है: हम कंप्यूटर को लाखों के बीच एक विशिष्ट जानवर को खोजने के लिए कैसे सिखा सकते हैं, भले ही वह सामान्य से अलग दिख रहा हो?

यहाँ उनके समाधान की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. समस्या: "खोया हुआ पालतू जानवर" का दुस्वप्न

वर्तमान में, यदि आप अपना पालतू जानवर खो देते हैं, तो आप माइक्रोचिप या टैग पर भरोसा करते हैं। लेकिन वे गिर सकते हैं या टूट सकते हैं। विकल्प यह है कि एक फोटो ली जाए और कंप्यूटर से पूछा जाए, "क्या यह मेरा कुत्ता है?"

समस्या यह है कि कंप्यूटर वर्तमान में इसमें काफी खराब हैं। वे अक्सर भ्रमित हो जाते हैं क्योंकि:

  • उनके पास केवल आँखें हैं: वे तस्वीर को देखते हैं लेकिन उसके पीछे की कहानी को नहीं "समझते"।
  • डेटा अव्यवस्थित है: विशिष्ट जानवरों को ठीक से प्रशिक्षित करने के लिए पर्याप्त अच्छी तस्वीरें नहीं हैं।
  • वे चकमा खा जाते हैं: यदि कुत्ता गीला है, सो रहा है, या अंधेरे में है, तो वह अलग दिख सकता है।

2. समाधान: कंप्यूटर को "वांटेड पोस्टर" देना

शोधकर्ताओं ने महसूस किया कि जब इंसान खोए हुए पालतू जानवर को देखते हैं, तो वे केवल फोटो नहीं देखते। वे विवरण भी पढ़ते हैं: "वह एक काला बिल्ली है जिसके बाएं पंजे पर सफेद धब्बा है और उसकी नाक पर एक निशान है।"

इसलिए, टीम ने एक ऐसा सिस्टम बनाया जो एक के बजाय दो इंद्रियों का उपयोग करता है:

  1. आँखें (दृष्टि): यह फोटो को देखती है।
  2. दिमाग (पाठ/टेक्स्ट): यह जानवर का विवरण पढ़ता है।

उन्होंने 19 लाख फोटो का एक विशाल "लाइब्रेरी" बनाया जिसमें लगभग 7,00,000 अद्वितीय जानवर शामिल हैं। इसे काम करने के योग्य बनाने के लिए, उन्होंने एक सुपर-स्मार्ट AI (जिसे Qwen3-VL कहा जाता है) का उपयोग किया ताकि हर एक फोटो के लिए स्वचालित रूप से "वांटेड पोस्टर" विवरण लिखा जा सके। भले ही मूल फोटो में कोई विवरण न हो, AI ने उसका विवरण कुछ इस तरह लिखा, जैसे, "एक बाड़ पर बैठी एक रोएँदार नारंगी बिल्ली।"

3. प्रयोग: सर्वश्रेष्ठ "जासूसों" को खोजना

इस सिस्टम को काम करने के योग्य बनाने के लिए, उन्हें काम के लिए सर्वश्रेष्ठ "जासूसों" (AI मॉडल) को चुनना था। उन्होंने यह देखने के लिए परीक्षणों की एक श्रृंखला चलाई कि कौन से मॉडल सबसे तेज हैं, जैसे कि एक स्पोर्ट्स टूर्नामेंट।

  • विज़न डिटेक्टिव (दृष्टि जासूस): उन्होंने छवियों को देखने वाले कई मॉडलों का परीक्षण किया। विजेता एक विशाल मॉडल था जिसे SigLIP2-Giant कहा जाता है। इसे एक ऐसे जासूस के रूप में सोचें जिसके पास 2 अरब "मस्तिष्क कोशिकाएं" हैं जो धुंधली फोटो में भी एक विशिष्ट मूंछ के पैटर्न जैसी सूक्ष्म विवरण को पहचान सकता है।
  • टेक्स्ट डिटेक्टिव (पाठ जासूस): उन्होंने विवरण पढ़ने वाले मॉडलों का परीक्षण किया। विजेता एक छोटा, कुशल मॉडल था जिसे E5-Small-v2 कहा जाता है। यह वह जासूस है जो "निशान" या "सफेद धब्बे" जैसे शब्दों के अर्थ को समझने में माहिर है।

4. सीक्रेट सॉस: "गेटेड फ्यूजन" (Gated Fusion)

एक बार जब उनके पास सर्वश्रेष्ठ जासूस आ गए, तो उन्हें यह पता लगाना था कि वे एक साथ मिलकर कैसे काम करेंगे। आप फोटो और टेक्स्ट को बस एक साथ चिपका नहीं सकते; उन्हें एक-दूसरे से बात करने की जरूरत है।

उन्होंने उन्हें संयोजित करने के विभिन्न तरीके आजमाए:

  • "गोंद" विधि (The Glue Method): बस फोटो और टेक्स्ट को अगल-बगल रख देना। (बहुत अव्यवस्थित)।
  • "क्रॉस-अटेंशन" विधि (The Cross-Attention Method): टेक्स्ट को फोटो से सवाल पूछने के लिए कहना। (अच्छा है, लेकिन धीमा है)।
  • "गेटेड फ्यूजन" विधि (The Winner): यह एक ट्रैफिक लाइट या एक स्मार्ट बाउंसर की तरह है।
    • यदि फोटो स्पष्ट है और टेक्स्ट अस्पष्ट है, तो गेट फोटो को अधिक बोलने की अनुमति देता है।
    • यदि फोटो धुंधली है (शायद कुत्ता दौड़ रहा है) लेकिन टेक्स्ट कहता है "नाक पर निशान", तो गेट टेक्स्ट को नेतृत्व करने की अनुमति देता है।
    • यह गतिशील रूप से तय करता है कि उस सटीक क्षण में कौन सा सुराग अधिक महत्वपूर्ण है।

5. परिणाम: एक बड़ी छलांग

परिणाम प्रभावशाली थे। विशाल विज़न डिटेक्टिव को टेक्स्ट डिटेक्टिव के साथ "स्मार्ट बाउंसर" (गेटेड फ्यूजन) का उपयोग करके जोड़कर:

  • सटीकता (Accuracy): वे 84.3% समय (Top-1 accuracy) सही जानवर की पहचान कर सके।
  • सुधार: यह पिछले सर्वश्रेष्ठ सिस्टमों की तुलना में 11% का सुधार है जो केवल फोटो का उपयोग करते थे।
  • विश्वसनीयता: सिस्टम ने बहुत कम गलतियाँ कीं (एक कम "इक्वल एरर रेट"), जिसका अर्थ है कि इसने शायद ही कभी एक जानवर को दूसरे के साथ भ्रमित किया।

बड़ी तस्वीर

इसे एक आंखों पर पट्टी बांधकर खोज करने से टॉर्च और मानचित्र के साथ खोज करने में अपग्रेड करने के रूप में सोचें।

  • पुराना तरीका: "मुझे लगता है कि यह कुत्ता बस्टर जैसा दिखता है।" (केवल दिखावट के आधार पर अनुमान लगाना)।
  • नया तरीका: "यह कुत्ता बस्टर जैसा दिखता है, और विवरण कहता है कि उसकी नाक पर एक निशान है, जो बस्टर से पूरी तरह मेल खाता है।" (दिखावट के आधार पर आत्मविश्वासपूर्ण पहचान)।

यह क्यों मायने रखता है

यह तकनीक केवल खोए हुए पालतू जानवरों को खोजने के लिए नहीं है। यह मदद कर सकती है:

  • वन्यजीव संरक्षण: बिना टैग लगाए जंगली जानवरों को ट्रैक करने के लिए।
  • पशु चिकित्सा देखभाल: उन जानवरों के सटीक मेडिकल रिकॉर्ड रखने के लिए जिनके पास माइक्रोचिप नहीं है।
  • शेल्टर (आश्रय स्थल): एक अराजक वातावरण में खोए हुए जानवरों को उनके मालिकों से जल्दी मिलाने के लिए।

शोध पत्र निष्कर्ष निकालता है कि हालांकि उनका सिस्टम वर्तमान में भारी है (इसे शक्तिशाली कंप्यूटरों की आवश्यकता है), यह साबित करता है कि एक तस्वीर में थोड़ा सा "कथा/कहानी" (टेक्स्ट) जोड़ने से कंप्यूटर उस चीज़ को खोजने में बहुत स्मार्ट हो जाता है जिसे वह ढूंढ रहा है। भविष्य का कार्य इस सिस्टम को इतना छोटा बनाने पर केंद्रित होगा कि यह एक सामान्य स्मार्टफोन पर चल सके ताकि कोई भी अपने खोए हुए पालतू जानवर को खोजने के लिए इसका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →