← नवीनतम पेपर
💻 computer science

Same or Not? Enhancing Visual Perception in Vision-Language Models

यह शोधपत्र TWIN को प्रस्तुत करता है, जो इमेज-पेयर क्वेरीज़ का एक बड़े पैमाने का डेटासेट है जिसे विज़न-लैंग्वेज मॉडल्स को समान वस्तुओं के बीच सूक्ष्म दृश्य अंतरों को पहचानने के लिए प्रशिक्षित करने हेतु डिज़ाइन किया गया है, जिसके परिणामस्वरूप सामान्य प्रदर्शन से समझौता किए बिना विविध डोमेन में सूक्ष्म-स्तरीय पहचान (fine-grained recognition) में महत्वपूर्ण सुधार होता है।

मूल लेखक: Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Same or Not? Enhancing Visual Perception in Vision-Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "धुंधले चश्मे" का प्रभाव

कल्पना कीजिए कि आपके पास चश्मे की एक ऐसी जोड़ी है जो आपको यह बताने में तो माहिर है कि "वह एक कुत्ता है" या "वह एक कार है।" लेकिन अगर आप ध्यान से देखें, तो वे चश्मे यह नहीं बता सकते कि वह आपका कुत्ता है या आपके पड़ोसी का कुत्ता, भले ही वे दिखने में थोड़े अलग हों। वे यह भी नहीं पकड़ सकते कि क्या एक लाल सेब वास्तव में बगल वाले सेब की तुलना में लाल रंग का थोड़ा अलग शेड है।

पेपर का तर्क है कि वर्तमान AI मॉडल (जिन्हें विजन-लैंग्वेज मॉडल या VLMs कहा जाता है) ये "धुंधले चश्मे" पहने हुए हैं। वे सामान्य श्रेणियों (जैसे "बिल्ली" बनाम "कुत्ता") के लिए तो उत्कृष्ट हैं, लेकिन बारीक विवरणों (fine-grained details) के मामले में बहुत खराब हैं। वे आकार, बनावट या छोटे डिज़ाइन परिवर्तनों में सूक्ष्म अंतर को अक्सर मिस कर देते हैं।

समाधान: "TWIN" डेटासेट

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया प्रशिक्षण उपकरण बनाया जिसे TWIN कहा जाता है (जिसका अर्थ है Two-Image INstance comparisons या दो-छवि उदाहरण तुलना)।

  • उपमा: TWIN को AI के लिए एक विशाल "अंतर पहचानो" (Spot the Difference) पहेली पुस्तक के रूप में समझें।
  • यह कैसे काम करता है: AI को केवल एक तस्वीर दिखाकर यह पूछने के बजाय कि "यह क्या है?", TWIN AI को दो तस्वीरें अगल-बगल दिखाता है और एक बहुत ही विशिष्ट प्रश्न पूछता है: "क्या ये दोनों तस्वीरें बिल्कुल एक ही भौतिक वस्तु की हैं, या वे केवल दो अलग-अलग वस्तुएं हैं जो एक जैसी दिखती हैं?"
  • चुनौती: इस डेटासेट में "हार्ड नेगेटिव्स" (hard negatives) शामिल हैं। ये ऐसी जोड़ियाँ हैं जो लगभग एक जैसी दिखती हैं लेकिन वास्तव में अलग हैं। उदाहरण के लिए, एक ही ब्रांड (Eureka) के दो वैक्यूम क्लीनर जिनका रंग एक जैसा है लेकिन हैंडल का आकार अलग है।
  • पैमाना: उन्होंने ऐसी 561,000 जोड़ियों की एक लाइब्रेरी बनाई, जिसमें घरेलू वस्तुओं (जैसे मग और कुर्सियों) से लेकर फैशन और इलेक्ट्रॉनिक्स तक सब कुछ शामिल है।

प्रशिक्षण: AI को "करीब से देखना" सिखाना

शोधकर्ताओं ने मौजूदा AI मॉडलों (जैसे Qwen2.5-VL) को TWIN डेटासेट का उपयोग करके प्रशिक्षित किया।

  • रूपक: एक ऐसे छात्र की कल्पना करें जो गणित में अच्छा है लेकिन स्पेलिंग (वर्तनी) में बुरा है। शिक्षक (TWIN डेटासेट) उसे सामान्य गणित के सवाल देना बंद कर देता है और इसके बजाय उसे विशेष रूप से "their" और "there" के बीच अंतर पहचानने के लिए हजारों अभ्यास देता है।
  • विधि: उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक तकनीक का उपयोग किया। इसे एक वीडियो गेम की तरह समझें जहाँ AI को केवल तभी "रिवॉर्ड पॉइंट" मिलता है जब वह सही ढंग से पहचान लेता है कि दो चित्र एक जैसे हैं या अलग। यदि वह गलत अनुमान लगाता है, तो उसे कोई अंक नहीं मिलता। समय के साथ, AI अंक पाने के लिए सूक्ष्म विवरणों (जैसे लोगो की स्थिति या एक विशिष्ट वक्र/curve) पर ध्यान देना सीख जाता है।

परिणाम: स्पष्ट दृष्टि

TWIN पर प्रशिक्षण के बाद, AI मॉडल अपने काम में बेहतर हो गए।

  1. वे विवरणों के बारे में स्मार्ट हो गए: मॉडल उन चीजों को नोटिस करने लगे जिन्हें वे पहले अनदेखा कर देते थे, जैसे घड़ी की सुई का रंग या पक्षी की चोंच की बनावट।
  2. उन्होंने अच्छी तरह से सामान्यीकरण (generalization) किया: भले ही TWIN में मुख्य रूप से घरेलू वस्तुओं (जैसे वैक्यूम क्लीनर और चाकू) की तस्वीरें थीं, मॉडल उन चीजों में बारीक विवरण पहचानने में बेहतर हो गए जिन्हें उन्होंने पहले नहीं देखा था, जैसे पक्षी, लैंडमार्क और प्रसिद्ध पेंटिंग्स।
    • उपमा: यह विभिन्न प्रकार की पत्तियों को देखकर अपनी दृष्टि का अभ्यास करने जैसा है; अचानक, आप दो समान दिखने वाली कारों के बीच अंतर पहचानने में बेहतर हो जाते हैं, भले ही आपने कारों के लिए अभ्यास न किया हो।
  3. उन्होंने अपने अन्य कौशल नहीं खोए: पेपर ने यह जांचने के लिए भी चेक किया कि क्या AI ने अन्य चीजें (जैसे टेक्स्ट पढ़ना या गणित हल करना) करना तो नहीं भूल गया। परिणामों से पता चला कि AI ने अपने सामान्य कौशल बनाए रखते हुए यह नई "सुपरपावर" (बारीक विवरण देखने की क्षमता) हासिल कर ली।

नया परीक्षण: FGVQA

यह साबित करने के लिए कि AI वास्तव में बेहतर हुआ है, शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे FGVQA (Fine-Grained Visual Question Answering) कहा जाता है।

  • यह परीक्षण एक अंतिम परीक्षा की तरह है जिसे विशेष रूप से AI को धोखेबाज और एक जैसी दिखने वाली छवियों के साथ फंसाने के लिए डिज़ाइन किया गया है।
  • प्रशिक्षण से पहले, AI इस परीक्षण में संघर्ष करता था। TWIN के साथ प्रशिक्षण के बाद, AI का स्कोर काफी बढ़ गया (कुछ मामलों में 19% तक बेहतर), जिससे साबित हुआ कि इसने वास्तव में सूक्ष्म अंतरों को देखना सीख लिया है।

सारांश

यह पेपर TWIN पेश करता है, जो "एक जैसा या अलग" वाली छवियों की एक विशाल संग्रह है, ताकि AI मॉडलों को "बड़ी तस्वीर" देखने के बजाय "छोटे विवरणों" पर ध्यान केंद्रित करना सिखाया जा सके। इस डेटासेट पर प्रशिक्षण देकर, AI मॉडल जुड़वा बच्चों और एक जैसे दिखने वाले लोगों के बीच अंतर करने में बेहतर हो जाते हैं, बिना उन चीजों को भूले जो वे पहले से जानते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →