← नवीनतम पेपर
🤖 AI

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

यह शोध पत्र टेस्ट-टाइम मैचिंग (TTM) को प्रस्तुत करता है, जो एक पुनरावृत्ति स्व-सुधार एल्गोरिदम है जो एक नवीन ग्रुप मैचिंग स्कोर के माध्यम से मूल्यांकन संबंधी विसंगतियों को ठीक करता है और मल्टीमॉडल मॉडलों की कंपोजिशनल रीजनिंग क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, जिससे वे प्रमुख बेंचमार्क पर पिछले स्टेट-ऑफ-द-आर्ट और अनुमानित मानव प्रदर्शन को भी पीछे छोड़ने में सक्षम होते हैं।

मूल लेखक: Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

प्रकाशित 2026-04-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन तर्क पहेली (logic puzzle) का टेस्ट दे रहे हैं। यह टेस्ट आपसे एक बार में एक समस्या हल करने के लिए नहीं कहता। इसके बजाय, यह आपको चित्रों और विवरणों का एक छोटा "समूह" (group) देता है। विवरण बिल्कुल एक जैसे शब्दों का उपयोग करते हैं, बस उनका क्रम अलग होता है। आपका काम सही चित्र को सही विवरण के साथ मिलाना है।

लंबे समय तक, AI मॉडल (जो टेस्ट देने वाले "छात्र" हैं) इस विशिष्ट प्रकार की पहेली में विफल रहे हैं। वे अक्सर इतना कम स्कोर करते हैं कि ऐसा लगता है जैसे वे केवल अनुमान लगा रहे हैं, भले ही वे अन्य कार्यों में अविश्वसनीय रूप से स्मार्ट हों।

यह शोध पत्र तर्क देता है कि टेस्ट स्वयं ही गलत तरीके से बनाया गया है (rigged), न कि छात्र। लेखक एक नया ग्रेडिंग तरीका और एक नई अध्ययन तकनीक पेश करते हैं जो इन AI मॉडलों को अपनी वास्तविक बुद्धिमत्ता दिखाने में मदद करती है।

उनकी खोज और समाधान का विवरण यहाँ दिया गया है:

1. दोषपूर्ण ग्रेडिंग प्रणाली (The "All-or-Nothing" Trap)

कल्पना कीजिए कि एक शिक्षक मिलान परीक्षण (matching test) को ग्रेड दे रहा है। पुराना नियम (जिसे GroupScore कहा जाता था) अविश्वसनीय रूप से सख्त था:

  • यदि आप एक जोड़े (pair) में दोनों मिलान सही करते हैं, तो आपको एक अंक मिलता है।
  • यदि आप एक भी गलत करते हैं, तो आपको उस पूरे जोड़े के लिए शून्य अंक मिलते हैं।

लेखकों ने महसूस किया कि यह नियम अनुचित है। यह ऐसा ही है जैसे कहना, "यदि आप गणित की समस्या का 99% सही हल करते हैं लेकिन एक छोटी सी चिन्ह (sign) की गलती कर देते हैं, तो आपको शून्य अंक मिलते हैं।" क्योंकि नियम इतना सख्त है, इसलिए स्मार्ट मॉडल भी असफल दिखते हैं।

सुधार: एक नया ग्रेडिंग नियम (GroupMatch)
लेखकों ने GroupMatch नामक एक नया नियम प्रस्तावित किया। प्रत्येक जोड़े को अलग से देखने के बजाय, यह नियम पूरे समूह के कुल स्कोर को देखता है।

  • उपमा (Analogy): कल्पना कीजिए कि आपके पास फलों की दो टोकरियाँ हैं। पुराने नियम ने कहा, "यदि आप टोकरी A में गलत सेब रखते हैं, तो आप फेल हो जाते हैं।" नया नियम कहता है, "क्या आपने कुल मिलाकर टोकरियों में सबसे अच्छे सेब रखे हैं?"
  • परिणाम: जब लेखकों ने AI मॉडलों को इस अधिक निष्पक्ष नियम का उपयोग करके पुन: ग्रेड किया, तो उनके स्कोर आसमान छू गए। अचानक, मॉडल जो अनुमान लगाने जैसा लग रहे थे, वास्तव में अधिकांश उत्तर सही प्राप्त कर रहे थे। उन्हें बस इसे साबित करने का एक बेहतर तरीका चाहिए था।

2. "SimpleMatch" ट्रिक (त्वरित समाधान)

एक बार जब लेखकों को एहसास हुआ कि मॉडल वास्तव में उत्तर जानते हैं, तो उन्होंने उस "छिपे हुए ज्ञान" को पुराने, सख्त ग्रेडिंग सिस्टम में वापस अनुवाद करने का एक सरल तरीका खोज लिया।

  • उन्होंने मॉडल को पहले सबसे अच्छा समग्र मिलान चुनने दिया (नए निष्पक्ष नियम का उपयोग करके)।
  • फिर, उन्होंने मॉडल को उस विकल्प पर टिके रहने के लिए मजबूर किया।
  • परिणाम: इस सरल चरण ने एक शीर्ष AI (GPT-4.1) को सबसे कठिन पहेली टेस्ट पर औसत मानव से अधिक स्कोर करने में सक्षम बनाया। इसने सिद्ध कर दिया कि AI तर्क करने में बुरा नहीं था; वह केवल एक तकनीकी आधार (technicality) पर ग्रेड किया जा रहा था।

3. "Test-Time Matching" (TTM) अध्ययन सत्र

लेखक वहीं नहीं रुके। वे चाहते थे कि मॉडल बिना किसी शिक्षक की मदद के, टेस्ट लेते समय और भी स्मार्ट बनें। उन्होंने Test-Time Matching (TTM) नामक एक विधि बनाई:

TTM को एक स्व-सुधार सत्र (self-improving study session) के रूप में सोचें जो अंतिम परीक्षा से ठीक पहले होता है:

  1. पहला अनुमान (The First Guess): मॉडल टेस्ट के प्रश्नों को देखता है और मिलानों का अपना सबसे अच्छा अनुमान लगाता है।
  2. आत्मविश्वास की जाँच (The Confidence Check): मॉडल खुद से पूछता है, "मैं इस अनुमान को लेकर कितना आश्वस्त हूँ?"
    • यदि वह बहुत आश्वस्त है, तो वह उस अनुमान को एक "तथ्य" (pseudo-label) मानता है और उसका अध्ययन करता है।
    • यदि वह अनिश्चित है, तो वह फिलहाल उस अनुमान को अनदेखा कर देता है।
  3. अध्ययन (The Study): मॉडल अभी-अभी सीखे गए "तथ्यों" के आधार पर अपने मस्तिष्क को तेजी से समायोजित (fine-tunes) करता है।
  4. नियमों को ढीला करना (Relaxing the Rules): जैसे-जैसे मॉडल स्मार्ट होता जाता है, लेखक "कॉन्फिडेंस बार" को कम करते जाते हैं। अब, मॉडल उन थोड़े कठिन प्रश्नों का अध्ययन करना शुरू करता है जिनके बारे में वह पहले अनिश्चित था।
  5. चक्र (The Loop): यह चक्र दोहराया जाता है, मॉडल धीरे-धीरे और अधिक टेस्ट प्रश्नों से सीखता है जब तक कि उसने पूरे सेट में महारत हासिल न कर ली हो।

उपमा (Analogy): कल्पना कीजिए कि एक छात्र अभ्यास टेस्ट दे रहा है। केवल उत्तरों को चिह्नित करने के बजाय, वे कहते हैं, "मैं इन 5 प्रश्नों के बारे में 100% आश्वस्त हूँ, इसलिए मैं इनके पीछे के तर्क को याद करूँगा।" फिर, वे कहते हैं, "ठीक है, मैं अगले 5 प्रश्नों के बारे में 90% आश्वस्त हूँ, आइए मैं उन पर भी अध्ययन करूँ।" जब तक वे समाप्त करते हैं, उन्होंने केवल टेस्ट को देखकर ही सामग्री सीख ली होती है।

परिणाम

इस पद्धति का उपयोग करके, लेखकों ने कुछ प्रभावशाली उपलब्धियां हासिल कीं:

  • नए रिकॉर्ड: उन्होंने कई कठिन बेंचमार्क पर नए "स्टेट ऑफ द आर्ट" (State of the Art) रिकॉर्ड स्थापित किए।
  • दिग्गजों को हराना: एक छोटा, विशिष्ट मॉडल (SigLIP-B16), इस अध्ययन तकनीक का उपयोग करने के बाद, एक विशाल, सामान्य-उद्देश्य वाले AI (GPT-4.1) को विशिष्ट तर्क कार्यों पर हराने में सक्षम रहा।
  • यह हर जगह काम करता है: यह ट्रिक न केवल कठिन "समूह" वाली पहेलियों पर, बल्कि उन टेस्ट पर भी काम करती है जिनमें समूह नहीं थे। यह उन मॉडलों पर भी काम किया जो टेक्स्ट उत्पन्न करते हैं (जैसे कहानियाँ लिखना) और उन मॉडलों पर भी जो केवल छवियों की तुलना करते हैं।

मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र निष्कर्ष निकालता है कि AI मॉडल वास्तव में हमारी सोच से कहीं अधिक बेहतर "कंपोजिशनल रीजनिंग" (नई स्थितियों को समझने के लिए टुकड़ों को जोड़ना) में सक्षम हैं। हम बस उन्हें सही ढंग से माप नहीं पा रहे थे। ग्रेडिंग सिस्टम को ठीक करके और मॉडलों को उनके अपने टेस्ट उत्तरों से सीखने का तरीका देकर, हम बिना किसी नए डेटा या मानव शिक्षकों के उनकी वास्तविक क्षमता को अनलॉक कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →