← नवीनतम पेपर
💬 NLP

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

यह शोध पत्र FewMMBench प्रस्तुत करता है, जो फ्यू-शॉट लर्निंग (few-shot learning) की स्थितियों के तहत मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि इंस्ट्रक्शन-ट्यून्ड (instruction-tuned) मॉडल्स अतिरिक्त प्रदर्शनों (demonstrations) या चेन-ऑफ-थॉट (Chain-of-Thought) प्रॉम्प्टिंग का उपयोग करने पर अक्सर न्यूनतम सुधार या यहाँ तक कि प्रदर्शन में गिरावट भी दिखाते हैं।

मूल लेखक: Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पहेलियाँ सुलझाना सिखा रहे हैं। आपके पास इसे सिखाने के दो तरीके हैं:

  1. "जीनियस" दृष्टिकोण: आप बस रोबोट को कहते हैं, "यह रही एक पहेली, इसे सुलझाओ!" (इसे Zero-Shot कहा जाता है)।
  2. "दिखाओ और बताओ" दृष्टिकोण: आप कहते हैं, "यह रही एक पहेली, और यहाँ समान पहेलियों को सुलझाने के तीन उदाहरण दिए गए हैं। अब, इस नई पहेली को सुलझाओ।" (इसे Few-Shot Learning कहा जाता है)।

लंबे समय तक, शोधकर्ताओं का मानना था कि "दिखाओ और बताओ" वाला दृष्टिकोण ही रोबोटों को स्मार्ट बनाने का असली मंत्र है। उनका मानना था कि यदि आप रोबोट को अधिक उदाहरण देते हैं, या ऐसे उदाहरण देते हैं जो समस्या से बहुत मिलते-जुलते हों, या उन्हें सोचने का एक चरण-दर-चरण तरीका (जिसे Chain-of-Thought कहा जाता है) बताते हैं, तो रोबोट बहुत बेहतर प्रदर्शन करेगा।

पेश है FEWMMBENCH।

FEWMMBENCH को नई पीढ़ी के रोबोटिक दिमागों (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) के लिए एक विशाल, कठोर "तनाव परीक्षण" या "ड्राइविंग परीक्षा" के रूप में समझें। ये रोबोट तस्वीरें देख भी सकते हैं और टेक्स्ट भी पढ़ सकते हैं। इस पेपर के रचनाकारों ने यह देखना चाहा: क्या "दिखाओ और बताओ" वास्तव में इन चित्र-पढ़ने वाले रोबोटों के लिए काम करता है, या यह सिर्फ एक मिथक है?

बड़ी हैरानी: "दिखाओ और बताओ" का जाल

शोधकर्ताओं ने 26 अलग-अलग रोबोटिक दिमागों का परीक्षण किया। उन्होंने पहेलियों को चार अलग-अलग तरीकों से दिया:

  • कोई संकेत नहीं: बस पहेली।
  • रैंडम संकेत: उन्हें रैंडम उदाहरण दिखाना।
  • स्मार्ट संकेत: उन्हें ऐसे उदाहरण दिखाना जो बिल्कुल पहेली जैसे दिखते हों।
  • सोचने के संकेत: उन्हें ऐसे उदाहरण दिखाना जिनमें एक "सोचने की प्रक्रिया" शामिल थी (जैसे, "पहले मैं रंग देखता हूँ, फिर मैं गिनती करता हूँ...")।

यहाँ उन्हें क्या पता चला, सरल उपमाओं का उपयोग करते हुए:

1. "ज़रूरत से ज़्यादा तैयार" छात्र

जिन रोबोटों को पहले से ही निर्देशों का पालन करने के लिए प्रशिक्षित किया गया था (Instruction-Tuned models), वे प्रतिभाशाली छात्रों की तरह थे जिन्हें पहले से ही विषय का ज्ञान था

  • परिणाम: जब आपने उन्हें अतिरिक्त उदाहरण दिए ("दिखाओ और बताओ"), तो वे स्मार्ट नहीं हुए। वास्तव में, वे कभी-कभी और भी बेवकूफ हो गए।
  • उपमा: एक मास्टर शेफ की कल्पना करें जो बिना किसी रेसिपी के एक परफेक्ट केक बना सकता है। यदि आप उन्हें केक बनाने से ठीक पहले 10 अन्य केक रेसिपी वाली एक कुकबुक थमा देते हैं, तो वे भ्रमित हो सकते हैं, ज़रूरत से ज़्यादा सोच सकते हैं और केक खराब कर सकते हैं। वह अतिरिक्त जानकारी केवल शोर (noise) थी।

2. "सर्च इंजन" मददगार साबित नहीं हुआ

शोधकर्ताओं ने स्मार्ट बनने की कोशिश की और टेस्ट क्वेश्चन से बिल्कुल मिलते-जुलते उदाहरण खोजने का प्रयास किया, बजाय इसके कि केवल रैंडम उदाहरण चुने जाएं।

  • परिणाम: इससे कोई फर्क नहीं पड़ा। रोबोटों ने उतना ही प्रदर्शन किया चाहे उदाहरण रैंडम हों या पूरी तरह से मेल खाते हों।
  • उपमा: यह कार चलाने के तरीके को सीखने के लिए किसी दूसरे कार को चलाते हुए वीडियो देखने जैसा है। रोबोट "परफेक्ट उदाहरण" और "रैंडम उदाहरण" के बीच अंतर नहीं कर सके। वे वास्तव में उदाहरणों से सीख नहीं रहे थे; वे बस प्रश्न के आधार पर अनुमान लगा रहे थे।

3. "चरण-दर-चरण" गाइड उल्टा पड़ गया

यह सबसे बड़ा झटका था। केवल टेक्स्ट-आधारित रोबोटों में, उनसे "चरण-दर-चरण सोचने" (Chain-of-Thought) के लिए कहना आमतौर पर उन्हें स्मार्ट बनाता है।

  • परिणाम: इन चित्र-पढ़ने वाले रोबोटों के लिए, उन्हें अपने विचार लिखने के लिए मजबूर करने से उनका प्रदर्शन खराब हो गया
  • उपमा: कल्पना कीजिए कि आप सूर्यास्त देख रहे हैं। यह सुंदर है और आप बस जानते हैं कि यह एक सूर्यास्त है। यदि कोई आपको रुकने और इस पर 5-चरणीय निबंध लिखने के लिए मजबूर करता है कि यह सूर्यास्त क्यों है ("1. आकाश नारंगी है। 2. सूरज नीचे है..."), तो आप खुद पर संदेह करने लगेंगे और ध्यान भटक सकता है। रोबोटों ने "हैलुसिनेशन" (मनगढ़ंत बातें बनाना) शुरू कर दिया या अपने ही लेखन से विचलित हो गए, जिससे वे वास्तव में तस्वीर देखना भूल गए।

यह क्यों मायने रखता है?

इन रोबोटों की वर्तमान स्थिति को एक नए नियुक्त कर्मचारी की तरह समझें।

  • यदि आप एक जूनियर कर्मचारी (बिना इंस्ट्रक्शन ट्यूनिंग वाला मॉडल) को काम पर रखते हैं, तो उन्हें उदाहरण दिखाना उनकी बहुत मदद करता है। उन्हें ट्रेनिंग व्हील्स की ज़रूरत होती है।
  • यदि आप एक सीनियर एक्सपर्ट (एक इंस्ट्रक्शन-ट्यून्ड मॉडल) को काम पर रखते हैं, तो उन्हें काम करने का तरीका पहले से ही पता है। यदि आप उदाहरणों और स्टेप-बाय-स्टेप गाइड्स के साथ उन्हें माइक्रो-मैनेज करना शुरू करते हैं, तो आप वास्तव में उन्हें धीमा कर देते हैं और भ्रमित कर देते हैं।

निष्कर्ष (Takeaway)

पेपर यह निष्कर्ष निकालता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स अभी भी संदर्भ (context) से सीखने के लिए संघर्ष कर रहे हैं। वे "जीरो-शॉट" (अपने आप हल करना) में बहुत अच्छे हैं लेकिन "फ्यू-शॉट" (उदाहरणों से सीखना) में बहुत खराब हैं।

FEWMMBENCH एक नया टूल है जो इस कमजोरी को उजागर करता है। यह एक दर्पण की तरह है जो हमें दिखाता है: "हे, तुम्हारे रोबोट देखने में तो अच्छे हैं, लेकिन वे बातचीत में जो देखते हैं उससे सीखने में खराब हैं।"

लेखक आशा करते हैं कि यह बेंचमार्क इंजीनियरों को यह समझने में मदद करेगा कि वे इन रोबोटों को इंसानों की तरह सीखने (उदाहरण दिखाकर) के लिए मजबूर करना बंद करें और उन्हें ऐसे तरीकों से बनाने पर ध्यान दें जो वास्तव में मशीनों के लिए काम करते हैं।

संक्षेप में: हमें लगा था कि रोबोटों को अधिक उदाहरण और चरण-दर-चरण मार्गदर्शिका देने से वे जीनियस बन जाएंगे। FEWMMBENCH ने साबित कर दिया कि चित्र-पढ़ने वाले रोबोटों के लिए, यह अक्सर उन्हें केवल भ्रमित ही करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →