← नवीनतम पेपर
🤖 AI

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

यह शोध पत्र MMBench-Live को प्रस्तुत करता है, जो एक निरंतर विकसित होने वाला मल्टीमॉडल बेंचमार्क है, जिसे एक मल्टी-एजेंट स्वचालित पाइपलाइन द्वारा संचालित किया जाता है जो वितरण निरंतरता (distribution consistency) को बनाए रखते हुए और डेटा संदूषण (data contamination) को कम करते हुए लागत प्रभावी, उच्च गुणवत्ता वाले मूल्यांकन उदाहरण उत्पन्न करता है।

मूल लेखक: Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक कक्षा के छात्रों को ग्रेड देने की कोशिश कर रहे हैं, जो कंप्यूटर के माध्यम से दुनिया को देखना और समझना सीख रहे हैं (इन्हें विजन-लैंग्वेज मॉडल्स या VLMs कहा जाता है)।

लंबे समय से, शिक्षकों ने सभी को ग्रेड देने के लिए उन्हीं पुराने टेस्ट पेपर्स (स्टैटिक बेंचमार्क) का उपयोग किया है। लेकिन एक बड़ी समस्या है: छात्र इंटरनेट से पढ़ाई कर रहे हैं, और इंटरनेट हर सेकंड बदल रहा है। यदि टेस्ट पेपर पिछले साल का है, तो हो सकता है कि छात्रों ने उत्तर पहले ही याद कर लिए हों क्योंकि वे प्रश्न उनके अध्ययन सामग्री (डेटा कंटैमिनेशन) में दिखाई दिए थे। साथ ही, टेस्ट पुराना भी हो सकता है, जो यह दर्शाने में विफल रहता है कि छात्र आज वास्तव में क्या कर सकते हैं।

MMBench-Live एक नया, क्रांतिकारी तरीका है टेस्ट बनाने का। स्थिर कागज प्रिंट करने और यह उम्मीद करने के बजाय कि वह प्रासंगिक बना रहेगा, लेखकों ने एक रोबोटिक टेस्ट-मेकिंग फैक्ट्री बनाई है जो लगातार नए, ताज़ा प्रश्न तैयार करती रहती है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "रेसिपी बुक" (स्ट्रक्चर्ड बेंचमार्क)

सबसे पहले, टीम ने केवल रैंडम तस्वीरें नहीं लीं। उन्होंने मूल टेस्ट (MMBench) को एक सख्त रेसिपी बुक में बदल दिया।

  • उन्होंने हर प्रश्न को उसके मूल तत्वों में तोड़ दिया: यह किस कौशल का परीक्षण कर रहा है? (जैसे, साइन पढ़ना, वस्तुओं को गिनना, मज़ाक समझना)।
  • उन्होंने मूल प्रश्नों का "स्वाद" (फ्लेवर) पहचाना (जैसे, "इन प्रश्नों में आमतौर पर व्यस्त शहर की सड़कें शामिल होती हैं" या "इनमें मेनू पर टेक्स्ट होता है")।
  • यह रेसिपी सुनिश्चित करती है कि भले ही नए प्रश्न बिल्कुल नए हों, लेकिन उनका स्वाद ठीक वैसा ही हो जैसा पुराने प्रश्नों का था। वे उन्हीं कौशलों का परीक्षण उसी तरह से करते हैं।

2. "स्मार्ट स्काउट" (टास्क-अवेयर डेटा एक्विजिशन)

इसके बाद, सिस्टम वास्तविक दुनिया (इंटरनेट) से नई तस्वीरें खोजने के लिए एक स्मार्ट स्काउट भेजता है।

  • समस्या: यदि आप केवल एक सर्च इंजन से "बिल्ली की तस्वीर" मांगते हैं, तो आपको एक कार्टून बिल्ली, एक खिलौना बिल्ली, या सोती हुई बिल्ली मिल सकती है। लेकिन यदि आपके टेस्ट के लिए "लेजर पॉइंटर का पीछा करती हुई बिल्ली" की आवश्यकता है, तो एक जेनेरिक सर्च विफल हो जाएगा।
  • समाधान: स्काउट का एक विशिष्ट मिशन होता है। वह बाहर जाता है, तस्वीरें ढूंढता है, और फिर एक फीडबैक कंट्रोलर (एक सख्त संपादक) उन तस्वीरों की जांच करता है।
  • लूप: यदि स्काउट एक सोती हुई बिल्ली की तस्वीर लाता है, तो संपादक कहता है, "नहीं, यह रेसिपी में फिट नहीं बैठता। इसके बजाय 'एक्टिव कैट्स' (सक्रिय बिल्लियों) के लिए खोजने का प्रयास करें।" स्काउट फिर से प्रयास करता है। यह स्वचालित रूप से तब तक होता है जब तक कि तस्वीरें मूल टेस्ट के "स्वाद" से पूरी तरह मेल न खा जाएं।

3. "शेफ और टेस्ट-टेस्टर" (QA जनरेशन और वेरिफिकेशन)

एक बार जब सही तस्वीरें मिल जाती हैं, तो सिस्टम को प्रश्न और उत्तर लिखने की आवश्यकता होती है।

  • शेफ: AI "शेफ" की एक टीम तस्वीर के आधार पर प्रश्न और उत्तर लिखती है।
  • टेस्ट-टेस्टर: यहीं पर चालाकी है। आमतौर पर, एक AI केवल उत्तर का अनुमान लगा सकता है। लेकिन MMBench-Live AI को उत्तर प्राप्त करने के लिए एक चरण-दर-चरण रेसिपी (एक निष्पादन योग्य योजना) लिखने के लिए मजबूर करता है।
  • वेरिफिकेशन: एक अलग, "ब्लाइंड" रोबोट (जो तस्वीर नहीं देख सकता, केवल टेक्स्ट देख सकता है) उस रेसिपी का पालन करता है। वह चरणों को चलाता है। यदि रेसिपी कहती है "लाल कारों को गिनें" और वह कारों को गिनता है और 3 प्राप्त करता है, लेकिन उत्तर कुंजी 4 कहती है, तो सिस्टम जान जाता है कि उत्तर गलत है और उसे हटा देता है। यह सुनिश्चित करता है कि उत्तर गणितीय और तार्किक रूप से सही हों, न कि केवल भाग्यशाली अनुमान।

4. परिणाम: एक तेज़, सस्ता और निष्पक्ष टेस्ट

पेपर का दावा है कि यह सिस्टम तीन कारणों से गेम-चेंजर है:

  • यह ताज़ा है: यह वास्तविक दुनिया के डेटा का उपयोग करके 5,900 नए टेस्ट प्रश्न बनाता है।
  • यह सस्ता और तेज़ है: इसे मैन्युअल रूप से करने में हजारों डॉलर खर्च होंगे और महीनों लग जाएंगे। यह रोबोट फैक्ट्री इसे 1-2 घंटे में लगभग $30 में कर देती है।
  • यह निष्पक्ष है: क्योंकि प्रश्न नए हैं और ऑन-द-फ्लाई जेनरेट किए गए हैं, छात्र (AI मॉडल) उत्तरों को केवल याद नहीं कर सकते। पेपर ने पाया कि पुराने टेस्ट की तुलना में यहाँ "मेमोराइजेशन सिग्नल्स" (याददाश्त के माध्यम से धोखाधड़ी) बहुत कमजोर थे।

निचोड़

MMBench-Live को एक लाइव कुकिंग कॉम्पिटिशन के रूप में समझें जहाँ सामग्रियां हर घंटे ताज़ा डिलीवर की जाती हैं, और जज यह सुनिश्चित करने के लिए एक सख्त चेकलिस्ट रखते हैं कि डिश मूल रेसिपी से मेल खाती हो। यह साबित करता है कि हम AI मॉडल्स को निष्पक्ष और सटीक रूप से टेस्ट करना जारी रख सकते हैं, बिना पुराने या याद किए गए टेस्टों में फंसे। यह देखने का एक टिकाऊ तरीका है कि क्या AI वास्तव में स्मार्ट हो रहा है या केवल अतीत को याद रखने में बेहतर हो रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →