← नवीनतम पेपर
💬 NLP

Multimodal Evaluation of Russian-language Architectures

यह शोध पत्र MERA Multi को प्रस्तुत करता है, जो रूसी-भाषा के आर्किटेक्चर के लिए पहला ओपन मल्टीमॉडल मूल्यांकन ढांचा है, जिसमें मॉडल क्षमताओं का आकलन करने और विविध भाषाओं के लिए एक प्रतिलिपि योग्य कार्यप्रणाली स्थापित करने हेतु टेक्स्ट, इमेज, ऑडियो और वीडियो मोडैलिटीज में 18 सांस्कृतिक रूप से विशिष्ट कार्य शामिल हैं।

मूल लेखक: Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan
प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, नए रोबोटों का एक समूह है जो चित्र देख सकते हैं, ध्वनियाँ सुन सकते हैं, वीडियो देख सकते हैं और टेक्स्ट पढ़ सकते हैं—और ये सब एक साथ कर सकते हैं। इन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) कहा जाता है। ये हर दिन बेहतर हो रहे हैं, लेकिन अब तक, हमारे पास उन्हें टेस्ट करने का केवल एक ही तरीका था जब वे अंग्रेजी बोल रहे हों।

यदि आप यह परीक्षण करना चाहते थे कि एक रोबोट रूसी संस्कृति, लोककथाओं या विशिष्ट रूसी चुटकुलों को कितनी अच्छी तरह समझता है, तो आपके पास इसे मापने के लिए कोई पैमाना नहीं था। मौजूदा परीक्षण ऐसे थे जैसे सहारा रेगिस्तान के लिए कैलिब्रेट किए गए थर्मामीटर का उपयोग करके रूसी सर्दियों को मापने की कोशिश करना।

यह पेपर MERA Multi पेश करता है, जो एक बिल्कुल नया, खुला "एग्जाम" है जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये AI रोबोट रूसी भाषा और संस्कृति को सभी इंद्रियों (टेक्स्ट, इमेज, ऑडियो और वीडियो) के माध्यम से कितनी अच्छी तरह समझते हैं।

यहाँ उन्होंने क्या किया है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

1. समस्या: "अंग्रेजी-मात्र" अंधा बिंदु (The "English-Only" Blind Spot)

वर्तमान AI जगत को एक विशाल पुस्तकालय के रूप में सोचें। अधिकांश पुस्तकें (बेंचमार्क/परीक्षण) अंग्रेजी में लिखी गई हैं। यदि आप जानना चाहते हैं कि क्या एक छात्र रूसी पढ़ सकता है, तो आप उसे केवल एक अंग्रेजी पुस्तक देकर यह नहीं कह सकते, "इसे पढ़ो।" आपको एक ऐसा परीक्षण चाहिए जो रूसी में लिखा गया हो और जो रूसी संदर्भ को समझता हो।

  • अंतराल (The Gap): पिछले रूसी परीक्षण केवल टेक्स्ट देखते थे। उन्होंने यह नहीं जांचा कि क्या AI एक रूसी मूवी क्लिप, एक रूसी गाना या एक रूसी सड़क के दृश्य की तस्वीर को समझ सकता है।
  • समाधान: लेखकों ने MERA Multi बनाया, जो AI के लिए पहला "रूसी भाषा का ड्राइविंग लाइसेंस टेस्ट" है जो चारों इंद्रियों की जांच करता है।

2. परीक्षा: 18 अलग-अलग कार्य

केवल एक बड़े परीक्षण के बजाय, उन्होंने 18 अलग-अलग मिनी-परीक्षाएं बनाईं। एक जिम की कल्पना करें जिसमें 18 अलग-अलग स्टेशन हैं:

  • "कान" वाले स्टेशन (ऑडियो): क्या AI एक रूसी लोक गीत और एक पॉप गीत के बीच अंतर कर सकता है? क्या वह "हीटर चालू करें" जैसे बोले गए आदेश को समझ सकता है?
  • "आंख" वाले स्टेशन (इमेज): क्या AI रूसी गणित की समस्या की तस्वीर देखकर उसे हल कर सकता है? क्या वह एक रूसी रेस्टोरेंट के मेनू को फोटो से पढ़ सकता है? क्या वह पहचान सकता है कि कोई तस्वीर "अजीब" है (जैसे कार चलाता हुआ पेंगुइन)?
  • "वीडियो" वाले स्टेशन: क्या AI एक रूसी कुकिंग शो की छोटी क्लिप देखकर चरणों को क्रमवार समझा सकता है?
  • "दिमाग" वाले स्टेशन (रीजनिंग): क्या AI किसी तस्वीर को देखकर उसके पीछे की कहानी समझ सकता है, न कि केवल वस्तुओं को? (उदाहरण के लिए, दृश्य संकेतों के आधार पर, "यह व्यक्ति दुखी क्यों है?")।

3. "सांस्कृतिक अनुवादक" (The "Cultural Translator")

लेखकों ने केवल अंग्रेजी परीक्षणों का रूसी में अनुवाद नहीं किया। ऐसा करना अमेरिकी बेसबॉल के बारे में चुटकुले का रूसी में अनुवाद करने जैसा होगा; यह एक रूसी वक्ता के लिए समझ में नहीं आएगा।

  • कस्टम निर्मित: उन्होंने इन परीक्षणों को रूसी सांस्कृतिक संदर्भों (जैसे सोवियत फिल्में, रूसी लोककथाएं और स्थानीय इतिहास) का उपयोग करके शून्य से बनाया।
  • "ट्यूरिंग टेस्ट" का ट्विस्ट: कुछ कार्य यह देखने के लिए डिज़ाइन किए गए हैं कि क्या AI रूसी में स्वाभाविक, मानव जैसी बातचीत कर सकता है, जिसमें व्यंग्य, मुहावरे और सांस्कृतिक बारीकियों को समझना शामिल है, ठीक वैसे ही जैसे एक वास्तविक व्यक्ति करता है।

4. ग्रेडिंग सिस्टम: "स्मार्ट टीचर"

आप उस AI को कैसे ग्रेड करेंगे जो एक लंबा, अस्पष्ट उत्तर देता है?

  • मानव आधार रेखा (The Human Baseline): सबसे पहले, वास्तविक मनुष्यों ने एक "गोल्ड स्टैंडर्ड" स्कोर सेट करने के लिए परीक्षा दी।
  • "जज" AI: चूंकि मनुष्य तुरंत हजारों AI उत्तरों को ग्रेड नहीं कर सकते, इसलिए लेखकों ने एक विशेष "जज AI" को प्रशिक्षित किया। इस जज को एक सख्त लेकिन निष्पक्ष शिक्षक के रूप में सोचें। यह केवल सही शब्द को नहीं देखता; यह जाँचता है कि क्या अर्थ सही है।
  • दो स्कोर: वे AI को दो स्कोर देते हैं:
    1. सटीक मिलान (Exact Match): क्या इसने बिल्कुल सही शब्द कहा?
    2. सिमेंटिक स्कोर (Semantic Score): क्या इसने विचार को सही पकड़ा, भले ही शब्द थोड़े अलग हों?

5. परीक्षण को निष्पक्ष रखना (चीटिंग रोकना)

AI परीक्षण में एक बड़ी समस्या "डेटा लीकेज" है। यह एक छात्र द्वारा परीक्षा के प्रश्नों को रटने जैसा है क्योंकि परीक्षा के प्रश्न पहले से ही छात्र को सिखाने के लिए उपयोग किए गए थे।

  • वॉटरमार्क्स: लेखकों ने अपने टेस्ट डेटा पर अदृश्य "वॉटरमार्क" रखे (जैसे पेंटिंग में एक छिपा हुआ हस्ताक्षर) ताकि यह ट्रैक किया जा सके कि क्या किसी AI मॉडल ने प्रशिक्षण के दौरान गुप्त रूप से टेस्ट डेटा से सीखा है।
  • लीकेज डिटेक्शन: उन्होंने एक "झूठ पकड़ने वाला" (lie detector) टूल बनाया जो यह बता सकता है कि क्या किसी मॉडल ने पहले टेस्ट के प्रश्न देखे हैं। यदि कोई मॉडल नकल करने की कोशिश करता है, तो सिस्टम उसे पकड़ सकता है।

6. परिणाम: कौन पास हुआ?

उन्होंने 50 से अधिक अलग-अलग AI मॉडल्स (फ्री/ओपन-सोर्स और पेड/क्लोज्ड-सोर्स दोनों) का परीक्षण किया।

  • विजेता: शीर्ष प्रदर्शन करने वाले "ओमनी-मॉडल्स" (वे मॉडल जो सब कुछ करने की कोशिश करते हैं) थे, जो Qwen परिवार से संबंधित थे। वे समग्र रूप से उच्चतम स्कोर प्राप्त करते हैं क्योंकि वे सभी अलग-अलग स्टेशनों पर अच्छे थे, न कि केवल एक पर।
  • विशेषज्ञ (The Specialists): कुछ मॉडल केवल एक चीज़ में माहिर थे (जैसे केवल ऑडियो समझना) लेकिन अन्य चीजों में विफल रहे।
  • वास्तविकता की जांच: सर्वश्रेष्ठ मॉडल भी अभी भी जटिल रूसी सांस्कृतिक बारीकियों और कठिन तर्क कार्यों के साथ संघर्ष करते हैं। मनुष्यों के प्रदर्शन और AI के प्रदर्शन के बीच अभी भी एक बड़ा अंतर है।

सारांश

MERA Multi रूसी बोलने वाले AI के लिए एक व्यापक, सांस्कृतिक रूप से जागरूक "रिपोर्ट कार्ड" है। यह साबित करता है कि एक भाषा को वास्तव में समझने के लिए, एक AI को केवल शब्दकोश की परिभाषाओं को ही नहीं, बल्कि संस्कृति, इतिहास और संदर्भ को भी समझना आवश्यक है। यह शोधकर्ताओं के लिए एक निष्पक्ष, पारदर्शी तरीका प्रदान करता है जिससे वे देख सकें कि कौन से AI मॉडल वास्तव में स्मार्ट हैं और कौन से केवल अनुमान लगा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →