← नवीनतम पेपर
💬 NLP

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

यह शोध पत्र BLUEX v2 प्रस्तुत करता है, जो ब्राजील की प्रमुख विश्वविद्यालय प्रवेश परीक्षाओं (2022-2025) से 395 मुक्त-अंत वाले प्रश्नों वाला एक नया बेंचमार्क है, जो पुर्तगाली विमर्श कार्यों पर 21 अत्याधुनिक LLMs का मूल्यांकन करता है, जो महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और गणितीय तर्क एवं छवि समझ में चुनौतियों को उजागर करता है।

मूल लेखक: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने रोबोटों के एक समूह की बुद्धिमत्ता का परीक्षण करने के लिए उन्हें सरल बहुविकल्पीय प्रश्न पूछे हैं, जैसे कि "आकाश का रंग क्या है? A) नीला, B) लाल।" वे सही अक्षर चुनने में बहुत अच्छा प्रदर्शन कर रहे थे। लेकिन इस शोध पत्र के पीछे के शोधकर्ताओं ने, BLUEX v2, महसूस किया कि एक अक्षर चुनना आसान है। बुद्धिमत्ता का असली परीक्षण एक पूरा निबंध लिखना, यह समझाना कि आकाश नीला क्यों है, और इसे सिद्ध करने के लिए एक आरेख (डायग्राम) बनाना है।

यह पेपर AI मॉडल्स के लिए एक नया, बहुत कठिन "फाइनल एग्जाम" पेश करता है, जिसे विशेष रूप से पुर्तगाली (Portuguese) भाषा में बोलने और लिखने की उनकी क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है।

यहाँ उनके काम का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "बहुविकल्पीय" का जाल

पहले, शोधकर्ता AI का परीक्षण ब्राजील की विश्वविद्यालय प्रवेश परीक्षाओं पर करते थे, लेकिन केवल पहले दौर (first round) पर। पहले दौर को एक ट्रिविया गेम की तरह समझें जहाँ आप बस सही उत्तर पर गोला लगाते हैं। AI के लिए अनुमान लगाना या पैटर्न पहचानना आसान है।

इन परीक्षाओं का दूसरा दौर (जिस पर BLUEX v2 ध्यान केंद्रित करता है) एक थीसिस डिफेंस (thesis defense) की तरह है। छात्रों को लंबे, विस्तृत उत्तर लिखने होते हैं, जटिल गणितीय समस्याओं को चरण-दर-चरण हल करना होता है, और मानचित्रों या ग्राफों की व्याख्या करनी होती है। पुराने परीक्षण यह मापने में सक्षम नहीं थे कि क्या एक AI वास्तव में एक इंसान की तरह सोच और लिख सकता है; वे केवल यह मापते थे कि क्या वह सही उत्तर को पहचान सकता है।

2. समाधान: AI के लिए एक नया "फाइनल एग्जाम"

टीम ने BLUEX v2 बनाया, जो 2022 और 2025 के बीच ब्राजील के शीर्ष विश्वविद्यालयों (UNICAMP और USP) के 395 वास्तविक प्रश्नों का एक विशाल डेटासेट है।

  • प्रश्न: ये केवल टेक्स्ट नहीं हैं। लगभग 56% में चित्र, चार्ट या मानचित्र शामिल हैं जिन्हें सही उत्तर देने के लिए आपको समझना अनिवार्य है।
  • फॉर्मेट: AI को मुक्त रूप (free-form) में उत्तर लिखना होता है, न कि A, B, C, या D चुनना।
  • विषय: यह इतिहास और समाजशास्त्र से लेकर भौतिकी और गणित तक 9 अलग-अलग विषयों को कवर करता है।

3. उन्होंने रोबोटों को कैसे ग्रेड किया: "AI शिक्षक"

हजारों परीक्षणों के लिए मानव द्वारा 5-पृष्ठों के निबंध को जल्दी से ग्रेड करना कठिन है। इसलिए, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जहाँ एक AI एक शिक्षक के रूप में कार्य करता है

  • रूब्रिक (Rubric): सबसे पहले, शोधकर्ताओं ने एक AI का उपयोग "आधिकारिक सही उत्तर" को पढ़ने और उसे एक चेकलिस्ट (रूब्रिक) में तोड़ने के लिए किया। उदाहरण के लिए, यदि उत्तर में "ATP" और "मांसपेशियों के संकुचन" (muscle contraction) का उल्लेख होना चाहिए, तो चेकलिस्ट में ये दो आइटम होंगे।
  • जज (Judge): एक अन्य AI ("जज") छात्र रोबोट के उत्तर को पढ़ता है और सूची के आइटमों को चेक करता है। क्या इसने ATP का उल्लेख किया? हाँ। क्या इसने मांसपेशियों के संकुचन का उल्लेख किया? नहीं।
  • स्कोर: रोबोट को 0 से 10 के बीच स्कोर मिलता है, जो इस आधार पर है कि उसने कितने चेकलिस्ट आइटम पूरे किए।
  • प्रमाण: यह सुनिश्चित करने के लिए कि "AI शिक्षक" अपनी ओर से कुछ गलत (hallucinating) न बोल रहा हो, उन्होंने इसकी ग्रेडिंग की तुलना वास्तविक मानव शिक्षकों से की। AI 89.5% बार मनुष्यों के साथ सहमत था। यह एक बहुत ही उच्च स्कोर है, जो साबित करता है कि स्वचालित ग्रेडिंग विश्वसनीय है।

4. परिणाम: कौन पास हुआ और कौन फेल?

उन्होंने 21 अलग-अलग AI मॉडल्स (रोबोटों) का इस परीक्षा पर परीक्षण किया।

  • फैलाव (Spread): स्कोर 4.18 के निचले स्तर से लेकर 9.10 के उच्च स्तर तक रहे। यह दर्शाता है कि यह परीक्षण एक स्मार्ट रोबोट और एक कम बुद्धिमान रोबोट के बीच अंतर करने में सक्षम है।
  • विजेता: शीर्ष प्रदर्शन करने वाले मॉडल विशाल, महंगे मॉडल जैसे Gemini 3.1 Pro और GPT-5 थे।
  • हारने वाले: छोटे, ओपन-सोर्स मॉडल संघर्ष करते दिखे, जिनका सबसे कम स्कोर लगभग 4.18 था।
  • ब्राजीलियाई सितारे: दिलचस्प बात यह है कि ब्राजील द्वारा बनाए गए मॉडल (Sabiá-4) ने बहुत अच्छा प्रदर्शन किया, जो वैश्विक दिग्गजों के लगभग बराबर था, जिससे पता चलता है कि स्थानीय प्रशिक्षण मदद करता है।

5. "कठिन हिस्से": जहाँ रोबोट लड़खड़ाते हैं

सबसे अच्छे रोबोटों को भी दो विशिष्ट चीजों में कठिनाई हुई:

  1. गणितीय तर्क (Math Reasoning): यह सबसे कठिन विषय था। ठीक वैसे ही जैसे एक इंसान जो एक बेहतरीन कहानी लिख सकता है लेकिन लंबी भाग (long division) नहीं कर सकता, AI सुंदर पुर्तगाली निबंध तो लिख सकते थे लेकिन अक्सर गणित के चरणों में गलती कर देते थे।
  2. छवि समझ (Image Understanding): जब किसी प्रश्न में ग्राफ या मानचित्र शामिल था, तो रोबोट के स्कोर में औसतन लगभग 0.5 अंक की गिरावट आई। यह एक छात्र को गणित की समस्या देने जैसा है लेकिन नंबरों को एक मुड़े हुए कागज पर बनाना; AI समस्या को हल करने के लिए विवरणों को स्पष्ट रूप से "देखने" में संघर्ष करता है।

6. परीक्षण की लागत

शोधकर्ता लागत के बारे में पारदर्शी थे। इस पूरे प्रयोग को चलाने में—प्रश्न पूछने, छवियों के विवरण उत्पन्न करने और उत्तरों को ग्रेड करने में—लगभग $127 खर्च हुए। यह इस आकार के अध्ययन के लिए आश्चर्यजनक रूप से सस्ता है, जो दिखाता है कि हम लाखों खर्च किए बिना भी AI का कड़ाई से परीक्षण कर सकते हैं।

मुख्य निष्कर्ष

BLUEX v2 पुर्तगाली में AI के परीक्षण के लिए एक नया, कठिन मानक है। यह साधारण ट्रिविया से आगे बढ़कर AI को लिखने, तर्क करने और चित्रों को देखने के लिए मजबूर करता है। परिणाम बताते हैं कि हालांकि AI पुर्तगाली में लिखने और बहस करने में बहुत अच्छा हो रहा है, लेकिन यह अभी भी जटिल गणित और दृश्य डेटा (visual data) की व्याख्या करने में संघर्ष करता है। यह बेंचमार्क शोधकर्ताओं को एक स्पष्ट मानचित्र देता है कि उन्हें अपने अगले सुधारों पर कहाँ ध्यान केंद्रित करना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →