← नवीनतम पेपर
💬 NLP

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

यह शोध पत्र EduArt को प्रस्तुत करता है, जो कई भाषाओं और प्रारूपों में 871 मानव-लिखित प्रश्नों से बना एक मनोवैज्ञानिक रूप से सुदृढ़, शैक्षिक-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स बहुविकल्पीय कला इतिहास पहचान में उत्कृष्ट हैं, वहीं उनका प्रदर्शन मुक्त-अंत वाले (open-ended) और त्रुटि-पहचान वाले कार्यों पर नाटकीय रूप से गिर जाता है, जो पहचान और कला-ऐतिहासिक ज्ञान को विश्वसनीय रूप से तैनात करने की क्षमता के बीच एक महत्वपूर्ण अंतर को उजागर करता है।

मूल लेखक: Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि कला इतिहास (art history) में नए छात्रों का समूह कितना बुद्धिमान है। लंबे समय से, मानक परीक्षण एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) रहा है। आप उन्हें एक पेंटिंग की तस्वीर दिखाते हैं और पूछते हैं, "इसे किसने चित्रित किया?" जिसमें चार विकल्प होते हैं: A, B, C, या D।

यह तरीका एक शेफ के खाना पकाने के कौशल को केवल एक बर्गर की तस्वीर की ओर इशारा करके यह पूछने जैसा है कि, "हाँ, यह एक बर्गर है।" यह बहुत आसान है। सबसे स्मार्ट AI मॉडल ("छात्र") अब इन बहुविकल्पीय प्रश्नों पर लगभग 100% अंक प्राप्त कर रहे हैं। वे जरूरी नहीं कि कला को समझ रहे हों; वे बस एक सूची से सही अक्षर का अनुमान लगाने में बहुत अच्छे हो गए हैं।

नया परीक्षण: EduArt
लेखकों ने एक नया, कठिन परीक्षा बनाया जिसे EduArt कहा जाता है। केवल बहुविकल्पीय होने के बजाय, उन्होंने इतालवी हाई स्कूल की पाठ्यपुस्तकों और अमेरिकी कॉलेज प्रवेश परीक्षाओं के वास्तविक प्रश्नों का उपयोग किया। उन्होंने ये प्रश्न कंप्यूटर से नहीं बनाए; वास्तविक मानव शिक्षकों ने इन्हें लिखा था।

EduArt को AI के लिए एक "बहु-कौशल बाधा दौड़" (multi-skill obstacle course) के रूप में समझें। केवल एक अक्षर चुनने के बजाय, AI को यह करना होगा:

  • रिक्त स्थान भरें: "कलाकार ने [______] तकनीक का उपयोग किया।"
  • गलती पकड़ें: "इस पेंटिंग के बारे में इस वाक्य में गलत शब्द खोजें।"
  • ड्रैग एंड ड्रॉप (Drag and drop): "सही शब्द को सही जगह पर रखें।"
  • अपने काम की व्याख्या करें: "आपने वह उत्तर क्यों चुना?"

उन्होंने क्या पाया
शोधकर्ताओं ने 12 अलग-अलग AI मॉडल (जैसे विभिन्न कंपनियों के दिमाग) का इस नई बाधा दौड़ पर परीक्षण किया। यहाँ क्या हुआ, सरल रूपकों का उपयोग करते हुए:

  1. "पहचान" का जाल (The "Recognition" Trap): जब AI को केवल एक सूची से उत्तर चुनने के लिए कहा गया (बहुविकल्पीय), तो शीर्ष मॉडलों ने 94% से अधिक स्कोर किया। वे कला इतिहास के जीनियस लग रहे थे। लेकिन जब परीक्षण बदल गया और उनसे उत्तर लिखने या गलती ढूंढने के लिए कहा गया, तो उनके स्कोर गिर गए। एक मॉडल जो उत्तर चुनने में 94% अच्छा था, त्रुटियां खोजने के लिए पूछे जाने पर 6% पर गिर गया।

    • रूपक: यह उस छात्र की तरह है जो एक ट्रिविया गेम शो में तेजी से बटन दबाकर सही उत्तर दे सकता है, लेकिन उसी विषय पर निबंध लिखने के लिए पूछे जाने पर पूरी तरह विफल हो जाता है। वे उत्तर को पहचानना जानते हैं, लेकिन वे ज्ञान का उपयोग करना नहीं जानते।
  2. "चित्र" का विरोधाभास (The "Picture" Paradox): आप सोच सकते हैं कि AI को पेंटिंग दिखाने से यह आसान हो जाएगा। आश्चर्यजनक रूप से, चित्र शामिल होने पर AI वास्तव में बदतर प्रदर्शन करता था।

    • रूपक: यह एक छात्र को मानचित्र और दिशा-सूचक यंत्र (compass) देने जैसा है, लेकिन वे मानचित्र को देखने में इतने विचलित हो जाते हैं कि वे चलना ही भूल जाते हैं। AI वास्तव में "देखने" के बजाय अपनी टेक्स्ट मेमोरी पर अधिक निर्भर लगता था। जब चित्र मौजूद था, तो वह भ्रमित हो गया; जब केवल टेक्स्ट था, तो उसने बेहतर प्रदर्शन किया।
  3. "स्वयं को समझाएं" प्रभाव (The "Explain Yourself" Effect): शोधकर्ताओं ने AI को अपने उत्तर का एक संक्षिप्त कारण लिखने के लिए कहा।

    • रूपक: कल्पना कीजिए कि एक छात्र जो आमतौर पर परीक्षण पर सही उत्तर का अनुमान लगाता है। जब शिक्षक कहता है, "ठीक है, अब मुझे बताओ कि तुमने वह उत्तर क्यों चुना," तो कुछ छात्र जम जाते हैं और गलत उत्तर देते हैं। अन्य अधिक आत्मविश्वासी हो जाते हैं और सही उत्तर देते हैं।
    • परिणाम: यह पूरी तरह से इस बात पर निर्भर करता था कि AI किस "परिवार" से आता है। कुछ AI परिवार (जैसे Claude) वास्तव में बेहतर होते हैं जब उन्हें खुद को समझाने के लिए कहा जाता है। अन्य (जैसे Google का Gemini और OpenAI का GPT) और भी खराब हो जाते हैं। ऐसा लगता है कि उन्हें ज़ोर से सोचने के लिए मजबूर करना कभी-कभी उन्हें उलझा देता है।

मुख्य निष्कर्ष
पेपर का मुख्य बिंदु यह है कि उत्तर जानना और उत्तर का उपयोग कर पाना दो अलग-अलग कौशल हैं।

यदि आप केवल बहुविकल्पीय प्रश्नों के साथ AI का परीक्षण करते हैं, तो आप एक भ्रामक रूप से उच्च स्कोर प्राप्त कर रहे हैं। यह एक कार के प्रदर्शन का मूल्यांकन केवल इस आधार पर करने जैसा है कि वह कितनी अच्छी तरह सीधी रेखा में पार्क कर सकती है, यह नजरअंदाज करते हुए कि क्या वह पहाड़ पर चढ़ सकती है या मोड़ ले सकती है।

कला इतिहास विशेषज्ञों के लिए जो पेंटिंग्स का विश्लेषण करने या विवरण लिखने के लिए AI का उपयोग करना चाहते हैं, यह पेपर चेतावनी देता है: "बहुविकल्पीय स्कोर पर भरोसा न करें।" भले ही एक AI किसी पेंटिंग का सही नाम चुन सकता है, इसका मतलब यह नहीं है कि वह उसके बारे में एक सही पैराग्राफ लिख सकता है या किसी नकली चीज़ को पहचान सकता है। यह जानने के लिए कि एक AI वास्तव में क्या कर सकता है, आपको उसका परीक्षण उन अव्यवस्थित, खुले कार्यों के साथ करना होगा जिनका सामना वास्तविक विद्वान करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →