← नवीनतम पेपर
💬 NLP

SemBench: A Universal Semantic Framework for LLM Evaluation

यह शोध पत्र SemBench प्रस्तुत करता है, जो एक स्केलेबल और भाषा-स्वतंत्र ढांचा है जो विभिन्न भाषाओं में बड़े भाषा मॉडलों की सिमेंटिक समझ (semantic understanding) का कुशलतापूर्वक मूल्यांकन करने के लिए शब्दकोश की परिभाषाओं और वाक्य एनकोडर्स का उपयोग करके स्वचालित रूप से सिंथेटिक बेंचमार्क उत्पन्न करता है।

मूल लेखक: Mikel Zubillaga, Naiara Perez, Oscar Sainz, German Rigau

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mikel Zubillaga, Naiara Perez, Oscar Sainz, German Rigau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट है जो कविताएँ लिख सकता है, कोड लिख सकता है और इंसान की तरह बातें कर सकता है। आप यह जानना चाहते हैं: क्या यह रोबोट वास्तव में समझता है कि वह क्या कह रहा है, या वह केवल उन पैटर्न्स के आधार पर अनुमान लगा रहा है जो उसने अपने ट्रेनिंग डेटा में देखे थे?

यह वह समस्या है जिसे "SemBench" नामक पेपर हल करने की कोशिश करता है।

पुराना तरीका: "मानव शिक्षक" परीक्षण

पारंपरिक रूप से, यह परीक्षण करने के लिए कि क्या कोई रोबोट शब्दों को समझता है, शोधकर्ता WiC (Word-in-Context) नामक एक विधि का उपयोग करते हैं।

इसे एक शिक्षक द्वारा छात्र को क्विज़ देने की तरह समझें:
शिक्षक दो वाक्य लिखता है:

  1. "मैं नाचने के लिए एक पार्टी (party) में गया।"
  2. "वह पार्टी (party) चुनाव हार गई।"

छात्र (AI) को उत्तर देना होता है: "क्या इन दोनों 'पार्टी' का अर्थ एक ही है?" (उत्तर 'नहीं' है; एक उत्सव है, दूसरा एक राजनीतिक समूह)।

समस्या: ऐसे क्विज़ बनाना कठिन काम है।

  • यह महंगा है: हजारों अनूठे वाक्य लिखने के लिए मानव विशेषज्ञों की आवश्यकता होती है।
  • यह धीमा है: किसी नई भाषा के लिए क्विज़ बनाने में बहुत समय लगता है।
  • यह सीमित है: यदि आप किसी दुर्लभ भाषा (जैसे बास्क) का परीक्षण करना चाहते हैं, तो आपके पास पर्याप्त मानव-लिखित क्विज़ नहीं हो सकते।

नया तरीका: SemBench (द डिक्शनरी डिटेक्टिव)

इस पेपर के लेखक, मिकेल और उनकी टीम ने SemBench का आविष्कार किया। इंसानों से क्विज़ लिखने के बजाय, उन्होंने एक मशीन बनाई जो केवल एक डिक्शनरी (शब्दकोश) और एक सेंटेंस एनकोडर (एक टूल जो यह मापता है कि दो वाक्य कितने समान हैं) का उपयोग करके अपने स्वयं के क्विज़ बनाती है

SemBench कैसे काम करता है, यहाँ एक रचनात्मक उपमा दी गई है:

उपमा: "आकार बदलने वाला अनुवादक" (The Shape-Shifting Translator)

कल्पना कीजिए कि आपके पास एक जादुई डिक्शनरी है। आप एक शब्द चुनते हैं, मान लीजिए "Bank"

  1. अर्थ चुनें: डिक्शनरी कहती है कि "Bank" के दो अर्थ हैं: (A) पैसे रखने की जगह, और (B) नदी का किनारा।
  2. AI का काम: AI से एक अनुवादक की तरह कार्य करने को कहा जाता है।
    • चरण 1: AI "River Bank" (नदी का किनारा) की परिभाषा देखता है और उसका उपयोग करके एक वाक्य बनाना होता है। (जैसे, "हम कीचड़ भरे किनारे पर बैठे थे।")
    • चरण 2: AI फिर उस नए वाक्य को लेता है और उसके लिए एक परिभाषा लिखनी होती है।
  3. परीक्षण: AI द्वारा लिखी गई नई परिभाषा की तुलना मूल डिक्शनरी परिभाषा से की जाती है।
    • यदि AI ने ऐसी परिभाषा लिखी जो "River Bank" जैसी लगती है, तो वह पास हो गया।
    • यदि उसने ऐसी परिभाषा लिखी जो "Money Bank" जैसी लगती है, तो वह फेल हो गया।

यदि AI बिना भ्रमित हुए परिभाषाओं (Definitions) और उदाहरणों (Examples) के बीच सहजता से स्विच कर सकता है, तो यह साबित करता है कि वह शब्द के अर्थ को वास्तव में समझता है।

यह एक बड़ी बात क्यों है?

1. यह "भाषा-निरपेक्ष" है (Universal)
आपको हर देश में भाषाविदों की एक टीम की आवश्यकता नहीं है। जब तक आपके पास किसी भी भाषा के लिए एक डिक्शनरी (भले ही वह साधारण हो) है, आप यह परीक्षण चला सकते हैं। लेखकों ने इसका परीक्षण अंग्रेजी (समृद्ध संसाधन), स्पेनिश (मध्यम संसाधन), और बास्क (बहुत कम संसाधन) पर किया। यह सभी के लिए काम आया।

2. यह एक "लाइटवेट" परीक्षण है
आपको एक विशाल डेटासेट की आवश्यकता नहीं है। पेपर दिखाता है कि आपको यह जानने के लिए कि कौन सा AI अधिक स्मार्ट है, केवल लगभग 250 से 500 उदाहरणों की आवश्यकता है। यह एक धावक का परीक्षण करने जैसा है जिसमें फुल मैराथन के बजाय एक छोटी स्प्रिंट कराई जाती है।

3. इसमें धोखाधड़ी करना कठिन है
मानक परीक्षणों में अक्सर ऐसे पैटर्न होते हैं जिन्हें AI याद कर सकता है। SemBench गतिशील है। क्योंकि AI को वाक्य बनाना होता है और फिर परिभाषा को "रिवर्स-इंजीनियर" करना होता है, इसलिए AI के लिए केवल सही उत्तर का "अनुमान" लगाना बहुत कठिन हो जाता है। उसे वास्तव में तर्क को समझना होगा।

परिणाम: क्या यह काम आया?

टीम ने अपने नए "डिक्शनरी डिटेक्टिव" टेस्ट की तुलना पुराने "मानव शिक्षक" टेस्ट (WiC) से की।

  • फैसला: परिणाम लगभग पूरी तरह से मेल खाते हैं! यदि किसी AI ने पुराने टेस्ट में अच्छा प्रदर्शन किया, तो उसने नए टेस्ट में भी अच्छा प्रदर्शन किया।
  • बोनस: SemBench वास्तव में एक "अच्छे" AI और एक "महान" AI के बीच अंतर बताने में बेहतर था। यह बुद्धिमत्ता के उन सूक्ष्म अंतरों को पकड़ सका जिन्हें पुराने टेस्ट मिस कर देते थे।
  • लो-रिसोर्स जीत: बास्क (एक ऐसी भाषा जिसके डिजिटल संसाधन बहुत कम हैं) में, नया टेस्ट अभी भी यह बता सका कि कौन सा AI उस भाषा के लिए विशेष रूप से बनाया गया है और कौन सा केवल अनुमान लगा रहा है। पुराना टेस्ट यहाँ संघर्ष कर रहा था।

निष्कर्ष (The Takeaway)

SemBench एक यूनिवर्सल ट्रांसलेटर के टूलकिट की तरह है। दुनिया की हर भाषा के लिए हजारों कठिन क्विज़ लिखने के लिए इंसानों का इंतज़ार करने के बजाय, अब हम एक डिक्शनरी और एक कंप्यूटर का उपयोग करके स्वचालित रूप से एक ऐसा टेस्ट बना सकते हैं जो यह जाँचता है कि क्या AI वास्तव में शब्दों के अर्थ को समझता है।

यह सस्ता है, तेज़ है, लगभग किसी भी भाषा के लिए काम करता है, और हमें इस बात की स्पष्ट तस्वीर देता है कि हमारे AI असिस्टेंट वास्तव में कितने "स्मार्ट" हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →