← नवीनतम पेपर
🤖 AI

Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference

टोकनएरिना (TokenArena) एक निरंतर बेंचमार्क पेश करता है जो पांच मुख्य अक्षों के माध्यम से ग्रैनुलर एंडपॉइंट स्तर पर एआई इन्फरेंस का मूल्यांकन करता है, जो प्रदर्शन, लागत और ऊर्जा मेट्रिक्स को संश्लेषित कर सटीकता, विलंबता और दक्षता में महत्वपूर्ण परिवर्तनशीलता को प्रकट करता है जिसे पारंपरिक मॉडल-स्तरीय बेंचमार्क अनदेखा कर देते हैं।

मूल लेखक: Yuxuan Gao, Megan Wang, Yi Ling Yu

प्रकाशित 2026-05-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Gao, Megan Wang, Yi Ling Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कार खरीद रहे हैं। वर्तमान में, आपके द्वारा पढ़ी जाने वाली कार समीक्षाएं आपको केवल मॉडल का नाम (जैसे, "द 2026 सुपर सेडान") और ब्रांड (जैसे, "फोर्ड") के बारे में बताती हैं। वे आपको बताती हैं कि इंजन शक्तिशाली है और कीमत वेबसाइट पर दी गई है।

लेकिन वास्तविक दुनिया में, कार खरीदना केवल मॉडल के नाम के बारे में नहीं है। यह विशिष्ट डीलरशिप, विशिष्ट ट्रिम स्तर, स्थानीय मौसम और आपके द्वारा उपयोग किए जा रहे सटीक ईंधन मिश्रण के बारे में है। एक "सुपर सेडान" जिसे किसी संदिग्ध गली-मोहल्ले के डीलर से खरीदा गया है, उसका इंजन जंग लगा हुआ, माइलेज खराब और जीपीएस टूटा हुआ हो सकता है, जबकि प्रमाणित डीलर से खरीदी गई ठीक वही मॉडल एकदम सही चलती है।

टोकन एरिना (Token Arena) AI के लिए एक नया "कंज्यूमर रिपोर्ट्स" है, लेकिन कारों के बजाय, यह AI एंडपॉइंट्स (endpoints) का परीक्षण करता है।

यहाँ इस शोध पत्र (paper) को सरल शब्दों में समझाया गया है, जो स्पष्ट करने के लिए उपमाओं (analogies) का उपयोग करता है।

1. समस्या: "मॉडल नाम" का झूठ

अभी, यदि आप पूछते हैं "Llama 3.3 कितना अच्छा है?" या "GPT-4 कितना तेज़ है?", तो आपको एक ही उत्तर मिलता है। यह शोध पत्र तर्क देता है कि यह यह कहने जैसा है कि "सभी 2026 सुपर सेडान 30 माइल प्रति गैलन का माइलेज देती हैं।" यह गलत है।

AI की दुनिया में, एक ही मॉडल नाम को दर्जनों अलग-अलग कंपनियों (प्रदाताओं/providers) द्वारा विभिन्न हार्डवेयर सेटिंग्स का उपयोग करके परोसा जा सकता है।

  • उपमा: कल्पना कीजिए कि दो लोग "ताज़ा ब्रेड" बेच रहे हैं। एक इसे एक हाई-एंड ओवन से ताज़ा बेचता है (उच्च गुणवत्ता, उच्च कीमत)। दूसरा इसे एक माइक्रोवेव से बेचता है जो 10 साल से चल रहा है (कम गुणवत्ता, कम कीमत)। यदि आप केवल लेबल "ब्रेड" को देखते हैं, तो आप अंतर नहीं कर सकते।
  • वास्तविकता: शोध पत्र ने पाया कि बिल्कुल एक ही AI मॉडल के लिए, विभिन्न प्रदाता एक-दूसरे की तुलना में 12 गुना तेज़ या 6 गुना अधिक ऊर्जा-कुशल हो सकते हैं। कुछ इतने "क्वांटाइज्ड" (पैसे बचाने के लिए संकुचित/compressed) होते हैं कि वे मूल संस्करण की तुलना में गणित और कोडिंग में अधिक गलतियाँ करते हैं।

2. समाधान: "एंडपॉइंट" को मापना

टोकन एरिना माप की इकाई को बदल देता है। मॉडल को रैंक करने के बजाय, यह एंडपॉइंट को रैंक करता है।

  • उपमा: "टोयोटा" को रैंक करने के बजाय, वे "शिकागो में एक विशिष्ट डीलरशिप पर बेची जाने वाली टोयोटा, जिसमें V6 इंजन और विशिष्ट टायर लगे हैं" को रैंक करते हैं।
  • एंडपॉइंट क्या है? यह निम्नलिखित का विशिष्ट संयोजन है: इसे कौन बेच रहा है? कौन सा मॉडल? कौन सा विशिष्ट संस्करण (टर्बो बनाम स्टैंडर्ड)? सर्वर कहाँ स्थित है?

3. तीन बड़े स्कोर (हेडलाइंस)

टोकन एरिना केवल एक स्कोर नहीं देता; यह आपको निर्णय लेने में मदद करने के लिए तीन मुख्य नंबर देता है, ठीक वैसे ही जैसे एक कार समीक्षा MPG, कीमत और सुरक्षा रेटिंग देती है।

  1. सही उत्तर के लिए जूल (ऊर्जा का बिल):
    • उपमा: AI को एक समस्या को सही ढंग से हल करने के लिए कितनी बिजली की आवश्यकता होती है?
    • यह क्यों मायने रखता है: कुछ AI एंडपॉइंट्स बहुत बर्बादी करते हैं। वे प्रतिस्पर्धी की तुलना में एक सही उत्तर पाने के लिए 6 गुना अधिक ऊर्जा का उपयोग कर सकते हैं। जैसे-जैसे दुनिया में बिजली खत्म हो रही है, यह एक बहुत बड़ी लागत बन रही है।
  2. सही उत्तर के लिए डॉलर (जेब का बिल):
    • उपमा: एक सही उत्तर पाने के लिए आप कितने पैसे खर्च करते हैं?
    • यह क्यों मायने रखता है: एक सस्ता AI इतना धीमा या इसमें इतनी गलतियाँ हो सकती हैं कि आपको एक सही उत्तर पाने के लिए इसे 10 बार पूछना पड़े। टोकन एरिना वास्तविक लागत की गणना करता है, न कि केवल वेबसाइट पर सूचीबद्ध "प्रति टोकन कीमत" की।
  3. एंडपॉइंट फिडेलिटी (क्या यह असली चीज़ है? वाला टेस्ट):
    • उपमा: कल्पना कीजिए कि आप "नाइकी" का जूता खरीद रहे हैं। क्या यह असली नाइकी है, या एक नकली जो समान दिखता है लेकिन जल्दी खराब हो जाता है?
    • यह क्यों मायने रखता है: कुछ प्रदाता एक शक्तिशाली मॉडल लेते हैं, पैसे बचाने के लिए उसे भारी रूप से कंप्रेस (compress) करते हैं, और उसे बिना बताए "मूल" के रूप में बेचते हैं। टोकन एरिना के पास एक "फिंगरप्रिंट स्कैनर" है जो AI के आउटपुट को सुनता है। यदि AI की "आवाज़" मूल निर्माता के संस्करण से थोड़ी भी अलग सुनाई देती है, तो यह उसे "ड्रिफ्टेड" (Drifted) या "क्वांटाइज्ड" (Quantized) के रूप में चिह्नित करता है।

4. "वर्कलोड" का ट्विस्ट: एक आकार सबके लिए सही नहीं है

शोध पत्र दिखाता है कि "सर्वश्रेष्ठ" AI पूरी तरह से इस पर निर्भर करता है कि आप क्या कर रहे हैं।

  • उपमा: एक फॉर्मूला 1 कार रेसिंग के लिए सबसे अच्छी है, लेकिन बच्चों को सॉकर प्रैक्टिस के लिए ले जाने के लिए बहुत खराब है। एक मिनीवैन सॉकर के लिए बेहतरीन है, लेकिन रेसिंग के लिए बहुत खराब है।
  • निष्कर्ष:
    • यदि आप चैट (Chat) कर रहे हैं (छोटे प्रश्न, छोटे उत्तर), तो तेज़ और सस्ते मॉडल जीतते हैं।
    • यदि आप रीजनिंग (Reasoning) कर रहे हैं (जटिल गणित, लंबी सोच), तो महंगे, उच्च-गुणवत्ता वाले मॉडल जीतते हैं क्योंकि वे पहली बार में ही सही उत्तर देते हैं।
    • यदि आप RAG कर रहे हैं (विशाल दस्तावेज़ पढ़ना), तो वे मॉडल जीतते हैं जो "पढ़ने" (इनपुट) की लागत में सस्ते हैं।
    • चौंकाने वाला तथ्य: शोध पत्र ने पाया कि "चैट" के लिए टॉप 10 की सूची "रीजनिंग" के लिए टॉप 10 की सूची से लगभग पूरी तरह से अलग है। यदि आप एक सामान्य "सर्वश्रेष्ठ AI" सूची के आधार पर AI चुनते हैं, तो आप अपने काम के लिए गलत टूल चुन सकते हैं।

5. उन्होंने यह कैसे किया (एक निरंतर बेंचमार्क)

टोकना एरिना एक बार का परीक्षण नहीं है। यह एक जीवित, निरंतर दौड़ है।

  • उपमा: कार पत्रिका द्वारा गैरेज में एक बार कार का परीक्षण करने के बजाय, टोकन एरिना इन AI कारों को वास्तविक सड़कों पर 24/7 चलाने वाले रोबोटों की तरह है।
  • प्रक्रिया:
    • वे हर दिन 78 अलग-अलग AI एंडपॉइंट्स को हजारों परीक्षण प्रश्न (प्रोब्स) भेजते हैं।
    • वे गति, लागत, ऊर्जा उपयोग और सटीकता को मापते हैं।
    • वे यह जांचते हैं कि क्या AI अपने मूल निर्माता के उत्तरों की तुलना करके अपनी गुणवत्ता के बारे में "झूठ" बोल रहा है।
    • वे हर रात लीडरबोर्ड को अपडेट करते हैं।

6. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि "मॉडल का नाम" अब पर्याप्त नहीं है।
यदि आप एक व्यवसाय या डेवलपर हैं जो एक AI ऐप बनाने की कोशिश कर रहे हैं, तो आप केवल यह नहीं कह सकते कि "हम Llama 3 का उपयोग करेंगे।" आपको पूछना होगा: "कौन सा प्रदाता? कौन सा विशिष्ट संस्करण? किस विशिष्ट कार्य के लिए?"

टोकन एरिना इस जटिल परिदृश्य में नेविगेट करने के लिए एक मानचित्र प्रदान करता है, जो आपको दिखाता है कि:

  1. विविधता बहुत अधिक है: एक ही मॉडल अलग-अलग लोगों द्वारा बेचे जाने पर बहुत अलग प्रदर्शन कर सकता है।
  2. ऊर्जा मायने रखती है: कुछ एंडपॉइंट्स भारी ऊर्जा बर्बाद करने वाले हैं।
  3. संदर्भ मायने रखता है: "सर्वश्रेष्ठ" AI बदल जाता है चाहे आप चैट कर रहे हों, कोडिंग कर रहे हों, या रीजनिंग कर रहे हों।

संक्षेप में: टोकन एरिना एक ऐसा उपकरण है जो आपको केवल इसलिए एक "खराब (lemon)" AI खरीदने से रोकता है क्योंकि उसके बॉक्स पर एक शानदार नाम है। यह यह देखने के लिए इसके अंदर झांकता है कि यह कितनी ऊर्जा जलाता है, एक सही उत्तर पाने के लिए वास्तव में इसकी लागत कितनी है, और क्या यह वास्तव में असली चीज़ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →