← नवीनतम पेपर
🤖 AI

Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation

यह शोध पत्र एक पदानुक्रमित सांख्यिकीय मॉडल (hierarchical statistical model) प्रस्तावित करता है जो LLM बेंचमार्किंग में सैंपलिंग वेरिएंस (sampling variance) को संबोधित करने के लिए कई पीढ़ियों (multiple generations) का लाभ उठाता है, जिससे स्कोर की सटीकता में सुधार होता है, सूक्ष्म-स्तरीय प्रॉम्प्ट-स्तर का कठिनाई विश्लेषण सक्षम होता है, और डेटा विज़ुअलाइज़ेशन के माध्यम से बेंचमार्क गुणवत्ता नियंत्रण की सुविधा मिलती है।

मूल लेखक: Wenbo Zhang, Hengrui Cai, Wenyu Chen

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenbo Zhang, Hengrui Cai, Wenyu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह आंकने की कोशिश कर रहे हैं कि एक नया शेफ खाना बनाने में कितना अच्छा है। आप उन्हें 100 रेसिपी बनाने की एक सूची देते हैं।

पुराना तरीका (द "वन शॉट" समस्या)
वर्तमान में, अधिकांश लोग AI मॉडल (जैसे लार्ज लैंग्वेज मॉडल्स) को एक सवाल पूछकर और उसके एक एकल उत्तर को देखकर आंकते हैं।

  • यदि शेफ एक बार एक बेहतरीन ऑमलेट बनाता है, तो हम कहते हैं कि वे एक उस्ताद हैं।
  • यदि वे एक बार इसे जला देते हैं, तो हम कहते हैं कि वे बहुत बुरे हैं।

समस्या यह है कि ये AI शेफ थोड़े अनिश्चित हो सकते हैं। कभी-कभी वे "लालची" (greedy) मूड में होते हैं और सबसे सुरक्षित, सबसे मानक रेसिपी पर टिके रहते हैं। अन्य समय में, वे "रैंडम" (random) हो जाते हैं और रचनात्मक बदलावों की कोशिश करते हैं। यदि आप केवल एक व्यंजन चखते हैं, तो आप भाग्यशाली या अभागा हो सकते हैं। आपको यह नहीं पता चलेगा कि शेफ वास्तव में अच्छे हैं, या उन्हें बस उस एक विशिष्ट ऑर्डर के साथ किस्मत मिली थी। यह एक बास्केटबॉल खिलाड़ी के फ्री-थ्रो प्रतिशत को केवल एक सिंगल बॉल फेंकते हुए देखने जैसा है।

नया तरीका (द "मल्टीपल जनरेशन" दृष्टिकोण)
यह पेपर एक बेहतर तरीका सुझाता है: शेफ को वही व्यंजन 50 बार बनाने के लिए कहें।

उसी रेसिपी के 50 अलग-अलग प्रयासों को देखकर, आपको एक स्पष्ट तस्वीर मिलती है:

  1. वास्तविक कौशल बनाम भाग्य: यदि शेफ 50 में से 48 बार इसे सही करते हैं, तो आप जानते हैं कि वे वास्तव में कुशल हैं। यदि वे केवल 25 बार इसे सही करते हैं, तो आप जानते हैं कि वे संघर्ष कर रहे हैं, भले ही वह एक भाग्यशाली शॉट एकदम सटीक रहा हो।
  2. कठिनाई को मापना: अब आप देख सकते हैं कि कौन सी रेसिपी वास्तव में कठिन हैं। यदि हर शेफ एक विशिष्ट व्यंजन में 50 बार विफल होता है, तो वह व्यंजन वस्तुनिष्ठ रूप से कठिन है। यदि वे सभी इसे सही करते हैं, तो यह आसान है। यह प्रत्येक प्रश्न के लिए एक "डिफिकल्टी स्कोर" (कठिनाई स्कोर) बनाता है।
  3. खराब रेसिपी खोजना: कभी-कभी, रेसिपी बुक खुद गलत होती है। हो सकता है कि रेसिपी कहती हो "नमक डालें" लेकिन उत्तर कुंजी (answer key) कहती हो "चीनी डालें।" यदि शेफ 50 बार प्रयास करता है और नमक डालता रहता है (क्योंकि रेसिपी यही कहती है), लेकिन उत्तर कुंजी गलत है, तो कंप्यूटर इस भ्रम को पकड़ सकता है। यह पेपर इसे "डेटा मैप" (Data Map) कहता है, जो टेस्ट में टूटे हुए प्रश्नों को खोजने और ठीक करने में मदद करता है।

"पासा फेंकने" (रोलिंग डाइस) का रूपक
AI को पासे की एक जोड़ी के रूप में सोचें।

  • ग्रीडी डिकोडिंग (पुराना तरीका): यह पासे को हमेशा उच्चतम संख्या पर रहने के लिए मजबूर करने जैसा है। यह अनुमानित है, लेकिन यह नहीं दिखाता कि पासे क्या कर सकते हैं।
  • रैंडम सैंपलिंग (नया तरीका): यह पासे को स्वाभाविक रूप से रोल करने देने जैसा है।
  • पेपर की अंतर्दृष्टि: यदि आप पासा एक बार फेंकते हैं, तो आपको लग सकता है कि पासा "6" आया है और आप सोच सकते हैं कि पासा जादुई है। यदि आप इसे 50 बार फेंकते हैं, तो आप वास्तविक औसत देख पाएंगे। यह पेपर गणितीय रूप से सिद्ध करता है कि पासे को अधिक बार फेंकने से (अधिक उत्तर उत्पन्न करने से) आपके द्वारा AI के कौशल का अनुमान लगाना बहुत अधिक सटीक और कम भाग्य पर आधारित हो जाता है।

उन्होंने वास्तव में क्या पाया
शोधकर्ताओं ने कई अलग-अलग AI मॉडलों का उपयोग करके चार अलग-अलग प्रकार के "टेस्ट" (बेंचमार्क) पर इसका परीक्षण किया:

  • स्थिरता (Stability): उन्होंने पाया कि कठिन तर्क (reasoning) कार्यों के लिए, AI एक रैंडम सैंपलर की तरह व्यवहार करता है। सच्चाई बताने के लिए एक उत्तर पर्याप्त नहीं है।
  • अंतर (The Gap): अक्सर एक बड़ा अंतर होता है जब AI सुरक्षित खेलता है (greedy) बनाम जब वह जोखिम लेता है (random)। केवल एक रैंडम अनुमान पर भरोसा करना अस्थिर है।
  • डेटा की सफाई: एक ही प्रश्न का 50 बार उत्तर देकर, वे एक गणितीय डेटासेट के लगभग 44% प्रश्नों को खोजने में सक्षम रहे जो या तो गलत लेबल किए गए थे या भ्रमित करने वाले तरीके से लिखे गए थे।

चुनौती (The Catch)
पेपर स्वीकार करता है कि 50 व्यंजन पकाने में केवल एक पकाने की तुलना में अधिक समय और ऊर्जा लगती है। इसके लिए अधिक कंप्यूटर पावर की आवश्यकता होती है। हालांकि, ट्रेड-ऑफ यह है कि आपको AI के लिए बहुत अधिक ईमानदार और विश्वसनीय रिपोर्ट कार्ड मिलता है।

सारांश में
किसी किताब को केवल एक पन्ने से न आंकें, और न ही किसी AI को केवल एक उत्तर से आंकें। AI को एक ही कार्य को कई बार करने के लिए कहकर, हम उसकी वास्तविक क्षमताओं को देख सकते हैं, समझ सकते हैं कि कौन से प्रश्न वास्तव में कठिन हैं, और उन टेस्ट को ठीक कर सकते हैं जो टूटे हुए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →