← नवीनतम पेपर
🤖 AI

Benchmark Everything Everywhere All at Once

यह शोधपत्र Benchmark Agent को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त एजेंटिक प्रणाली है जो न्यूनतम मानवीय हस्तक्षेप के साथ उच्च-गुणवत्ता वाले, विविध मूल्यांकन बेंचमार्क को स्वचालित रूप से उत्पन्न करके पारंपरिक बेंचमार्क निर्माण की श्रम-साध्य और स्केलेबिलिटी संबंधी चुनौतियों का समाधान करती है।

मूल लेखक: Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि एक नया रोबोट कितना बुद्धिमान है। अतीत में, मनुष्यों को बैठने, सैकड़ों कठिन प्रश्न लिखने, उनके साथ चित्र खोजने और उत्तरों को मैन्युअल रूप से ग्रेड करने की आवश्यकता होती थी। यह धीमा, महंगा था, और जब तक परीक्षण तैयार होता, रोबोट अक्सर उत्तर सीख चुके होते थे, जिससे परीक्षण बेकार हो जाता था।

यह शोध पत्र "बेंचमार्क एजेंट" (Benchmark Agent) को पेश करता है, जो एक नया सिस्टम है जो एक स्वचालित टेस्ट-मेकर (automated test-maker) के रूप में कार्य करता है। मनुष्यों द्वारा सारा काम करने के बजाय, यह AI सिस्टम खुद अपने परीक्षणों को डिजाइन, बनाता और जाँचता है ताकि यह देख सके कि अन्य AI मॉडल कैसा प्रदर्शन कर रहे हैं।

यह कैसे काम करता है, इसे सरल उपमाओं के साथ यहाँ समझाया गया है:

1. समस्या: "पुराना हुआ पाठ्यपुस्तक" वाला मुद्दा (The "Outdated Textbook" Issue)

वर्तमान AI बेंचमार्क (परीक्षणों) को पाठ्यपुस्तकों की तरह समझें।

  • समस्या: एक पाठ्यपुस्तक लिखने में बहुत समय लगता है (डेटा एकत्र करना, प्रश्न लिखना)। जब तक पुस्तक प्रकाशित होती है और छात्र (AI मॉडल) इसका अध्ययन करना शुरू करते हैं, तब तक छात्रों ने उत्तर रट लिए होते हैं। परीक्षण अब यह नहीं बताता कि कौन वास्तव में बुद्धिमान है; यह केवल यह बताता है कि किसने किताब रट ली है।
  • शोध पत्र का दावा: मौजूदा परीक्षण बहुत जल्दी "संतृप्ति" (saturation) तक पहुँच जाते हैं। वे उपयोगी होना बंद कर देते हैं क्योंकि मॉडल उन पर बहुत अच्छे हो जाते हैं, और नए परीक्षणों को मैन्युअल रूप से बनाना बहुत धीमा और महंगा है।

2. समाधान: "वास्तुकार और निर्माता" की टीम (The "Architect and Builder" Team)

बेंचमार्क एजेंट एक पूरी तरह से स्वायत्त प्रणाली है जो परीक्षणों के लिए एक निर्माण दल (construction crew) की तरह कार्य करती है। यह केवल उत्तरों को ग्रेड नहीं करती; यह आपके द्वारा मांगी गई चीज़ के आधार पर शून्य से पूरा परीक्षा पत्र बनाती है। इसके दो मुख्य कार्यकर्ता हैं:

कार्यकर्ता A: वास्तुकार (The "Benchmark Planner")

यह ऑपरेशन का मस्तिष्क है।

  • यह क्या करता है: आप इसे बताते हैं, "मैं यह परीक्षण करना चाहता हूँ कि क्या AI डॉक्टर और मरीज के बीच की बातचीत को समझ सकता है, जिसमें उनकी आवाज़ का लहजा और एक मेडिकल स्कैन भी शामिल है।"
  • यह कैसे काम करता है:
    1. डिजाइन (Design): यह इस बड़े अनुरोध को छोटे, विशिष्ट कार्यों में तोड़ देता है (जैसे, "एक मेडिकल स्कैन खोजें," "एक बातचीत खोजें," "निदान के बारे में एक प्रश्न बनाएं")।
    2. ग्राउंडिंग (Grounding - वास्तविकता की जाँच): यह जाँचता है कि क्या ये कार्य वास्तव में संभव हैं। यह पूछता है, "क्या हमारे पास उपयोग करने के लिए वास्तविक मेडिकल स्कैन हैं? क्या हम कानूनी रूप से उन्हें टेस्ट प्रश्न में बदल सकते हैं?" यदि उत्तर 'नहीं' है, तो यह कार्य को फिर से डिजाइन करता है।
    3. आवंटन (Allocation): यह सुनिश्चित करने के लिए कि परीक्षण संतुलित रहे, यह तय करता है कि प्रत्येक प्रकार के कितने प्रश्न बनाए जाएं।

कार्यकर्ता B: निर्माता (The "Benchmark Executor")

यह वह व्यावहारिक कार्यकर्ता है जो वास्तव में टेस्ट आइटम बनाता है।

  • यह क्या करता है: यह वास्तुकार की योजना लेता है और प्रश्नों को बनाने के लिए उपकरणों (tools) का उपयोग करता है।
  • यह कैसे काम करता है:
    • यह छवियों को रीसाइज करने, ऑडियो को टेक्स्ट में बदलने या तथ्यों के लिए वेब खोजने के लिए टूल्स का उपयोग करता है।
    • यह वास्तविक प्रश्न और उत्तर उत्पन्न करता है।
    • गुणवत्ता नियंत्रण (Quality Control): यह एक सख्त संपादक की तरह कार्य करता है। यदि कोई प्रश्न भ्रमित करने वाला है या उत्तर गलत है, तो यह उसे फेंक देता है और पर्याप्त उच्च-गुणवत्ता वाले प्रश्न प्राप्त होने तक फिर से प्रयास करता है।

3. यह क्या विशेष बनाता है?

शोध पत्र इसकी तीन मुख्य महाशक्तियों को उजागर करता है:

  • अनुकूलन (Customization - "दर्जी" की उपमा): एक "एक ही आकार सबके लिए" (one-size-fits-all) वाले परीक्षण (जैसे मानक बहुविकल्पीय परीक्षा) के बजाय, यह प्रणाली आपकी सटीक आवश्यकताओं के अनुसार परीक्षण को अनुकूलित कर सकती है। क्या आप यह परीक्षण करना चाहते हैं कि क्या एक AI 19वीं सदी की कला को समझ सकता है? या किसी विशिष्ट भाषा में लिखे गए कोड को? वास्तुकार उस विशिष्ट कार्य के लिए एक कस्टम सूट डिजाइन करता है।
  • गति और कम लागत (Speed and Low Cost - "फैक्ट्री" की उपमा): मनुष्य एक टेस्ट प्रश्न बनाने में मिनटों या घंटों का समय लेते हैं। बेंचमार्क एजेंट उन्हें सेकंडों में बना सकता है। शोध पत्र का दावा है कि यह मानव एनोटेशन की तुलना में लगभग 20 गुना तेज़ और बहुत सस्ता है।
  • हमेशा ताज़ा (Always Fresh - "लाइव स्ट्रीम" की उपमा): क्योंकि यह परीक्षणों को स्वचालित रूप से बनाता है, यह एक नया, अधिक स्मार्ट AI मॉडल आने के क्षण में तुरंत नए परीक्षण बना सकता है। यह प्रश्नों को लगातार रिफ्रेश करके "याद करने" (memorization) की समस्या को रोकता है।

4. क्या यह सफल रहा?

शोधकर्ताओं ने इस प्रणाली का परीक्षण 15 अलग-अलग प्रकार के परीक्षणों को बनाकर किया (जिसमें गणित, कला, मेडिकल इमेजिंग और बातचीत शामिल थी)।

  • मानवीय जाँच (Human Check): मानव विशेषज्ञों ने परीक्षणों को देखा और कहा, "हाँ, ये अच्छे, स्पष्ट और उत्तर देने योग्य हैं।"
  • AI जज (AI Judge): एक अन्य AI ने जज के रूप में कार्य किया और पुष्टि की कि प्रश्न तार्किक थे और लक्ष्यों से मेल खाते थे।
  • परिणाम: सिस्टम ने उच्च-गुणवत्ता वाले परीक्षण सफलतापूर्वक बनाए जो एक "कम बुद्धिमान" AI और एक "बुद्धिमान" AI के बीच अंतर बता सके, भले ही वह स्मार्ट AI बहुत उन्नत क्यों न हो।

सारांश

संक्षेप में, बेंचमार्क एजेंट AI परीक्षण बनाने के लिए एक "सेल्फ-ड्राइविंग कार" है। मनुष्यों द्वारा प्रश्नों को लिखने की प्रक्रिया को मैन्युअल रूप से चलाने के बजाय, यह सिस्टम पूरी यात्रा को संचालित करता है—आपकी ज़रूरत को समझने से लेकर, सही सामग्री खोजने और अंतिम परीक्षण बनाने तक—यह सुनिश्चित करता है कि परिणाम ताज़ा, निष्पक्ष और तेज़ हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →