ACE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments
ACE-Bench एक हल्का, पुनरुत्पादनीय एजेंट मूल्यांकन बेंचमार्क है जो कार्य क्षितिज (task horizons) और कठिनाई के सूक्ष्म, नियंत्रणीय हेरफेर के लिए स्थिर JSON वातावरणों के साथ एक एकीकृत ग्रिड-आधारित योजना कार्य का उपयोग करता है, जिससे मौजूदा बेंचमार्क में प्रचलित उच्च ओवरहेड और अविश्वसनीय स्कोरिंग संबंधी समस्याओं का समाधान होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि एक नया रोबोट शेफ 100 मेहमानों के लिए एक विशाल, जटिल डिनर पार्टी की योजना बनाने में कितना अच्छा है।
वर्तमान परीक्षणों के साथ समस्या
अभी, हम इन AI "शेफ" (एजेंटों) का परीक्षण करने के लिए उन्हें एक वास्तविक, अराजक रसोई में काम करने के लिए मजबूर करते हैं। उन्हें फ्रिज तक जाना पड़ता है, ओवन खोलना पड़ता है, किराने की दुकान को कॉल करना पड़ता है और डिलीवरी ट्रक का इंतज़ार करना पड़ता है।
- समय की बर्बादी: पेपर में बताया गया है कि वर्तमान परीक्षणों में, रोबोट अपना लगभग 40% समय केवल रसोई के जवाब देने का इंतज़ार करने में बिता देता है (दरवाजे खोलना, वेबसाइट लोड होना, सर्वर का इंतज़ार करना)। यह एक छात्र की तरह है जो गणित की परीक्षा दे रहा है लेकिन आधा समय शिक्षक द्वारा पेपर बांटने का इंतज़ार करने में बिता देता है।
- अनुचित मिश्रण: इसके अलावा, परीक्षण असंतुलित हैं। कुछ कार्य आसान हैं (जैसे "सैंडविच बनाना"), जबकि अन्य असंभव हैं (जैसे "500 लोगों के लिए शादी की योजना बनाना")। यदि कोई रोबोट सैंडविच बनाने में माहिर है लेकिन शादियों के मामले में खराब है, तो अंतिम स्कोर गड़बड़ा जाता है। आप यह नहीं बता सकते कि रोबोट स्मार्ट है या सिर्फ भाग्यशाली था क्योंकि उसे आसान सवाल मिले।
समाधान: ACE-Bench (एक "डिजिटल सिमुलेशन किचन")
लेखकों ने ACE-Bench नामक एक नया परीक्षण बनाया है। एक वास्तविक रसोई के बजाय, उन्होंने एक परफेक्ट, इंस्टेंट डिजिटल सिमुलेशन बनाया है।
इसे एक वीडियो गेम लेवल की तरह समझें जहाँ नियम एक सरल किताब (एक JSON फ़ाइल) में लिखे गए हैं। रोबोट को किसी चीज़ का इंतज़ार नहीं करना पड़ता; वह बस तुरंत पन्ने पलटता है। यह "इंतज़ार के समय" को हटा देता है, जिससे हम केवल यह माप पाते हैं कि रोबोट वास्तव में कितना स्मार्ट है।
यह परीक्षण कैसे काम करता है: "शेड्यूल पहेली"
इस परीक्षण का मुख्य आधार एक विशाल शेड्यूलिंग पहेली है, जैसे स्कूल का टाइमटेबल भरना या शादी का सीटिंग चार्ट बनाना।
- ग्रिड: एक कैलेंडर की कल्पना करें जिसमें खाली स्लॉट हैं। कुछ स्लॉट पहले से भरे हुए (pre-filled) हैं, लेकिन कुछ छिपे हुए हैं जिन्हें रोबोट द्वारा भरा जाना है।
- नियम:
- स्थानीय नियम (Local Rules): "यह क्लास सोमवार को नहीं हो सकती।" (जांचने में आसान)।
- वैश्विक नियम (Global Rules): "पूरे सप्ताह के कुल क्रेडिट ठीक 30 होने चाहिए।" (जांचने में कठिन क्योंकि आपको पूरी तस्वीर देखनी पड़ती है)।
नियंत्रण के लिए दो जादुई नॉब्स (Knobs)
ACE-Bench की खासियत यह है कि शोधकर्ता इस परीक्षण को बिल्कुल उतना ही कठिन या लंबा बना सकते हैं जितना वे चाहते हैं, इसके लिए वे दो "नॉब्स" को घुमा सकते हैं:
नॉब 1: "छिपे हुए स्लॉट" (Horizon)
- उपमा: एक भूलभुलैया की कल्पना करें।
- यदि आप नॉब को 1 पर घुमाते हैं, तो रोबोट को केवल एक खाली सीट भरनी होगी। यह एक छोटा, सरल कार्य है।
- यदि आप इसे 17 पर घुमाते हैं, तो रोबोट को 17 सीटें भरनी होंगी, और उसके द्वारा किया गया हर चुनाव अगले 16 को प्रभावित करता है। यह तर्क की एक लंबी, जटिल श्रृंखला है। यह परीक्षण करता है कि रोबोट कितनी दूर तक "आगे देख" सकता है।
नॉब 2: "डिकॉय बजट" (Difficulty)
- उपमा: "असली चाबी खोजने के खेल" की कल्पना करें जहाँ कोई व्यक्ति असली चाबी की तरह दिखने वाली नकली चाबियाँ रख देता है।
- यदि नॉब 0 पर है, तो कोई नकली चाबियाँ नहीं हैं। रोबोट बस सही चाबी चुन लेता है।
- यदि नॉब 10 है, तो रोबोट को 10 नकली चाबियाँ (डिकॉय) दी जाती हैं। ये नकली चाबियाँ स्थानीय नियमों (जैसे, "हाँ, यह क्लास सोमवार को फिट बैठती है!") के लिए एकदम सही दिखती हैं, लेकिन यदि आप उन्हें चुनते हैं, तो वे वैश्विक नियमों को तोड़ देती हैं (जैसे, "ओह, अब कुल क्रेडिट बहुत अधिक हो गए हैं!")।
- यह रोबोट को बहुत सावधान रहने और गहराई से सोचने के लिए मजबूर करता है, न कि केवल अनुमान लगाने के लिए।
उन्होंने क्या पाया
उन्होंने 13 अलग-अलग AI मॉडल (छोटे से लेकर विशाल तक) का इस नए परीक्षण पर परीक्षण किया।
- परिणाम: परीक्षण पूरी तरह से सफल रहा।
- बड़े दिमाग जीतते हैं: विशाल AI मॉडल छोटे मॉडलों की तुलना में कठिन पहेलियों को बहुत बेहतर तरीके से हल करते हैं।
- कठिन पहेली = कम स्कोर: जैसे-जैसे वे "छिपे हुए स्लॉट" और "डिकॉय" नॉब्स को बढ़ाते गए, सभी के स्कोर गिरते गए, ठीक वैसे ही जैसा अपेक्षित था।
- कोई इंतज़ार नहीं: क्योंकि यह एक हल्का डिजिटल परीक्षण है, वे इसे बहुत तेज़ी से हजारों प्रयोगों के रूप में चला सकते थे, यहाँ तक कि AI को प्रशिक्षित करते समय भी।
संक्षेप में
ACE-Bench AI दिमागों के लिए एक जिम की तरह है। AI को बारिश में मैराथन दौड़ने (धीमी वेबसाइटों का इंतज़ार करने) के बजाय, वे इसे एक ट्रेडमिल पर रखते हैं जहाँ गति और ढलान को पूरी तरह से समायोजित किया जा सकता है। यह वैज्ञानिकों को यह देखने की अनुमति देता है कि AI की तर्क करने वाली मांसपेशियां वास्तव में कितनी मजबूत हैं, बिना धीमे कंप्यूटरों या अनुचित परीक्षण प्रश्नों के शोर के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।