Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
यह शोधपत्र Agentick को प्रस्तुत करता है, जो विविध मोडैलिटी और कठिनाई स्तरों में 37 प्रक्रियात्मक रूप से उत्पन्न (procedurally generated) कार्यों वाला एक एकीकृत बेंचमार्क है, ताकि RL, LLM, VLM, हाइब्रिड और मानव एजेंटों के लिए अनुक्रमिक निर्णय लेने (sequential decision-making) में निष्पक्ष तुलना को सक्षम किया जा सके और प्रगति को गति दी जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि दुनिया का सबसे अच्छा "समस्या समाधानकर्ता" (problem solver) कौन है। आपके पास तीन बहुत ही अलग प्रकार के प्रतियोगी हैं:
- द ब्लैंक स्लेट (The Blank Slate): एक रोबोट जिसे कुछ भी नहीं पता और उसे सब कुछ 'ट्रायल एंड एरर' (गलती करके सीखने) के माध्यम से सीखना है (जैसे एक बच्चा चलना सीखता है)।
- द एनसाइक्लोपीडिया (The Encyclopedia): एक सुपर-स्मार्ट कंप्यूटर जिसने लगभग पूरा इंटरनेट पढ़ लिया है लेकिन उसने वास्तविक दुनिया में कभी कुछ किया नहीं है।
- द हाइब्रिड (The Hybrid): दोनों का मिश्रण।
समस्या क्या है? अब तक, हम उनकी निष्पक्ष तुलना नहीं कर सकते थे। यह एक तैराक, एक शतरंज के ग्रैंडमास्टर और एक मैराथन धावक की तुलना करने जैसा है और उनसे "दौड़ लगाने" के लिए कहने जैसा है। तैराक डूब जाएगा, और शतरंज खिलाड़ी रास्ता भटक जाएगा।
मिलिए "एजेंटिक" (Agentick) से।
इस शोध पत्र के लेखकों ने एक नया, सार्वभौमिक परीक्षण मैदान बनाया है जिसे Agentick कहा जाता है। इसे एक विशाल, प्रक्रियात्मक रूप से निर्मित (procedurally generated) "बाधा दौड़" (obstacle course) के रूप में समझें, जिसे विशेष रूप से इसलिए डिज़ाइन किया गया है ताकि किसी भी प्रकार का AI एक ही खेल के मैदान पर प्रतिस्पर्धा कर सके।
बाधा दौड़ (The Benchmark)
Agentick केवल एक खेल नहीं है; यह 37 अलग-अलग मिनी-गेम्स (जैसे भूलभुलैया, पहेलियाँ और खजाने की खोज) का एक संग्रह है जो धीरे-धीरे कठिन होते जाते हैं। ये खेल छह विशिष्ट कौशलों का परीक्षण करते हैं:
- नेविगेशन (Navigation): क्या आप अपना रास्ता खोज सकते हैं?
- प्लानिंग (Planning): क्या आप आगे की सोच सकते हैं?
- रीजनिंग (Reasoning): क्या आप तर्क संबंधी पहेलियों को हल कर सकते हैं?
- मेमोरी (Memory): क्या आपको याद है कि 10 कदम पहले क्या हुआ था?
- जनरलाइजेशन (Generalization): क्या आप एक नए नियम के अनुकूल ढल सकते हैं?
- टीमवर्क (Teamwork): क्या आप दूसरों के साथ (या उनके विरुद्ध) काम कर सकते हैं?
यूनिवर्सल ट्रांसलेटर (The Interface)
यही असली जादू है: Agentick खेल के हर एक क्षण के लिए एक साथ पाँच अलग-अलग भाषाएँ बोलता है।
- "ब्लैंक स्लेट" (RL) के लिए: यह एक पिक्सेलेटेड वीडियो गेम स्क्रीन दिखाता है (जैसे पुराने ज़माने का आर्केड गेम)।
- "एनसाइक्लोपीडिया" (LLMs) के लिए: यह ASCII पात्रों (जैसे दीवारों के लिए
#और खाली जगह के लिए.) का उपयोग करके एक टेक्स्ट-आधारित मानचित्र या लिखित विवरण दिखाता है। - इंसानों के लिए: यह एक 3D-शैली का दृश्य दिखाता है।
यह सुनिश्चित करता है कि किसी के साथ भी अन्याय न हो। "एनसाइक्लोपीडिया" को यह अनुमान लगाने की ज़रूरत नहीं है कि पिक्सेल का क्या अर्थ है, और "ब्लैंक स्लेट" को नियम समझने के लिए उपन्यास पढ़ने की आवश्यकता नहीं है। वे सभी दुनिया की समान स्थिति देखते हैं, बस उनके सर्वोत्तम प्रारूप में।
परिणाम: कौन जीता?
शोधकर्ताओं ने यह देखने के लिए 90,000 से अधिक गेम चलाए कि कौन सबसे अच्छा प्रदर्शन करता है। यहाँ उन्होंने पाया (सरल उपमाओं का उपयोग करते हुए):
कोई एक नायक नहीं: कोई भी एक "सर्वश्रेष्ठ" AI नहीं है। यह कार्य पर निर्भर करता है।
- ब्लैंक स्लेट (RL) प्लानिंग और टीमवर्क में अद्भुत था। इसने दोहराव के माध्यम से खेल के सटीक मैकेनिक्स को सीखा और एक कुशल रणनीतिकार बन गया।
- एनसाइक्लोपीडिया (LLMs) नेविगेशन और जनरलाइजेशन में बेहतरीन था। क्योंकि इसने बहुत कुछ पढ़ा था, यह बिना अभ्यास किए एक नई भूलभुलैया में सही रास्ता अनुमान लगा सकता था।
- फैसला: यहाँ तक कि सबसे स्मार्ट AI (GPT-5 mini) भी केवल लगभग 30% "परफेक्ट स्कोर" तक ही पहुँच सका। आज AI जो कर सकता है और जो उसे करना चाहिए, उसके बीच एक बड़ा अंतर है।
"सोचने" का तरीका (The "Thinking" Trick): आप AI को कैसे सोचने के लिए कहते हैं, यह इस पर निर्भर करता है कि AI कितना बड़ा है।
- जब शोधकर्ताओं ने LLMs को कार्य करने से पहले "चरण-दर-चरण सोचें" (जिसे चेन-ऑफ-थॉट विधि कहा जाता है) के लिए कहा, तो उनका प्रदर्शन तीन गुना या दस गुना तक बढ़ गया। यह एक छात्र को बताने जैसा है, "सिर्फ अनुमान मत लगाओ; पहले अपना तर्क लिखो।" अचानक, वे पहेली को बहुत बेहतर तरीके से हल करते हैं।
संक्षिप्त और स्पष्ट बेहतर है: मानचित्र में नेविगेट करने की कोशिश करने वाले AI के लिए, टेक्स्ट ग्रिड (ASCII) लंबे, फैंसी विवरणों की तुलना में बेहतर काम करते हैं।
- कल्पना कीजिए कि आप किसी को दिशा निर्देश दे रहे हैं। प्रतीकों (जैसे
#= दीवार,.= रास्ता) वाला एक सरल मानचित्र, टेक्स्ट के एक पैराग्राफ की तुलना में जो कहता है, "आप एक कमरे में खड़े हैं जिसमें आपके बाईं ओर एक दीवार है..." को प्रोसेस करना कंप्यूटर के लिए अधिक कुशल था। संक्षिप्त प्रतीक स्थानिक तर्क (spatial reasoning) के लिए अधिक प्रभावी थे।
- कल्पना कीजिए कि आप किसी को दिशा निर्देश दे रहे हैं। प्रतीकों (जैसे
यह क्यों महत्वपूर्ण है
यह शोध पत्र तर्क देता है कि वास्तव में सक्षम, स्वायत्त एजेंट (रोबोट या सॉफ्टवेयर जो अपने आप काम कर सकें) बनाने के लिए, हमें इन विभिन्न प्रकार के AI को अलग-अलग दुनियाओं के रूप में देखना बंद करना होगा। Agentick एक साझा आधार प्रदान करता है जिससे यह देखा जा सके कि प्रत्येक प्रकार कहाँ चमकता है और कहाँ विफल होता है।
यह सुझाव देता है कि AI का भविष्य केवल बड़े मॉडल बनाने या उन्हें लंबे समय तक प्रशिक्षित करने के बारे में नहीं है; यह "करने से सीखने" (Blank Slate) को "विश्व ज्ञान" (Encyclopedia) के साथ जोड़ने के बारे में है, और साथ ही सर्वोत्तम परिणाम प्राप्त करने के लिए सही "प्रॉम्प्टिंग" (निर्देशों) का उपयोग करने के बारे में है।
संक्षेप में: Agentick पहला निष्पक्ष रेफरी है जो एक ही अरीना में शतरंज के खिलाड़ी, तैराक और धावक का न्याय कर सकता है, यह साबित करते हुए कि हालांकि हमने प्रगति की है, हम अभी भी एक पूर्ण स्वायत्त एजेंट बनाने से बहुत दूर हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।