← नवीनतम पेपर
💬 NLP

Benchmark Test-Time Scaling of General LLM Agents

यह शोध पत्र जनरल एजेंटबेंच (General AgentBench) प्रस्तुत करता है, जो विविध डोमेन में सामान्य-उद्देश्य वाले एलएलएम (LLM) एजेंटों के मूल्यांकन के लिए एक एकीकृत बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान एजेंट सामान्य सेटिंग्स में महत्वपूर्ण प्रदर्शन गिरावट का सामना करते हैं और न तो अनुक्रमिक (sequential) और न ही समानांतर (parallel) टेस्ट-टाइम स्केलिंग परिणामों में प्रभावी रूप से सुधार करती है क्योंकि इसमें कॉन्टेक्स्ट सीलिंग (context ceilings) और वेरिफिकेशन गैप्स (verification gaps) मौजूद हैं।

मूल लेखक: Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान सहायक (एक AI एजेंट) है जो विशिष्ट कार्यों में माहिर है। यदि आप उन्हें कोड लिखने के लिए कहते हैं, तो वे एक मास्टर प्रोग्रामर होते हैं। यदि आप उन्हें वेब खोजने के लिए कहते हैं, तो वे एक जासूस होते हैं। यदि आप उन्हें गणित करने के लिए कहते हैं, तो वे एक जीनियस होते हैं।

लेकिन क्या होता है जब आप उन्हें एक वास्तविक दुनिया के परिदृश्य में डालते हैं जहाँ सब कुछ आपस में मिला हुआ है? क्या होगा यदि आप उनसे कहें कि "टोक्यो की यात्रा की योजना बनाएं, सबसे अच्छा सुशी खोजें, टिकट बुक करने के लिए एक स्क्रिप्ट लिखें, और फिर उस व्यंजन के सांस्कृतिक इतिहास को समझाएं," जबकि उनके पास हर कल्पनाशील उपकरण (सर्च इंजन, कोड कंपाइलर, मैप्स, कैलकुलेटर, आदि) से भरी एक विशाल टूलबॉक्स तक पहुंच हो?

यह शोध पत्र, "Benchmark Test-Time Scaling of General LLM Agents," वास्तव में इन सहायकों के लिए एक तनाव परीक्षण (stress test) है जो इस अराजक, वास्तविक दुनिया की रसोई में काम कर रहे हैं।

इनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण यहाँ दिया गया है:

1. "विशेषज्ञ बनाम सामान्यज्ञ" का झटका (The "Specialist vs. Generalist" Shock)

सेटअप:
अधिकांश पिछले परीक्षण एक शेफ को एक विशिष्ट व्यंजन बनाने के लिए कहने जैसे थे (जैसे, "एक सूफ़ले बनाएं") एक ऐसी रसोई में जिसमें केवल सूफ़ले की सामग्री हो। AI ने इन परीक्षणों में उत्कृष्ट प्रदर्शन किया।

नया परीक्षण (General AgentBench):
शोधकर्ताओं ने एक "सुपर-किचन" (General AgentBench) बनाया। इस रसोई में, शेफ को एक सामान्य ऑर्डर दिया जाता है जैसे "एक भूखे पर्यटक के लिए कुछ स्वादिष्ट बनाएं" लेकिन उन्हें 300 अलग-अलग उपकरणों (एक ब्लेंडर, एक हथौड़ा, एक GPS, एक कोडिंग कंपाइलर, एक मानचित्र) वाला एक टूलबॉक्स दिया जाता है। उन्हें नहीं पता कि कौन सा उपकरण उपयोग करना है जब तक कि वे समस्या को समझ न लें।

परिणाम:
जब AI "विशेषज्ञ रसोई" से "सुपर-किचन" में गया, तो अधिकांश भ्रमित हो गए। उनका प्रदर्शन काफी कम हो गया (लगभग 30%)। यह एक मास्टर शेफ की तरह है जो कार का इंजन ठीक करने की कोशिश कर रहा है क्योंकि उसे "समस्या ठीक करने" के लिए कहा गया था, भले ही वह एक शेफ है। वे जम गए क्योंकि उन्हें बिना किसी स्पष्ट निर्देश पुस्तिका के एक विशाल ढेर में से सही उपकरण चुनना था।

2. "कड़ी मेहनत करने" के दो तरीके (Test-Time Scaling)

जब AI फंस जाता है, तो हम आमतौर पर उत्तर देने से पहले उसे "कड़ी मेहनत करने" (सोचने) के लिए कहते हैं। इस पेपर ने इसे करने के दो तरीकों का परीक्षण किया:

A. अनुक्रमिक स्केलिंग (Sequential Scaling): "लंबी बातचीत"

उपमा: कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं। आप प्रयास करते हैं, असफल होते हैं, सोचते हैं, फिर से प्रयास करते हैं, असफल होते हैं, और अधिक गहराई से सोचते हैं, और चलते रहते हैं। आप उत्तर खोजने के लिए अपने आप से एक लंबी, गहरी बातचीत कर रहे हैं।
निष्कर्ष: यह कुछ समय के लिए काम करता है। लेकिन अंततः, आप एक "कॉन्टेक्स्ट सीलिंग" (Context Ceiling) से टकराते हैं।
अपने मस्तिष्क की कल्पना एक व्हाइटबोर्ड की तरह करें। यदि आप पुराने विचारों को मिटाए बिना व्हाइटबोर्ड पर नए विचार लिखते रहते हैं, तो बोर्ड भर जाता है। AI अपने स्वयं के इतिहास से अभिभूत हो जाता है। वह पांच मिनट पहले जो किया था उसे भूलने लगता है या अपनी पिछली गलतियों से भ्रमित हो जाता है।

  • सबक: केवल अपने आप से अधिक देर तक बात करना तब तक मदद नहीं करता जब तक कि आपके पास मानसिक स्थान समाप्त न हो जाए। एक निश्चित बिंदु पर, अधिक सोचना वास्तव में आपको समस्या सुलझाने में बदतर बना देता है।

B. समानांतर स्केलिंग (Parallel Scaling): "समिति का मतदान"

उपमा: लंबे समय तक सोचने के बजाय, आप अपने ही चार अलग-अलग संस्करणों से एक साथ पहेली सुलझाने के लिए कहते हैं। आपको 4 अलग-अलग उत्तर मिलते हैं। अब, आपको उनमें से सबसे अच्छा चुनना है।
निष्कर्ष: यह पेचीदा है।

  • अच्छी खबर: यदि आप 4 संस्करणों को पूछते हैं, तो इस बात की बहुत अधिक संभावना है कि उनमें से कम से कम एक सही उत्तर पा लेगा। ("Past@K" मेट्रिक ऊपर जाता है)।
  • बुरी खबर: AI सही उत्तर चुनने में बहुत खराब है। इसे "वेरिफिकेशन गैप" (Verification Gap) कहा जाता है।
    • कल्पना कीजिए कि 4 विशेषज्ञों की एक समिति है। एक के पास सही उत्तर है, लेकिन AI (समिति अध्यक्ष) यह नहीं बता सकता कि कौन सही है। वह अक्सर गलत वाला चुन लेता है, या भ्रमित हो जाता है।
    • भले ही AI सही उत्तर उत्पन्न कर सकता था, लेकिन वह इसे विजेता के रूप में पहचानने में विफल रहा। यह कमरे में एक जीनियस होने जैसा है, लेकिन AI उस जीनियस पर भरोसा नहीं करता है।

3. "क्रॉस-डोमेन" आश्चर्य (The "Cross-Domain" Surprise)

वहाँ एक शानदार क्षण था। कभी-कभी, AI सामान्य सेटिंग में बेहतर हो गया।
उपमा: एक शेफ जो आमतौर पर केवल इतालवी भोजन पकाता है, उससे न्यूयॉर्क में सबसे अच्छा पिज्जा खोजने के लिए कहा जाता है। केवल "पिज्जा" गूगल करने के बजाय, वे एक विशिष्ट पिज्जेरिया का सटीक स्थान खोजने के लिए "मैप API" टूल का उपयोग करते हैं, और फिर रेटिंग की जांच करने के लिए "रिव्यू API" का उपयोग करते हैं।
सबक: कुछ AI इतने स्मार्ट हैं कि वे महसूस कर सकते हैं, "हे, मुझे वेब खोजने की ज़रूरत नहीं है; मुझे इस विशिष्ट डेटाबेस टूल का उपयोग करना चाहिए।" यह दिखाता है कि जब उन्हें उपकरणों को मिलाने की स्वतंत्रता दी जाती है, तो सबसे स्मार्ट एजेंट हमें आश्चर्यचकित कर सकते हैं।

सारांश: इसका भविष्य के लिए क्या अर्थ है?

पेपर निष्कर्ष निकालता है कि जबकि AI स्मार्ट हो रहा है, हम दो बड़ी दीवारों से टकरा रहे हैं:

  1. मेमोरी वॉल (The Memory Wall): आप केवल कठिन समस्याओं को हल करने के लिए AI को अपने आप में अधिक देर तक बात करने के लिए नहीं कह सकते; वह अंततः अपने इतिहास में खो जाता है। हमें उसकी मेमोरी को प्रबंधित करने के बेहतर तरीकों की आवश्यकता है।
  2. जजमेंट वॉल (The Judgment Wall): आप केवल एक AI को 100 उत्तर उत्पन्न करने और सही चुनने की उम्मीद नहीं कर सकते; वह अपने काम का न्याय करने में बुरा है। हमें बेहतर "जजों" या सत्यापन प्रणालियों की आवश्यकता है।

मुख्य बात (The Bottom Line):
हम AI जो एक "विशेषज्ञ" (एक चीज़ में महान) है से एक "सामान्यज्ञ" (कई चीज़ों में महान) की ओर बढ़ रहे हैं। लेकिन अभी, हमारे सामान्यज्ञ उन प्रतिभाशाली छात्रों की तरह हैं जो घबरा जाते हैं जब परीक्षा का प्रारूप बदल जाता है। जटिल, खुले-अंत वाले कार्यों को वास्तव में संभालने से पहले उन्हें बेहतर अध्ययन आदतों (कॉन्टेक्स्ट प्रबंधन) और बेहतर आत्म-विश्वास (यह जानना कि कौन सा उत्तर सही है) की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →