← नवीनतम पेपर
🤖 AI

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

यह शोधपत्र AgentFloor प्रस्तुत करता है, जो एक स्तरीय बेंचमार्क है और यह दर्शाता है कि छोटे ओपन-वेट मॉडल्स एजेंटिक वर्कफ़्लो में अधिकांश नियमित, शॉर्ट-होराइज़न टूल-यूज़ कार्यों को प्रभावी ढंग से संभाल सकते हैं, जिससे बड़े फ्रंटियर मॉडल्स को केवल जटिल लॉन्ग-होराइज़न प्लानिंग के लिए आरक्षित रखा जा सकता है और कम लागत पर तुलनीय समग्र प्रदर्शन प्राप्त किया जा सकता है।

मूल लेखक: Ranit Karmakar, Jayita Chatterjee

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ranit Karmakar, Jayita Chatterjee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त डिलीवरी कंपनी चलाते हैं। हर बार जब कोई ग्राहक ऑर्डर देता है, तो आपके सिस्टम को दर्जनों छोटे निर्णय लेने होते हैं: "पता चेक करें," "कीमत पता करें," "वेयरहाउस को कॉल करें," "लेबल प्रिंट करें।"

लंबे समय तक, नियम यह था: "हर निर्णय के लिए हमारे सबसे महंगे, सुपर-स्मार्ट CEO का उपयोग करें।" यहाँ तक कि "पता चेक करने" जैसे साधारण काम के लिए भी, आप CEO को काम पर रखेंगे। यह काम तो करता है, लेकिन इसमें बहुत पैसा खर्च होता है और इसमें काफी समय लगता है।

AgentFloor नामक शोध पत्र एक सरल प्रश्न पूछता है: क्या हमें हर काम के लिए वास्तव में CEO की आवश्यकता है? या क्या हम नियमित कामों के लिए एक स्मार्ट, तेज़ और सस्ते इंटर्न को काम पर रख सकते हैं, ताकि CEO को केवल वास्तव में कठिन समस्याओं के लिए बचाया जा सके?

यह जानने के लिए, शोधकर्ताओं ने एक विशाल, 30-चरणों वाला बाधा दौड़ (एक बेंचमार्क) बनाया जो विभिन्न AI "वर्कर्स" द्वारा टूल्स (औजारों) के उपयोग की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है। उन्होंने अलग-अलग आकार के 16 विभिन्न AI मॉडलों (छोटे "इंटर्न" से लेकर विशाल "CEO" तक) का परीक्षण वर्तमान शीर्ष-स्तरीय AI (GPT-5) के विरुद्ध किया।

यहाँ उन्हें क्या मिला, जिसे कुछ सरल उपमाओं के माध्यम से समझाया गया है:

1. कठिनाई की "सीढ़ी" (The "Ladder" of Difficulty)

शोधकर्ताओं ने कार्यों को एक 6-रंगों वाली सीढ़ी में व्यवस्थित किया। जैसे-जैसे आप ऊपर चढ़ते हैं, काम कठिन होता जाता है:

  • रंग 1 और 2 (ग्राउंड फ्लोर): सरल निर्देश और एक टूल का उपयोग करना (जैसे फोन नंबर ढूँढना)।
  • रंग 3 और 4 (मध्य भाग): दो टूल्स को एक साथ जोड़ना या किसी परिणाम के आधार पर निर्णय लेना (जैसे "यदि कीमत अधिक है, तो मैनेजर को कॉल करें")।
  • रंग 5 और 6 (शिखर): जटिल योजना बनाना जहाँ आपको लंबे समय तक नियमों को याद रखना पड़ता है और बिना भटके कई चरणों का समन्वय करना पड़ता है।

2. परिणाम: कौन क्या चढ़ सकता है?

अध्ययन ने एक स्पष्ट "फ्लोर" (सीमा) का खुलासा किया जहाँ छोटे मॉडल काम करने में असमर्थ हो जाते हैं।

  • ग्राउंड फ्लोर (रंग 1 और 2): छोटे, सस्ते मॉडल (यानी "इंटर्न") वास्तव में महंगे CEO के बराबर या उनसे बेहतर हैं। वे सरल निर्देशों का पालन कर सकते हैं और सिंगल टूल का उपयोग पूरी तरह से कर सकते हैं। वास्तव में, छोटे मॉडल इतने तेज़ और सस्ते थे कि वे 15 गुना कम लागत में और 2.5 गुना तेज़ी से समान मात्रा में काम कर सकते थे।
  • मध्य रंग (रंग 3 और 4): छोटे मॉडल अभी भी बहुत अच्छा काम कर रहे हैं। वे CEO के प्रदर्शन के बहुत करीब हैं। अध्ययन यह नहीं कह सका कि वे 100% सांख्यिकीय निश्चितता के साथ बिल्कुल बराबर हैं, लेकिन वे उपयोग के लिए पर्याप्त करीब थे।
  • शिखर (रंग 5 और 6): यहीं पर अंतर दिखाई देता। जब कार्य में दीर्घकालिक योजना बनाने और एक साथ कई नियमों को याद रखने की आवश्यकता होती है, तो छोटे मॉडल लड़खड़ाने लगते हैं। वे भ्रमित हो जाते हैं, उनके "कदम" खत्म हो जाते हैं (जैसे कोई धावक थक जाता है), या वे ऐसे टूल्स बनाने लगते हैं जो अस्तित्व में ही नहीं हैं। बड़ा CEO (GPT-5) यहाँ अभी भी बेहतर है, लेकिन वह भी शिखर पर एकदम परफेक्ट नहीं है; वह भी इन सबसे कठिन कार्यों में काफी विफल होता है।

3. "जादुई समाधान" काम नहीं आया

शोधकर्ताओं ने छोटे मॉडलों को उच्च स्तरों पर चढ़ने में मदद करने के लिए एक "चीट शीट" (एक विशेष प्रॉम्प्ट) देने की कोशिश की, इस उम्मीद में कि यह उन्हें CEO जितना स्मार्ट बना देगा।

  • परिणाम: यह सार्वभौमिक रूप से काम नहीं आया। एक ट्रिक जो एक विशिष्ट मॉडल की मदद करती थी, कभी-कभी दूसरे मॉडल को और खराब कर देती थी। यह एक मैराथन धावक को एक विशिष्ट जोड़ी दौड़ने वाले जूतों को देने जैसा है; यह उस विशेष धावक की मदद कर सकता है, लेकिन यह किसी और को लड़खड़ा भी सकता है। ऐसा कोई एकल "जादुई बटन" नहीं है जो एक छोटे मॉडल को जटिल योजना बनाने के लिए तुरंत एक बड़े मॉडल जितना स्मार्ट बना दे।

4. मुख्य निष्कर्ष: "स्मार्ट रूटिंग" रणनीति

यह शोध पत्र एक नए तरीके से AI सिस्टम बनाने का सुझाव देता है, जिसे वे रूटिंग (Routing) कहते हैं।

सब कुछ करने के लिए महंगे, धीमे और सुपर-स्मार्ट AI का उपयोग करने के बजाय, आपको एक स्मार्ट मैनेजर की तरह काम करने वाला सिस्टम बनाना चाहिए:

  1. आसान, नियमित कामों को (डेटा चेक करना, सरल खोज) छोटे, सस्ते मॉडलों को भेजें। वे तेज़, सस्ते हैं और इस काम के लिए उतने ही अच्छे हैं।
  2. बड़े, महंगे AI को केवल उन दुर्लभ, जटिल कार्यों के लिए सुरक्षित रखें जिनमें गहरी योजना और दीर्घकालिक स्मृति की आवश्यकता होती है।

निचोड़ (The Bottom Line)

आपको किराने के सामान के लिए गाड़ी चलाने के लिए फेरारी की आवश्यकता नहीं है; एक भरोसेमंद साइकिल उस यात्रा के लिए तेज़ और सस्ती है।

यह शोध पत्र सिद्ध करता है कि अधिकांश "नियमित" AI कार्यों (जैसे डेटाबेस चेक करना या सिंगल टूल का उपयोग करना) के लिए, छोटे, ओपन-सोर्स मॉडल पहले से ही पर्याप्त अच्छे हैं। आपको केवल शीर्ष स्तर की जटिल योजना के लिए ही विशाल, महंगे "फ्रंटियर" मॉडलों की आवश्यकता है, और तब भी, वे अभी भी पूर्ण नहीं हैं।

सही काम के लिए सही "वर्कर" का उपयोग करके, कंपनियाँ गुणवत्ता खोए बिना अपने सिस्टम की गति बढ़ा सकती हैं और भारी मात्रा में पैसा बचा सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →