← नवीनतम पेपर
💻 computer science

When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark

यह शोध पत्र एक लागत- और विलंबता-जागरूक (cost- and latency-aware) बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि जहाँ टूल-ऑगमेंटेड प्लानिंग (tool-augmented planning) इवेंट-क्यूए (Event-QA) जैसे जटिल ज्ञान-गहन कार्यों के लिए सटीकता में महत्वपूर्ण सुधार करती है, वहीं यह अक्सर अत्यधिक विलंबता लागत का कारण बनती है और उन कार्यों के लिए कोई लाभ नहीं देती—या प्रदर्शन को कम कर देती है—जहाँ पर्सुएसिव रिस्पॉन्स जनरेशन (persuasive response generation) जैसे कार्यों के लिए सरल वन-शॉट प्रॉम्प्टिंग अधिक कुशल है।

मूल लेखक: Subha Ghoshal, Ali Al-Bustami

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Subha Ghoshal, Ali Al-Bustami

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो बहुत ही अलग प्रकार के रहस्यों को सुलझाने के लिए जासूसों की एक टीम को काम पर रख रहे हैं। एक रहस्य के लिए तथ्यों के एक विशाल, व्यवस्थित पुस्तकालय (जैसे किसी शहर के आधिकारिक रिकॉर्ड) में खुदाई करने की आवश्यकता है, और दूसरे के लिए एक पड़ोसी को स्थानीय मुद्दे पर अपनी राय बदलने के लिए मनाने हेतु एक प्रेरक पत्र लिखने की आवश्यकता है।

यह शोध पत्र मूल रूप से इस बात का रिपोर्ट कार्ड है कि दो अलग-अलग प्रकार के जासूस (लार्ज लैंग्वेज मॉडल्स, या LLMs) कैसा प्रदर्शन करते हैं जब उन्हें सर्च इंजन और डेटाबेस जैसे टूल्स का उपयोग करने की अनुमति दी जाती है बनाम जब उन्हें केवल अपनी याददाश्त पर निर्भर रहना पड़ता है।

यहाँ सरल उपमाओं का उपयोग करके अध्ययन का विवरण दिया गया है:

दो जासूस

शोधकर्ताओं ने एक ही जासूसी एजेंसी के दो संस्करणों का परीक्षण किया:

  1. सीनियर डिटेक्टिव (GPT-4o): अत्यधिक अनुभवी, बहुत बुद्धिमान, लेकिन इन्हें काम पर रखना महंगा है और ये गहराई से सोचने के कारण काम करने में धीमे हैं।
  2. जूनियर डिटेक्टिव (GPT-4o-mini): कम अनुभवी, इन्हें काम पर रखना सस्ता है और ये बहुत तेज़ी से काम करते हैं, लेकिन सूक्ष्म विवरणों को मिस कर सकते हैं।

दो रहस्य (कार्य)

1. "लाइब्रेरी" रहस्य (Event-QA)

  • काम: अतीत में हुई घटनाओं के बारे में विशिष्ट प्रश्नों के उत्तर देना (जैसे, "2019 की बैठक में कौन शामिल हुआ था?")। उत्तर एक जटिल, संरचित डेटाबेस (जैसे तथ्यों का एक विशाल स्प्रेडशीट) में छिपे होते हैं।
  • रणनीति: जासूस या तो तुरंत उत्तर का अनुमान लगा सकते हैं (One-Shot) या एक Plan-Execute-Replan विधि का उपयोग कर सकते हैं। इसका मतलब है कि वे रुकते हैं, चरणों की एक सूची बनाते हैं, लाइब्रेरी में तथ्य खोजने जाते हैं, यह देखते हैं कि क्या उन्हें सही जानकारी मिली है, और यदि नहीं, तो फिर से खोजने के लिए एक नई योजना बनाते हैं।
  • परिणाम:
    • सीनियर डिटेक्टिव लाइब्रेरी टूल्स का उपयोग करते समय इस कार्य में अद्भुत थे। उनकी सटीकता लगभग 47% से बढ़कर 67% हो गई। हालाँकि, इसमें उन्हें बहुत अधिक समय लगा (प्रति प्रश्न लगभग 317 सेकंड) क्योंकि वे सावधानीपूर्वक मानचित्र पढ़ रहे थे और फाइलों का मिलान कर रहे थे।
    • जूनियर डिटेक्टिव जटिल लाइब्रेरी टूल्स के साथ थोड़ा संघर्ष करते हैं लेकिन एक सरल टूल (केवल विकिपीडिया खोजना) के साथ आश्चर्यजनक रूप से अच्छा प्रदर्शन करते हैं। वे तेज़ थे लेकिन सीनियर डिटेक्टिव की तुलना में कम सटीक थे।
    • सबक: कठिन, तथ्य-आधारित पहेलियों के लिए, टूल्स और प्लानिंग का उपयोग करना मदद करता है, लेकिन इसकी एक कीमत (समय के रूप में) चुकानी पड़ती है। जटिल टूल्स को प्रभावी ढंग से संभालने के लिए आपको "सीनियर डिटेक्टिव" की आवश्यकता होती है।

2. "डिबेट" रहस्य (ChangeMyView)

  • काम: किसी फोरम (जैसे रेडिट) पर किसी व्यक्ति की राय पर एक प्रेरक प्रतिक्रिया लिखना। लक्ष्य उनकी राय बदलना है।
  • रणनीति: फिर से, वे या तो तुरंत तर्क लिख सकते हैं (One-Shot) या बैकग्राउंड जानकारी के लिए वेब सर्च करने और अपने तर्क की योजना बनाने के लिए रुक सकते हैं (Planning + Search
  • परिणाम:
    • चौंकाने वाला! "प्लान और सर्च" रणनीति ने वास्तव में प्रदर्शन को नुकसान पहुँचाया।
    • जूनियर डिटेक्टिव जो सरल "One-Shot" विधि का उपयोग कर रहे थे, विजेता रहे। उन्होंने केवल 6 सेकंड में 75% बार इसे सही किया।
    • जब जूनियर डिटेक्टिव ने "Plan and Search" विधि का उपयोग करने की कोशिश की, तो वे भ्रमित हो गए, बहुत अधिक समय लगा (150 सेकंड से अधिक), और वास्तव में वे उत्तर गलत देते रहे।
    • सबक: रचनात्मक या राय-आधारित कार्यों के लिए, बहुत अधिक सोचना और अतिरिक्त तथ्यों की खोज करना एक व्याकुलता बन सकता है। कभी-कभी, अपने अंतर्ज्ञान (या मॉडल के आंतरिक ज्ञान) पर भरोसा करना तेज़ और बेहतर होता है।

मुख्य निष्कर्ष: "टूलबॉक्स" दुविधा

एक शोध पत्र एक व्यावहारिक प्रश्न पूछता है जो व्यवसायों के लिए महत्वपूर्ण है: "एक स्मार्ट दिमाग और एक बड़ा टूलबॉक्स पाने के लिए अतिरिक्त भुगतान करना कब सार्थक है?"

  • "ओवर-इंजीनियरिंग" का जाल: शोधकर्ताओं ने पाया कि कुछ कामों के लिए (जैसे डिबेट), एक जासूस को एक विशाल टूलबॉक्स देना और उन्हें "सब कुछ प्लान करने" के लिए कहना, उन्हें केवल धीमा और भद्दा बना देता है। यह एक धावक को ईंटों से भरा बैकपैक देने जैसा था; वे अब तेज़ी से दौड़ नहीं पा रहे थे।
  • "काम के लिए सही टूल":
    • यदि आपको किसी डेटाबेस से कठिन तथ्य चाहिए, तो सीनियर डिटेक्टिव को लाइब्रेरी टूल्स के साथ उपयोग करें। यह धीमा और महंगा है, लेकिन यह काम पूरा करता है।
    • यदि आपको प्रेरक लेखन या त्वरित उत्तर चाहिए, तो जूनियर डिटेक्टिव को बिना टूल्स के उपयोग करें। यह सस्ता, त्वरित और आश्चर्यजनक रूप से सटीक है।

निचोड़

आपको हमेशा सबसे महंगे AI या सबसे जटिल प्लानिंग सिस्टम की आवश्यकता नहीं होती है।

  • सोचें: यदि कार्य गणित की समस्या हल करने या किसी विशिष्ट तथ्य को खोजने जैसा है, तो धीमे हो जाएं, टूल्स का उपयोग करें और योजना बनाएं।
  • न सोचें: यदि कार्य ईमेल लिखने या किसी तर्क को देने जैसा है, तो सरल रखें, टूल्स को छोड़ दें और बस आगे बढ़ें।

यह पेपर हमें सिखाता है कि "ज़्यादा गहराई से सोचना" (अधिक टूल्स और प्लानिंग का उपयोग करना) हमेशा बेहतर नहीं होता; कभी-कभी, यह केवल समय और पैसे की बर्बादी है। कुंजी जासूस के कौशल स्तर और उनके टूलबॉक्स के आकार को उस विशिष्ट रहस्य के साथ मिलाना है जिसे वे सुलझाने की कोशिश कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →