The Bitter Lesson of Tool Calling
यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि प्रोग्रामेटिक टूल कॉलिंग, जो टूल इनवोकेशन के लिए टाइप किए गए पायथन स्टब्स (typed Python stubs) का उपयोग करती है, विविध भाषा मॉडलों और समानांतर निष्पादन (parallel execution) एवं संदर्भ क्षरण (context degradation) जैसी चुनौतीपूर्ण स्थितियों में नेटिव JSON टूल कॉलिंग का एक सुदृढ़ और अक्सर बेहतर विकल्प है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो बाहरी दुनिया से बात कर सकता है। काम पूरा करने के लिए, इस रोबोट को अन्य प्रोग्रामों से मदद मांगनी पड़ती है, जैसे मौसम की जांच करना या गणित की कोई समस्या हल करना। लंबे समय तक, रोबोट के लिए मदद मांगने का एकमात्र तरीका "JSON" नामक एक बहुत ही सख्त और कठोर प्रारूप में बोलना था। इसे ऐसे समझें कि रोबोट केवल छोटे, पहले से छपे हुए पोस्टकार्डों पर अनुरोध भेज सकता है। यदि उसे तीन चीजें करनी हैं, तो उसे तीन अलग-अलग पोस्टकार्ड लिखने होंगे, पहले वाले के जवाब का इंतजार करना होगा, फिर दूसरा लिखना होगा, और इसी तरह। यह व्यवस्थित तो है, लेकिन धीमा और अनाड़ी है।
हालाँकि, चूंकि यह रोबोट भी एक शानदार कोडर है, इसलिए वैज्ञानिकों ने सोचा: क्यों न इसे सीधे एक कंप्यूटर प्रोग्राम लिखने दिया जाए जो काम कर सके? पोस्टकार्डों के बजाय, रोबोट एक छोटा सा स्क्रिप्ट लिख सकता है—निर्देशों का एक समूह जो कंप्यूटर को बताता है कि एक बार में क्या करना है। यह "प्रोग्रामैटिक टूल कॉलिंग" कहलाता है। यह रोबोट को पोस्टकार्डों के बजाय एक पेन और नोटबुक देने जैसा है। बड़ा सवाल यह था: क्या यह नया, लचीला तरीका वास्तव में बेहतर है, या पुराना, कठोर पोस्टकार्ड तरीका अभी भी शिखर का राजा है? यह शोध पत्र इस सवाल की गहराई में जाता है कि क्या रोबोट को कोड लिखने देना इसे एक तेज़, स्मार्ट और अधिक विश्वसनीय सहायक बनाता है।
शोधकर्ताओं ने 14 अलग-अलग AI मॉडल संस्करणों का उपयोग करके एक विशाल परीक्षण आयोजित किया, जो पुराने मॉडलों से लेकर नवीनतम, सबसे शक्तिशाली पीढ़ियों तक फैले हुए थे। उन्होंने उन्हें 309 विभिन्न कार्यों के दौर से गुजारा, सरल एकल-चरण वाले कार्यों से लेकर जटिल परिदृश्यों तक जहाँ रोबोट को एक साथ कई चीजें करनी पड़ती थीं या चरणों को आपस में जोड़ना पड़ता था। उन्होंने पुराने "पोस्टकार्ड" तरीके (JSON टूल कॉलिंग) की तुलना नए "स्क्रिप्ट" तरीके (प्रोग्रामैटिक टूल कॉलिंग) से की।
परिणाम थोड़े आश्चर्यजनक और तकनीक के विकास का एक सबक देने वाले थे। अध्ययन में पाया गया कि अधिकांश नए, स्मार्ट मॉडलों के लिए, स्क्रिप्ट लिखना पोस्टकार्ड भेजने जितना ही अच्छा या उससे भी बेहतर था। वास्तव में, मॉडलों के नवीनतम परिवार (GPT-5.6 श्रृंखला) को भारी बढ़ावा मिला, और कोड लिखने की अनुमति मिलने पर उनकी सटीकता में लगभग 10.6% का सुधार हुआ। यह एक रेस कार ड्राइवर को एक बेहतर ट्रैक देने जैसा था; वे न केवल तेज़ दौड़े, बल्कि वे अधिक समझदारी से दौड़े।
लेकिन यहाँ एक मोड़ है: शोध पत्र सुझाव देता है कि यह नया तरीका हर रोबोट के लिए जादू की छड़ी नहीं है। पुराने मॉडल वास्तव में स्क्रिप्ट दृष्टिकोण के साथ संघर्ष करते थे। तीन पुराने मॉडलों ने कोड लिखने के लिए कहा जाने पर भ्रमित होकर त्रुटिपूर्ण स्क्रिप्ट बनाईं, जो फॉर्मेटिंग को सही ढंग से संभालने में असमर्थ होने के कारण क्रैश हो गईं। ऐसा लगता है कि इस नए, लचीले तरीके का उपयोग करने की क्षमता इस बात पर निर्भर करती है कि मॉडल का "दिमाग" कितना "नया" और सक्षम है। शोध पत्र तर्क देता है कि अंतर इस बात से नहीं है कि रोबोट बनाने वाली कंपनी कौन सी है (जैसे Anthropic बनाम OpenAI), बल्कि इस बात से है कि रोबोट की पीढ़ी कौन सी है। नवीनतम वाले स्क्रिप्ट के लिए तैयार हैं; पुराने वाले अभी भी पोस्टकार्डों पर अटके हुए हैं।
शोधकर्ताओं ने यह भी परीक्षण किया कि ये तरीके दबाव में कैसा प्रदर्शन करते हैं। जब रोबोट को एक साथ कई चीजें करनी पड़ती थीं (जैसे 100 अनुरोधों को एक साथ भेजना), तो पुराना पोस्टकार्ड तरीका टूटने लगा, कॉल छोड़ देता था और कार्यों को मिस कर देता था। हालाँकि, स्क्रिप्ट पद्धति बिना किसी रुकावट के चलती रही, और बिना किसी चूक के कार्यभार को संभाल लिया। इसी तरह, जब रोबोट को छानने के लिए जानकारी का एक बड़ा और भ्रमित करने वाला ढेर दिया गया (एक "कॉन्टेक्स्ट रॉट" परीक्षण), तो स्क्रिप्ट पद्धति स्थिर रही, जबकि पुराने तरीके ने प्रदर्शन में कुछ उतार-चढ़ाव दिखाया।
तो, निष्कर्ष क्या है? शोध पत्र सुझाव देता है कि नवीनतम और सर्वश्रेष्ठ AI मॉडलों के लिए, टूल कॉल करने के लिए कोड लिखना एक व्यवहार्य, मजबूत और अक्सर श्रेष्ठ विकल्प है। यह कार्यों की जटिल श्रृंखलाओं को तेज़ी से संभालता है और काम का बोझ बढ़ने पर भी अभिभूत नहीं होता है। हालाँकि, यह अभी तक एक सार्वभौमिक समाधान नहीं है। यदि आप एक पुराने मॉडल का उपयोग कर रहे हैं, तो आपको अभी भी पुराने पोस्टकार्ड शैली पर टिके रहने की आवश्यकता हो सकती, अन्यथा रोबोट अपने ही पैरों में उलझकर गिर सकता है। यहाँ "कड़वा सबक" यह है कि हालांकि कोड-आधारित एजेंटों का भविष्य उज्ज्वल दिखता है, हमें यह सुनिश्चित करना होगा कि हमारे उपकरण वास्तव में इस अपग्रेड को संभालने के लिए पर्याप्त स्मार्ट हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।