NTILC: Neural Tool Invocation via Learned Compression
NTILC एक न्यूरल फ्रेमवर्क है जो लीनियर इन-कॉन्टेक्स्ट टूल रजिस्ट्री लुकअप को सीखे गए लेटेंट रिट्रीवल और एक सिग्नेचर-अवेयर कंपोजिट ऑब्जेक्टिव से बदल देता है, जिससे एजेंटिक टूल-कॉलिंग मॉडल्स के लिए उच्च चयन सटीकता बनाए रखते हुए 95% से अधिक कॉन्टेक्स्ट टोकन रिडक्शन और 74% तक कम लेटेंसी प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यधिक कुशल व्यक्तिगत सहायक (AI) हैं जिसे आपके लिए काम निपटाने की आवश्यकता है। ऐसा करने के लिए, आपके पास एक विशाल फोन बुक (Tool Registry) है जिसमें हजारों अलग-अलग सेवाएँ शामिल हैं: मौसम की रिपोर्ट, कैलकुलेटर, फ़ाइल एडिटर, वेब सर्च करने वाले, और बहुत कुछ।
पुराना तरीका: "सब कुछ पढ़ने वाला" दृष्टिकोण (The "Read-Everything" Approach)
वर्तमान में, जब आप अपने सहायक से कोई प्रश्न पूछते हैं जैसे, "ऐन आर्बर में मौसम कैसा है?", तो सहायक को आपका उत्तर देने से पहले पूरी फोन बुक को ज़ोर से पढ़ना पड़ता है।
- समस्या: यदि आपकी फोन बुक में 5,000 प्रविष्टियाँ हैं, तो यह बहुत अधिक पढ़ना है! इसमें बहुत समय (लेटेंसी) लगता है, बहुत पैसा (टोकन उपयोग) खर्च होता है, और सहायक अप्रासंगिक जानकारी (जैसे "फ़ाइल एडिटिंग" के बारे में पढ़ना जब आपको केवल मौसम जानना हो) से भ्रमित हो जाता है।
- परिणाम: जैसे-जैसे फोन बुक बढ़ती है, सहायक धीमा होता जाता है और शोर (noise) से अभिभूत होने के कारण गलतियाँ करने लगता है।
नया तरीका: NTILC (स्मार्ट इंडेक्स दृष्टिकोण)
यह शोध पत्र NTILC पेश करता है, जो एक नया सिस्टम है जो यह बदल देता है कि आपका सहायक सही टूल कैसे ढूँढता है। पूरी फोन बुक पढ़ने के बजाय, NTILC एक स्मार्ट, पूर्व-निर्मित इंडेक्स (एक डिजिटल लाइब्रेरी कैटलॉग की तरह) का उपयोग करता है।
यह इस प्रकार काम करता है, चरण-दर-चरण:
- अनुरोध (The Request): आप पूछते हैं, "मौसम क्या है?"
- अनुवाद (The Translation): पूरी किताब पढ़ने के बजाय, सिस्टम तुरंत आपके प्रश्न को एक "गुप्त कोड" (एम्बेडिंग) में अनुवादित करता है जो आपके अनुरोध के "इरादे" (intent) को दर्शाता है।
- मिलान (The Match): यह अपने गुप्त कोड की तुलना रजिस्ट्री में मौजूद प्रत्येक टूल के पूर्व-निर्धारित गुप्त कोडों से करता है। यह पलक झपकते ही सबसे करीबी मिलान (मौसम वाला टूल) ढूँढ लेता है।
- कार्रवाई (The Action): सहायक को उत्तर देने के लिए आवश्यक विवरण प्राप्त करने हेतु वह केवल मौसम टूल के विशिष्ट पृष्ठ को देखता है।
जादुई ट्रिक: सहायक को कभी भी 5,000 पन्नों वाली फोन बुक को पढ़ने की आवश्यकता नहीं होती है। वह केवल उस एक पन्ने को देखता है जिसकी उसे आवश्यकता है। यह "पढ़ने के समय" (कॉन्टेक्स्ट उपयोग) को 95% से अधिक कम कर देता है और इस प्रक्रिया को बहुत तेज़ बना देता है।
पेचीदा हिस्सा: "सिमेंटिक ब्लर" (Semantic Blur)
यह एक विशिष्ट समस्या है जिसे यह शोध पत्र हल करता है। कल्पना कीजिए कि आपकी फोन बुक में दो टूल हैं:
- टूल A: "Get Weather" (जिसके लिए ज़िप कोड की आवश्यकता है)।
- टूल B: "Get Weather" (जिसके लिए अक्षांश और देशांतर/latitude and longitude की आवश्यकता है)।
वे बिल्कुल एक जैसे सुनाई देते हैं! यदि सहायक केवल नामों को देखता है, तो वह गलत टूल चुन सकता है। यदि आप ज़िप कोड देते हैं, लेकिन वह उस टूल को चुन लेता है जिसे अक्षांश और देशांतर की आवश्यकता है, तो वह टूल विफल हो जाएगा। शोध पत्र इसे "सिमेंटिक ब्लर" कहता है—जब टूल्स एक जैसे दिखते हैं लेकिन अलग तरह से काम करते हैं।
समाधान: "फंक्शनल मार्जिन" (The Functional Margin)
NTILC एक विशेष प्रशिक्षण पद्धति का उपयोग करता है जिसे फंक्शनल मार्जिन लॉस (Functional Margin Loss) कहा जाता है। इसे एक सख्त शिक्षक के रूप में समझें जो सहायक को केवल टूल के नाम को पहचानना ही नहीं, बल्कि टूल के आकार (shape) को महसूस करना भी सिखाता है।
- भले ही दो टूल्स के नाम एक जैसे हों, यदि उनके "आकार" (उनके द्वारा आवश्यक तर्क/arguments) अलग हैं, तो सिस्टम उन्हें अपनी मेमोरी में एक-दूसरे से दूर धकेल देता है।
- यह सुनिश्चित करता है कि जब आप "ज़िप कोड के साथ मौसम" के बारे में पूछते हैं, तो सिस्टम बिल्कुल जानता है कि उन दो "Weather" टूल्स में से कौन सा चुनना है, जिससे गलत चुनाव से बचा जा सके।
परिणाम
इस शोध पत्र ने कई सार्वजनिक डेटासेट्स (जैसे ToolBench और API-Bank) पर इसका परीक्षण किया और पाया:
- गति: यह पुराने तरीके की तुलना में 74% तक तेज़ है।
- दक्षता: यह AI द्वारा किए जाने वाले "पढ़ने" के कार्य को 95% से अधिक कम कर देता है।
- सटीकता: यह पुराने तरीके के समान ही सटीक है, भले ही फोन बुक बहुत बड़ी (हजारों टूल्स) हो जाए।
सारांश
NTILC एक ऐसे लाइब्रेरियन से अपग्रेड करने जैसा है जो आपके उत्तर को खोजने के लिए लाइब्रेरी की हर किताब को पढ़ता है, बजाय एक ऐसे लाइब्रेरियन के जिसके पास एक सटीक, त्वरित इंडेक्स है। वे बिना अन्य किताबें खोले जानते हैं कि आपको किस किताब की आवश्यकता है, जिससे समय बचता है और भ्रम कम होता है, भले ही लाइब्रेरी में लाखों किताबें बढ़ जाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।