ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
यह शोध पत्र ToolWeave को प्रस्तुत करता है, जो एक संरचित ढांचा है जो टूल निर्भरताओं (tool dependencies) और सूक्ष्म पैरामीटर प्रोवेनेंस ट्रैकिंग (fine-grained parameter provenance tracking) को लागू करके यथार्थवादी मल्टी-टर्न टूल-कॉलिंग संवादों को संश्लेषित करता है, जिसके परिणामस्वरूप मौजूदा डेटासेट्स की तुलना में फाइन-ट्यून किए गए LLMs के लिए काफी बेहतर मल्टी-स्टेप इंटरेक्शन गुणवत्ता और उत्कृष्ट बेंचमार्क प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक सहायक (personal assistant) बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। इसे करने के लिए, आपको उसे हजारों उदाहरण दिखाने होंगे जहाँ रोबोट समस्याओं को हल करने के लिए उपकरणों (जैसे उड़ान बुक करना, बैंक बैलेंस चेक करना, या कंप्यूटर ठीक करना) का सफलतापूर्वक उपयोग करता है।
समस्या यह है कि इन रोबोटों को सिखाने के लिए हम वर्तमान में जो "पाठ्यपुस्तकें" (डेटासेट) उपयोग करते हैं, वे काल्पनिक और अवास्तविक कहानियों से भरी होती हैं। यह एक पायलट को विमान उड़ाना सिखाने जैसा है जहाँ विमान अचानक बिना रनवे के आसमान में प्रकट हो जाता है, या जहाँ पायलट को ईंधन का स्तर जांचे बिना ही जादू से पता चल जाता है।
समस्या: "नकली पाठ्यपुस्तकें"
IBM रिसर्च और IIIT हैदराबाद के लेखकों ने पाया कि इन प्रशिक्षण कहानियों को बनाने के मौजूदा तरीकों में दो मुख्य समस्याएं हैं:
"गोंद से चिपका देने" वाली समस्या (The "Glued-Together" Problem): वर्तमान तरीके उन उपकरणों को चुनते हैं जो केवल इसलिए एक साथ फिट होते दिखते हैं क्योंकि उनका नाम एक जैसा है। उदाहरण के लिए, यदि एक उपकरण "टिकट आईडी" देता है और दूसरे उपकरण को "टिकट आईडी" की आवश्यकता होती है, तो पुराने तरीके उन्हें आपस में जोड़ देते हैं। लेकिन वास्तव में, एक उपकरण मूवी टिकट के लिए हो सकता है और दूसरा अस्पताल के अपॉइंटमेंट के लिए। उनके नाम समान हैं लेकिन उनका आपस में कोई संबंध नहीं है। यह ऐसी बातचीत बनाता है जिसका कोई तार्किक अर्थ नहीं निकलता।
"जादुई छड़ी" वाली समस्या (The "Magic Wand" Problem): ये कहानियाँ बनाते समय, पुराने तरीके अक्सर AI को जानकारी "भ्रमित" (hallucinate) करने या मनगढ़ंत बातें बनाने की अनुमति देते हैं। रोबोट अचानक उपयोगकर्ता का क्रेडिट कार्ड नंबर या कोई विशिष्ट तारीख जान सकता है, जबकि उपयोगकर्ता ने उसे कभी बताया ही नहीं। यह एक जादूगर द्वारा उस खरगोश को टोपी से बाहर निकालने जैसा है जो वहां था ही नहीं।
समाधान: ToolWeave
लेखक एक नया फ्रेमवर्क पेश करते हैं जिसे ToolWeave कहा जाता है। ToolWeave को केवल रैंडम कहानियाँ बनाने वाली मशीन के रूप में नहीं, बल्कि एक मास्टर आर्किटेक्ट और एक सख्त संपादक के रूप में देखें जो मिलकर एक वास्तविक प्रशिक्षण पाठ्यक्रम तैयार कर रहा है।
यहाँ बताया गया है कि ToolWeave कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:
1. "लेगो सेट" बनाना (The Tool Graph)
रैंडम टूल्स को शेल्फ से उठाने के बजाय, ToolWeave पहले एक कस्टम "लेगो सेट" बनाता है।
- पुराना तरीका: आप एक लाल ब्लॉक और एक नीला ब्लॉक इसलिए उठाते हैं क्योंकि दोनों ही ब्लॉक हैं।
- ToolWeave का तरीका: यह ब्लॉक्स को इस तरह डिजाइन करता है कि वे अनिवार्य रूप से एक-दूसरे में फिट हों। यह "मेंटेनेंस शेड्यूल" टूल बनाता है जिसे एक "टेक्नीशियन आईडी" की आवश्यकता होती है जो केवल एक "हायरिंग" टूल से आती है। यह कनेक्शन (निर्भरता) को स्वयं टूल्स के भीतर ही बुन देता है, जिससे यह सुनिश्चित होता है कि यदि आप टूल A का उपयोग करते हैं, तो आपको टूल C का उपयोग करने के लिए टूल B के आउटपुट की तार्किक रूप से आवश्यकता होगी।
2. "पटकथा लेखक" (Structured Planning)
एक बार टूल्स बन जाने के बाद, ToolWeave केवल AI को "कहानी लिखने" के लिए नहीं कहता। यह AI को पहले एक विस्तृत पटकथा (script) लिखने के लिए मजबूर करता है।
- योजना: एक भी संवाद लिखने से पहले, सिस्टम एक चरण-दर-चरण योजना बनाता है। यह पूछता है: "यह नंबर कहाँ से आया? क्या उपयोगकर्ता ने इसे बताया? या पिछले टूल ने हमें यह दिया?"
- परिणाम: यह "जादुई छड़ी" की समस्या को रोकता है। रोबोट क्रेडिट कार्ड नंबर नहीं बना सकता क्योंकि स्क्रिप्ट स्पष्ट रूप से कहती है, "रुको, हमारे पास अभी यह नंबर नहीं है। हमें उपयोगकर्ता से पूछने की आवश्यकता है।"
3. "अभिनेता" (Dialogue Synthesis)
अंत में, सिस्टम पटकथा निभाने के लिए AI "अभिनेताओं" की एक टीम का उपयोग करता है।
- एक अभिनेता उपयोगकर्ता बनता है, एक सहायक बनता है, और अन्य उपकरण (tools) बनते हैं।
- वे स्क्रिप्ट का सख्ती से पालन करते हैं। यदि स्क्रिप्ट कहती है कि उपयोगकर्ता को किसी विवरण को स्पष्ट करने की आवश्यकता है, तो अभिनेता वह दृश्य निभाता है। यदि स्क्रिप्ट कहती है कि एक टूल विफल हो जाता है (जैसे सर्वर एरर), तो अभिनेता उस गलती से उबरने का अभ्यास करते हैं।
- इससे ऐसी बातचीत बनती है जो मानवीय, तार्किक और वास्तविक उतार-चढ़ाव से भरी होती है।
परिणाम: एक बेहतर पायलट
लेखकों ने इस नए "पाठ्यपुस्तक" (ToolWeave डेटा) का पुराने डेटा के मुकाबले परीक्षण किया। उन्होंने अलग-अलग रोबोट मॉडल (जैसे Llama-3) को इस नए डेटा पर प्रशिक्षित किया और फिर उन्हें टेस्ट किया।
- अधिक वास्तविकता: नए डेटा में 45% मल्टी-स्टेप इंटरैक्शन (जहाँ एक टूल दूसरे की ओर ले जाता है) शामिल थे, जबकि पुराने डेटा में यह 7% से भी कम था।
- कम झूठ: तथ्यों को मनगढ़ंत बनाने (hallucinations) की दर 50% से अधिक से गिरकर लगभग 20% रह गई।
- बेहतर प्रदर्शन: मानक परीक्षाओं (BFCL-V3 जैसे बेंचमार्क) पर परीक्षण किए जाने पर, ToolWeave डेटा पर प्रशिक्षित रोबोटों ने काफी अधिक स्कोर किया। उदाहरण के लिए, एक बड़े मॉडल (Llama-3.1-70B) ने पुराने डेटा के साथ 23.50% के स्कोर से ToolWeave डेटा के साथ 39.75% तक की छलांग लगाई।
सारांश में
ToolWeave AI सहायकों के लिए प्रशिक्षण डेटा बनाने का एक नया तरीका है। AI को टूल्स के जुड़ाव का अनुमान लगाने और तथ्य गढ़ने देने के बजाय, यह पहले एक संरचित और तार्किक आधार बनाता है। यह एक छात्र को गलतियों और जादू के करतबों से भरी किताब पढ़ाने और उसे एक स्पष्ट, चरण-दर-चरण मैनुअल देने के बीच का अंतर है जो दिखाता है कि वास्तविक दुनिया वास्तव में कैसे काम करती है। इसका परिणाम एक ऐसा AI है जो जटिल, बहु-चरणीय समस्याओं को हल करने में बहुत बेहतर है और बिना भटके या बिना मनगढ़ंत बातें किए काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।