TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
यह शोध पत्र TACO को प्रस्तुत करता है, जो एक GRPO-आधारित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक स्व-पर्यवेक्षित, जज-मुक्त क्रेडिट असाइनमेंट तंत्र का उपयोग करके एजेंटिक मल्टीमॉडल मॉडलों को बढ़ाता है, ताकि उपयोगी टूल कॉल्स को सटीक रूप से अलग किया जा सके और उन्हें पुरस्कृत किया जा सके जबकि अनावश्यक या भ्रामक कॉल्स को दबाया जा सके, जिससे फाइन-ग्रेन्ड विजुअल क्वेश्चन आंसरिंग प्रदर्शन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन कभी-कभी बहुत अधिक उत्साही सहायक है जो एक तस्वीर का उपयोग करके एक पहेली को हल करने की कोशिश कर रहा है। यह सहायक पूरी तस्वीर को देख सकता है, लेकिन इसके पास एक विशेष उपकरण भी है: एक "डिजिटल आवर्धक लेंस" (कोड) जो इसे सूक्ष्म विवरणों पर ज़ूम करने, विशिष्ट हिस्सों को क्रॉप करने, या इसे पढ़ने में आसान बनाने के लिए छवि को घुमाने (रोटेट करने) की अनुमति देता है।
समस्या यह है कि इस सहायक को हमेशा यह नहीं पता होता कि आवर्धक लेंस का उपयोग कब करना है। कभी-कभी यह तब ज़ूम करता है जब इसकी आवश्यकता नहीं होती (समय बर्बाद करता है), कभी-कभी यह गलत जगह पर ज़ूम करता है (चीजों को और खराब कर देता है), और कभी-कभी यह ठीक वहीं ज़ूम करता है जहाँ इसकी आवश्यकता होती है (पहेली सुलझा देता है)।
यह शोध पत्र एक नया प्रशिक्षण तरीका पेश करता है जिसे TACO (टूल-ऑगमेंटेड क्रेडिट ऑप्टिमाइज़ेशन) कहा जाता है, जो इस सहायक को यह सिखाने के लिए है कि उसे अपने उपकरणों का उपयोग कब करना चाहिए और कब केवल अपनी आँखों से देखना चाहिए।
TACO कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:
समस्या: "ग्रुप रिवॉर्ड" का जाल
मानक प्रशिक्षण में, यदि सहायक अंतिम उत्तर सही पाता है, तो सभी को एक गोल्ड स्टार मिलता है। यदि वह गलत होता है, तो सभी को थम्स डाउन मिलता है।
- दोष: कल्पना कीजिए कि सहायक ने अपने दिमाग में सही उत्तर निकाल लिया था, लेकिन फिर उसने छवि के किसी यादृच्छिक हिस्से पर ज़ूम करने का निर्णय लिया, भ्रमित हो गया, और गलत उत्तर दे दिया। मानक प्रशिक्षण में, सहायक को पूरी प्रक्रिया के लिए दंडित किया जाता है, भले ही उसका प्रारंभिक तर्क एकदम सही था। इसके विपरीत, यदि उसने भाग्य से सही उत्तर का अनुमान लगाया लेकिन फिर अनावश्यक रूप से ज़ूम करने में समय बर्बाद किया, तो भी उसे गोल्ड स्टार मिलता है। यह सहायक को आलसी या अराजक बनाता है।
समाधान: TACO की दो-भाग वाली प्रणाली
TACO इसे दो विशिष्ट चैनलों में फीडबैक को विभाजित करके ठीक करता है, जैसे कि एक कोच दो अलग-अलग प्रकार की सलाह दे रहा हो।
1. "क्या होगा अगर" परीक्षण (DAPR)
उपमा: एक जासूस की कल्पना करें जो आवर्धक लेंस का उपयोग करने से ठीक पहले रुकता है और पूछता है, "यदि मैं इस उपकरण का उपयोग नहीं करता, तो मैं क्या अनुमान लगाता?"
- यह कैसे काम करता है: AI को अपना कोड चलाने से पहले रुकने के लिए मजबूर किया जाता है। वह जो अभी देख रहा है उसके आधार पर वह एक त्वरित अनुमान लगाता है। फिर, वह कोड चलाता है (ज़ूम/क्रॉप), नए दृश्य को देखता है, और दूसरा अनुमान लगाता है।
- स्कोर:
- यदि पहला अनुमान गलत था और दूसरा अनुमान (ज़ूम करने के बाद) सही है, तो उपकरण को सकारात्मक स्कोर मिलता है (बहुत बढ़िया!)।
- यदि पहला अनुमान सही था और दूसरा अनुमान (ज़ूम करने के बाद) गलत हो जाता है, तो उपकरण को नकारात्मक स्कोर मिलता है (बुरा कदम, आपने खुद को भ्रमित कर दिया!)।
- यदि उत्तर नहीं बदला, तो स्कोर शून्य है (तटस्थ)।
- यह क्यों स्मार्ट है: यह "स्व-पर्यवेक्षित" (self-supervised) है। AI बिना किसी मानव शिक्षक या बाहरी AI की मदद के खुद का मूल्यांकन करता है। यह "धोखाधड़ी" को भी रोकता है क्योंकि AI अपने विचारों के बीच में उत्तर नहीं लिख सकता; "पहले" और "बाद" के अनुमान के बीच का अंतर किसी भी धोखाधड़ी को रद्द कर देता है।
2. "कौन जिम्मेदार है?" गेट (OGAR)
उपमा: एक शिक्षक की कल्पना करें जो ग्रुप प्रोजेक्ट को ग्रेड दे रहा है। यदि समूह विफल होता है, तो शिक्षक को यह जानने की आवश्यकता है कि किसने गलती की ताकि वे उस छात्र को दंडित न करें जिसने सही काम किया था।
- यह कैसे काम करता है: TACO ऊपर दिए गए "क्या होगा अगर" परीक्षण के परिणाम को देखता है।
- यदि उपकरण उपयोगी था: AI को पूरे विचार की श्रृंखला (उपकरण का उपयोग करने से पहले का तर्क + स्वयं उपकरण) के लिए श्रेय मिलता है।
- यदि उपकरण हानिकारक था: AI को केवल उस हिस्से के लिए दंडित किया जाता है जहाँ उसने उपकरण का उपयोग किया। उपकरण का उपयोग करने से पहले जो स्मार्ट तर्क उसने दिया था, उसे सुरक्षित रखा जाता है और दंडित नहीं किया जाता।
- यदि उपकरण अनावश्यक था: यदि AI पहले से ही उत्तर जानता था लेकिन फिर भी उपकरण का उपयोग किया, तो उपकरण वाले हिस्से को कोई श्रेय नहीं मिलता। यह AI को आसान सवालों पर समय बर्बाद करना बंद करने के लिए सिखाता है।
परिणाम: एक स्मार्ट, तेज़ सहायक
इस प्रणाली का उपयोग करके, AI एक बहुत ही विशिष्ट व्यवहार सीखता है:
- यह उपकरणों का अत्यधिक उपयोग करना बंद कर देता है। यह सीख जाता है कि यदि इसे पहले से ही उत्तर पता है, तो ज़ूम करना समय की बर्बादी है और इससे कोई इनाम नहीं मिलता।
- यह ऐसे उपकरणों का उपयोग करना बंद कर देता है जो नुकसान पहुँचाते हैं। यह सीख जाता है कि यदि ज़ूम करने से वह भ्रमित हो जाता है, तो उसे नकारात्मक स्कोर मिलेगा, इसलिए वह ऐसा करना बंद कर देता है।
- यह कुशल बनता है। क्योंकि यह उपकरण का उपयोग तभी करता है जब वास्तव में मदद मिलती है, यह समस्याओं को तेज़ी से (कम लेटेंसी के साथ) और अधिक सटीकता से हल करता है।
पेपर से वास्तविक दुनिया के उदाहरण
पेपर ने इन कार्यों पर इसका परीक्षण किया:
- बारीक टेक्स्ट पढ़ना: बैंक का नाम पढ़ने के लिए धुंधले साइन पर ज़ूम करना (उपयोगी!)।
- ओरिएंटेशन ठीक करना: बस के रूट नंबर को पढ़ने के लिए एक टेढ़ी फोटो को घुमाना (उपयोगी!)।
- गणित: भिन्न (fraction) की गणना करने के लिए कोड का उपयोग करना (उपयोगी!)।
- गलतियाँ: एक मामले में, AI ने एक चार्ट पर ज़ूम करने की कोशिश की, लेकिन ज़ूम करने से रेखाएं इतनी घनी हो गईं कि उन्हें पढ़ना मुश्किल हो गया, जिससे उसका सही अनुमान गलत में बदल गया। TACO ने AI को यह पहचानने में सक्षम बनाया कि ऐसा क्यों हुआ और इसे रोकने के लिए सिखाया।
सारांश
TACO एक कोच की तरह है जो AI को न केवल यह सिखाता है कि आवर्धक लेंस का उपयोग कैसे करना है, बल्कि यह भी कि इसका उपयोग कब करना है। यह AI को केवल तभी पुरस्कृत करता है जब उपकरण वास्तव में एक गलत उत्तर को सही में बदल देता है, और यह AI के अच्छे तर्क को दंडित होने से बचाता है यदि एक बुरा टूल चुनाव अंतिम परिणाम को बिगाड़ देता है। परिणाम स्वरूप, एक AI जो अधिक स्मार्ट और तेज़ है क्योंकि वह जानता है कि कब कार्य करना है और कब केवल देखना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।