SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models
SCRIBE एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कौशल-सशर्त पुरस्कार मॉडलों (skill-conditioned reward models) के माध्यम से संरचित, मध्य-स्तरीय पर्यवेक्षण पेश करके टूल-उपयोग करने वाले भाषा मॉडलों को उन्नत करता है, जो रिवॉर्ड वेरिएन्स (reward variance) को कम करके और कौशल महारत से उच्च-स्तरीय योजना तक एक स्पष्ट प्रगति स्थापित करके तर्क की सटीकता और मल्टी-टर्न टूल इंटरेक्शन की सफलता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल पहेली हल करना सिखा रहे हैं, जैसे कि कोई गणित की समस्या जिसके लिए कैलकुलेटर का उपयोग करना आवश्यक हो, या कोई ऐसा कार्य जिसके लिए वेब पर खोजना और फिर एक रिपोर्ट लिखना आवश्यक हो। रोबोट को उत्तर प्राप्त करने के लिए कई चरणों से गुजरना पड़ता है।
मुख्य समस्या इन रोबोट्स को प्रशिक्षित करने में दोषारोपण (blame) की है। यदि रोबोट बिल्कुल अंत में विफल हो जाता है, तो आप कैसे जानेंगे कि क्यों?
- क्या इसकी योजना खराब थी?
- क्या इसने टूल कमांड में कोई मूर्खतापूर्ण टाइपिंग की गलती (typo) की?
- क्या इसने परिणाम को गलत समझा?
आमतौर पर, हम केवल अंत में रोबोट को "थम्स अप" या "थम्स डाउन" देते हैं। लेकिन यह एक छात्र को अंतिम परीक्षा में फेल होने के बाद यह बताने जैसा है कि, "तुम फेल हो गए," बिना यह बताए कि उसने कौन सा अध्याय गलत पढ़ा था। उन्हें पता नहीं चलेगा कि क्या सुधारना है।
यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे SCRIBE कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "अस्पष्ट शिक्षक" (The Vague Teacher)
वर्तमान में, जब हम इन AI एजेंटों को प्रशिक्षित करते हैं, तो हम एक "जज" (एक अन्य AI) का उपयोग उनके काम को चरण-दर-चरण ग्रेड करने के लिए करते हैं। लेकिन यह जज अक्सर असंगत होता है।
- उपमा: एक गणित के टेस्ट को ग्रेड करने वाले शिक्षक की कल्पना करें जो कहता है, "अच्छा काम किया, तुमने सही उत्तर प्राप्त किया!" भले ही छात्र ने वहां तक पहुँचने के लिए किसी जादू के ट्रिक का उपयोग किया हो और पूरी तर्क प्रक्रिया को छोड़ दिया हो। या, शिक्षक "बुरा काम किया!" कह सकता है क्योंकि छात्र ने वर्तनी (spelling) की एक छोटी सी गलती की थी, भले ही गणित एकदम सही था।
- परिणाम: रोबोट भ्रमित हो जाता है। उसे समझ नहीं आता कि उसे बेहतर योजना बनाने पर ध्यान केंद्रित करना चाहिए या बस तेजी से टाइप करने पर।
2. समाधान: "कौशल पुस्तकालय" (The Skill Library - SCRIBE)
SCRIBE एक मिड-लेवल सुपरवाइजर (मध्यम-स्तरीय पर्यवेक्षक) पेश करके खेल बदल देता है। जज को यह अनुमान लगाने देने के बजाय कि क्या अच्छा है और क्या बुरा, SCRIBE जज को रोबोट द्वारा किए जाने वाले प्रत्येक प्रकार के चरण के लिए एक विशिष्ट नियम पुस्तिका (Rulebook) देता है।
- उपमा: रोबोट की यात्रा को "मिनी-चैलेंजेस" की एक श्रृंखला के रूप में सोचें।
- चैलेंज A: "सही टूल खोजें।"
- चैलेंज B: "डेटा को सही ढंग से पढ़ें।"
- चैलेंज C: "परिणामों को जोड़ें।"
- नवाचार: रोबोट शुरू करने से पहले, सिस्टम के पास स्किल प्रोटोटाइप्स (कौशल प्रोटोटाइप) का एक पुस्तकालय होता है। ये प्रत्येक विशिष्ट चुनौती के लिए "चीट शीट" या "रूब्रिक्स" की तरह हैं।
- यदि रोबोट "चैलेंज A" कर रहा है, तो जज केवल अनुमान नहीं लगाता; वह "टूल सिलेक्शन रूलबुक" निकालता है। यह नियम पुस्तिका बताती है कि एक अच्छा टूल चयन कैसा दिखता है (जैसे, "क्या इसने पैरामीटर्स की जांच की?")।
- यदि रोबोट "चैलेंज B" कर रहा है, तो जज "डेटा रीडिंग रूलबुक" का उपयोग करता है।
जज को इन विशिष्ट नियम पुस्तिकाओं का उपयोग करने के लिए मजबूर करके, ग्रेडिंग निष्पक्ष और सुसंगत हो जाती है। यह "जादू के ट्रिक" वाली समस्या और "वर्तनी की गलती" वाली समस्या को रोक देता है।
3. राउटर: "ट्रैफिक पुलिस" (The Router: The Traffic Cop)
इसे काम करने के लिए, सिस्टम को यह जानने की आवश्यकता है कि किसी भी क्षण में किस नियम पुस्तिका का उपयोग किया जाए।
- उपमा: एक व्यस्त चौराहे पर ट्रैफिक पुलिस की कल्पना करें। जैसे-जैसे रोबोट अपने चरणों के माध्यम से आगे बढ़ता है, "राउटर" (ट्रैफिक पुलिस) देखता है कि रोबोट क्या कर रहा है और उसे सही लेन (सही स्किल प्रोटोटाइप) की ओर इशारा करता है।
- यह सुनिश्चित करता है कि रोबोट को हमेशा उस विशिष्ट क्षण के लिए सही मानकों द्वारा परखा जा रहा है।
4. आश्चर्यजनक खोज: "दौड़ने से पहले चलना सीखना" (Learning to Walk Before Running)
इस पेपर की सबसे दिलचस्प खोज यह है कि रोबोट कैसे सीखता है।
- उपमा: आप एक बच्चे को केवल फिनिश लाइन पर "तेज दौड़ो!" चिल्लाकर मैराथन दौड़ना नहीं सिखा सकते। आपको उसे पहले संतुलन बनाना, फिर चलना, और फिर जॉगिंग करना सिखाना होगा।
- निष्कर्ष: शोधकर्ताओं ने पाया कि मिड-लेवल स्किल्स (जैसे "चलना" और "संतुलन बनाना") को पूर्ण करने पर ध्यान केंद्रित करने से, रोबोट स्वयं हाई-लेवल प्लानिंग (मैराथन रणनीति) में बेहतर हो गया।
- रोबोट को भव्य रणनीतियाँ बनाने के लिए स्पष्ट रूप से सिखाने की आवश्यकता नहीं थी। एक बार जब उसने छोटे, विशिष्ट कौशल (जैसे टूल का सही उपयोग करना) में महारत हासिल कर ली, तो जटिल, बहु-चरणीय समाधानों की योजना बनाने की क्षमता स्वाभाविक रूप से उभर आई। "चलना" इतना विश्वसनीय हो गया कि "दौड़ना" अपने आप होने लगा।
5. परिणाम: एक बेहतर रोबोट
जब उन्होंने इस पद्धति का परीक्षण किया:
- गणित: एक छोटे मॉडल के गणित स्कोर में काफी सुधार हुआ (एक कठिन टेस्ट पर 43% से 63% तक)।
- टूल्स: रोबोट जटिल, बहु-चरणीय बातचीत में टूल्स का उपयोग करने में बहुत बेहतर हो गया, जिससे कुछ क्षेत्रों में उसकी सफलता दर दोगुनी हो गई।
- टीम वर्क: उन्होंने पाया कि SCRIBE उन अन्य तरीकों के साथ काम करता है जो लो-लेवल त्रुटियों (जैसे टाइपिंग की गलती) को ठीक करते हैं। यह इंजन को ठीक करने वाले मैकेनिक (लो-लेवल) और ड्राइवर को बेहतर रणनीति सिखाने वाले कोच (मिड-लेवल) के साथ मिलकर काम करने जैसा है। साथ मिलकर, वे एक चैंपियन कार बनाते हैं।
सारांश
SCRIBE एक प्रशिक्षण ढांचा है जो अनुमान लगाना बंद करता है और नियम पुस्तिका के साथ ग्रेडिंग करना शुरू करता है। बड़ी समस्याओं को छोटे, अच्छी तरह से परिभाषित "कौशलों" में तोड़कर और प्रत्येक कौशल को एक विशिष्ट चेकलिस्ट के साथ परखकर, AI अधिक विश्वसनीय बनना सीखता है। सबसे अच्छी बात? छोटे चरणों को ठीक करके, AI स्वाभाविक रूप से बिना किसी अतिरिक्त निर्देश के बड़ा सोचना और बेहतर योजना बनाना सीख जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।