Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning
यह शोध पत्र सैद्धांतिक और संरचनात्मक रूप से यह प्रदर्शित करता है कि चेन-ऑफ-थॉट (Chain-of-Thought) प्रशिक्षण, सामान्यीकरण सीमाओं (generalization bounds) को इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डिस्ट्रीब्यूशन घटकों में विभाजित करके और तर्क को एक दो-चरणीय सर्किट में आंतरिक रूप से समाहित करके, बड़े भाषा मॉडलों के कंपोजिशनल जनरलाइजेशन को बढ़ाता है, जो मॉडलों को केवल उत्तरों को रटने के बजाय सीखे गए कौशल को संयोजित करके सोचना सिखाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: बच्चे को खाना बनाना सिखाना बनाम उसे रेसिपी देना
कल्पना कीजिए कि आप एक रोबोट (या एक लार्ज लैंग्वेज मॉडल) को जटिल समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं।
पुराना तरीका (बिना चेन-ऑफ-थॉट के):
आप रोबोट को लासग्ना (lasagna) की एक तस्वीर दिखाते हैं और कहते हैं, "यह लासग्ना जैसा दिखता है। अब, मेरे लिए एक बनाओ।"
रोबोट उस तस्वीर को देखता है, पैटर्न को याद करता है, और उसकी नकल करने की कोशिश करता है। यदि आप उससे थोड़े अलग सामग्री वाले लासग्ना के लिए पूछते हैं (जैसे नूडल्स की जगह ज़ुकिनी का उपयोग करना), तो रोबोट भ्रमित हो जाता है। उसे यह नहीं पता कि कैसे खाना बनाना है; वह केवल यह जानता है कि अंतिम व्यंजन कैसा दिखता है। यदि स्थिति थोड़ी भी बदलती है, तो वह विफल हो जाता है। यह उत्तर रटने जैसा है।
नया तरीका (चेन-ऑफ-थॉट या CoT):
सिर्फ लासग्ना दिखाने के बजाय, आप रोबोट को प्रक्रिया दिखाते हैं। आप कहते हैं, "पहले, नूडल्स उबालें। फिर, टमाटर काटें। फिर, उन्हें परतों में सजाएं।"
आप रोबोट को कौशल (उबालना, काटना, परत बनाना) और उन्हें जोड़ना सिखा रहे हैं।
अब, यदि आप ज़ुकिनी वाला लासग्ना मांगते हैं, तो रोबोट घबराता नहीं है। वह सोचता है: "ठीक है, मुझे पता है कि नूडल्स कैसे उबालते हैं। मुझे पता है कि परतें कैसे बनाई जाती हैं। मैं बस नूडल्स की जगह ज़ुकिनी डाल दूँगा और उन्हीं चरणों का पालन करूँगा।" उसने केवल यह नहीं सीखा कि क्या सोचना है, बल्कि उसने कैसे सोचना है, यह सीख लिया है।
यह पेपर यह सिद्ध करता है कि यह "चरणों को सिखाने" की विधि (CoT ट्रेनिंग) ही वह गुप्त सूत्र है जो AI को उन नई, अजीब या जटिल समस्याओं को संभालने के लिए स्मार्ट बनाता है जिन्हें उसने पहले कभी नहीं देखा है।
भाग 1: सिद्धांत (यह क्यों काम करता है)
लेखकों ने गणित का उपयोग करके यह सिद्ध किया कि यह क्यों काम करता है। उन्होंने दो प्रकार की समस्याओं को देखा:
- इन-डिस्ट्रीब्यूशन (ID): वे समस्याएँ जो बिल्कुल वैसी ही हैं जैसी रोबोट ने अभ्यास किया था।
- आउट-ऑफ-डिस्ट्रीब्यूशन (OOD): नई, अजीब या अलग सामग्रियों वाली समस्याएँ जिनका अभ्यास रोबोट ने नहीं किया था।
निष्कर्ष:
- बिना CoT के: रोबोट ID समस्याओं में बहुत अच्छा है (उसने पैटर्न को रट लिया है) लेकिन OOD समस्याओं में बहुत खराब है। यह उस छात्र की तरह है जिसने एक विशिष्ट गणित के टेस्ट के उत्तर रट लिए हैं लेकिन अगर प्रश्न में एक संख्या भी बदल दी जाए, तो वह फेल हो जाता है।
- CoT के साथ: रोबly बड़ी समस्याओं को छोटे, सरल कौशलों में तोड़ना सीख जाता है। जब कोई नई समस्या आती है, तो वह अपने टूलबॉक्स से सही "कौशल" निकालता है और उन्हें जोड़ देता है। यह एक ऐसे शेफ की तरह है जो सौते (sauté), बेक और फ्राई करना जानता है; वह कोई भी भोजन बना सकता है, भले ही उसने वह विशिष्ट रेसिपी पहले कभी न देखी हो।
"नॉइज़" (शोर/त्रुटि) परीक्षण:
शोधकर्ताओं ने यह भी परीक्षण किया कि क्या होता है जब प्रशिक्षण डेटा अव्यवस्थित (messy) होता है (उदाहरण के लिए, रेसिपी कहती है "5 मिनट तक उबालें" लेकिन रोबोट कभी-कभी "50 मिनट तक उबालें" देखता है)।
- परिणाम: कुछ अव्यवस्थित डेटा के बावजूद, रोबोट अभी भी सामान्य विधि सीख जाता है! जब तक त्रुटियाँ 100% गलत नहीं हैं, रोबोट अभी भी तर्क को समझ सकता है। यह एक अच्छी खबर है क्योंकि इसका मतलब है कि हमें हर एक चरण के लिए एकदम सटीक, मानव-लिखित डेटा की आवश्यकता नहीं है; हमें बस ज्यादातर सही चरणों की आवश्यकता है।
भाग 2: आंतरिक संरचना (रोबोट का मस्तिष्क कैसे बदलता है)
लेखकों ने केवल परिणामों को नहीं देखा; उन्होंने यह देखने के लिए कि सोचने की प्रक्रिया कैसे बदली, रोबट के मस्तिष्क (न्यूरल नेटवर्क लेयर्स) के अंदर झाँका।
"दो-चरणीय सर्किट" का उदाहरण:
कल्पना कीजिए कि रोबोट का मस्तिष्क 8 स्टेशनों वाला एक फैक्ट्री असेंबली लाइन है।
- बिना CoT के: रोबोट लाइन के बिल्कुल अंत में सब कुछ करने की कोशिश करता है। वह मध्यवर्ती चरणों को समझने के लिए अंतिम स्टेशन तक प्रतीक्षा करता है। यह घर बनाने के लिए छत लगने तक दीवारें कहाँ लगानी हैं, यह सोचने के लिए रुकने जैसा है। यह अव्यवस्थित और धीमा है।
- With CoT: रोबोट एक दो-चरणीय असेंबली लाइन बनाता है।
- चरण 1 (शुरुआती स्टेशन): यह समस्या के पहले भाग को हल करता है (जैसे, "फ्रांस की राजधानी क्या है?")। यह इस प्रक्रिया के शुरुआती चरण में ही इस उत्तर को एक स्टिकी नोट पर लिख देता है (एक मध्यवर्ती परिणाम)।
- चरण 2 (बाद के स्टेशन): यह उस स्टिकी नोट को लेता है और उसका उपयोग दूसरे भाग को हल करने के लिए करता है (जैसे, "फ्रांस का राष्ट्रपति कौन है?")।
यह क्यों महत्वपूर्ण है:
पहले चरण को जल्दी हल करके, रोबोट बाद के स्टेशनों को अगले चरण पर पूरी तरह से ध्यान केंद्रित करने के लिए मुक्त कर देता है। यह गणित की समस्या हल करने वाले इंसान जैसा है: आप कागज पर "10 + 5 = 15" लिखते हैं ताकि अगली गुणा करते समय आपको वह संख्या याद रखने के लिए दिमाग पर बोझ न लेना पड़े। यह रोबोट को तेज़, अधिक सटीक और कठिन समस्याओं को संभालने में सक्षम बनाता है।
भाग 3: वास्तविक दुनिया का परीक्षण
अंत में, उन्होंने वास्तविक गणित की समस्याओं (जैसे स्कूल की किताबों में पाई जाती हैं) पर इसका परीक्षण किया।
- परिणाम: जब उन्होंने मॉडल्स को अपना काम दिखाना (CoT) सिखाया, तो मॉडल्स गणित में बहुत बेहतर हो गए।
- "मेसी डेटा" का आश्चर्य: जब उन्होंने जानबूझकर प्रशिक्षण गणित समस्याओं में गलतियाँ डालीं (जैसे लंबे समाधान के बीच में "2 + 2 = 5" लिखना), तब भी मॉडल्स ने समस्याओं को सही ढंग से हल करना सीख लिया, जब तक कि गलतियाँ बहुत अधिक न हों।
निष्कर्ष (The Takeaway)
यह पेपर हमें बताता है कि AI को स्मार्ट बनाने के लिए, हमें इसे केवल अधिक डेटा देने या केवल अंतिम उत्तर माँगने की आवश्यकता नहीं है। हमें इसे चीजों को तोड़ना (break down करना) सिखाना होगा।
- केवल उत्तर न दें: चरणों को दिखाएं।
- गलतियों से न डरें: यदि चरण ज्यादातर सही हैं, तो AI तर्क को सीख सकता है भले ही डेटा थोड़ा त्रुटिपूर्ण हो।
- परिणाम: एक ऐसा AI जो आज सीखे गए सरल कौशलों का उपयोग करके कल जटिल और बिल्कुल नई समस्याओं को हल कर सकता है।
संक्षेप में: CoT ट्रेनिंग एक ऐसे रोबोट को जो तथ्य रटता है, उसे एक ऐसे रोबोट में बदल देती है जो तर्क को समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।