Beyond In-Distribution Success: Scaling Curves of CoT Granularity for Language Model Generalization
यह शोध पत्र प्रदर्शित करता है कि चेन-ऑफ-थॉट (CoT) तर्क, विशेष रूप से सूक्ष्म-स्तरीय डेटा के साथ, वैध निर्भरता संरचनाओं के आंतरिककरण को मजबूर करके और प्रत्यक्ष प्रश्न-उत्तर प्रशिक्षण में निहित शॉर्टकट से बचकर, मिश्रित कार्यों पर भाषा मॉडलों के आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: "परीक्षा बनाम वास्तविक दुनिया" की समस्या
कल्पना कीजिए कि आप एक छात्र को शेफ (रसोइया) बनने के लिए प्रशिक्षित कर रहे हैं।
- इन-डिस्ट्रीब्यूशन (कक्षा): आप छात्र को "स्पैगेटी बोलोग्नीज़" के 10,000 विभिन्न रूपों वाली एक रेसिपी बुक देते हैं। वह उन सभी 10,000 व्यंजनों को पूरी तरह से याद कर लेता है। जब आप उससे उन 10,000 में से कोई भी व्यंजन बनाने के लिए कहते हैं, तो वह ए+ (A+) ग्रेड प्राप्त करता है।
- आउट-ऑफ-डिस्ट्रीब्यूशन (वास्तविक दुनिया): फिर, आप उसे एक रेस्टोरेंट की रसोई में भेजते हैं जहाँ सामग्रियाँ थोड़ी अलग हैं, या काम करने का क्रम बदल गया है। अचानक, छात्र सुन्न हो जाता है। वह एक नया व्यंजन नहीं बना पाता क्योंकि उसने केवल उत्तर रटे थे, तर्क (logic) नहीं।
यह शोध पत्र जांच करता है कि क्यों AI भाषा मॉडल (जैसे कि वह जिससे आप अभी बात कर रहे हैं) "कक्षा" छोड़ने और "वास्तविक दुनिया" का सामना करने पर विफल हो जाते हैं। लेखकों ने पाया कि हम AI को कैसे सिखाते हैं, यह इस बात से अधिक महत्वपूर्ण है कि हम उसे कितना डेटा खिलाते हैं।
मुख्य खोज: "केवल उत्तर" बनाम "अपना काम दिखाएं"
शोधकर्ताओं ने AI को प्रशिक्षित करने के दो तरीकों की तुलना की:
"उत्तर कुंजी" विधि (Q-A): आप AI को एक समस्या दिखाते हैं और बस अंतिम उत्तर देते हैं।
- उपमा: जैसे एक छात्र जो बीजगणित (algebra) कैसे करना है यह जाने बिना केवल गणित के टेस्ट का अंतिम स्कोर याद रखता है।
- परिणाम: AI कक्षा में तो बेहतरीन अंक प्राप्त करता है लेकिन वास्तविक दुनिया में बुरी तरह विफल हो जाता है। लाखों उदाहरणों के बावजूद, वह अनुकूलित (adapt) नहीं हो पाता।
"अपना काम दिखाएं" विधि (चेन-ऑफ-थॉट या CoT): आप AI को समस्या, चरण-दर-चरण तर्क और फिर उत्तर दिखाते हैं।
- उपमा: जैसे एक छात्र गणित के सवाल के हर चरण को लिखता है: "पहले मैं इन्हें जोड़ता हूँ, फिर मैं उन्हें गुणा करता हूँ..."
- परिणाम: AI तर्क सीखता है। जब वह किसी नई, अजीब समस्या का सामना करता है, तो वह उसे तोड़ सकता है और हल कर सकता है, भले ही उसने पहले कभी वह विशिष्ट समस्या न देखी हो।
आश्चर्यजनक तथ्य: "अपना काम दिखाएं" विधि 80% अधिक कुशल थी। AI ने "उत्तर कुंजी" विधि की तुलना में बहुत कम डेटा के साथ जीनियस बनना सीख लिया।
मुख्य अंतर्दृष्टि 1: चरणों की "ग्रैनुलैरिटी" (Granularity)
यह शोध पत्र एक दिलचस्प अवधारणा पेश करता है जिसे ग्रैनुलैरिटी कहा जाता है। यह इस बात को संदर्भित करता है कि "चरण" कितने विस्तृत हैं।
- कोर्स ग्रैनुलैरिटी (एक सारांश): "मैंने संख्याओं को जोड़ा, फिर मैंने उन्हें गुणा किया, और उत्तर प्राप्त किया।"
- फाइन ग्रैनुलैरिटी (एक ब्लूप्रिंट/खाका): "मैंने संख्या A ली, संख्या B को जोड़ा, परिणाम लिखा। फिर मैंने उस परिणाम को लिया, उसे C से गुणा किया, और नया परिणाम लिखा।"
निष्कर्ष: चरण जितने विस्तृत (Fine Granularity) होंगे, AI उतना ही बेहतर सामान्यीकरण (generalize) करेगा।
- उपमा: कल्पना कीजिए कि आप किसी को घर बनाना सिखा रहे हैं।
- कोर्स: "दीवारें बनाओ, फिर छत बनाओ।" (यदि छत का डिज़ाइन बदल जाता है, तो वे फंस जाते हैं)।
- फाइन: "ईंटों को इस विशिष्ट पैटर्न में बिछाएं, मोर्टार की इतनी मात्रा का उपयोग करें, फिर बीम को यहाँ रखें।" (यदि छत का डिज़ाइन बदल जाता है, तो उन्हें पता होता है कि ईंटों और बीमों को कैसे समायोजित करना है)।
यह शोध पत्र सिद्ध करता है कि यदि आप चरणों को छोड़ देते हैं या तर्क को बहुत अस्पष्ट बना देते हैं, तो AI तर्क भूल जाता है और अनुमान लगाने लगता है।
मुख्य अंतर्दृष्टि 2: "रिकैप" तंत्र (धागा न खोएं)
पेपर का एक तकनीकी लेकिन महत्वपूर्ण बिंदु स्मृति (memory) के बारे में है।
AI मॉडल्स की एक "अटेंशन विंडो" होती है। वे केवल पढ़े गए पिछले कुछ हज़ार शब्दों को ही "याद" रख सकते हैं। यदि कार्य बहुत लंबा है, तो AI अंतिम चरण तक पहुँचते-पहुँचते पहला चरण भूल सकता है।
- समस्या: AI "निर्भरता" (dependency) को भूल जाता है (जैसे, "मुझे याद रखना है कि सॉस तीखा था")।
- समाधान (रिकैप): पेपर सुझाव देता है कि AI को वर्तमान दृश्य में महत्वपूर्ण जानकारी को कॉपी और पेस्ट करने के लिए प्रशिक्षित किया जाना चाहिए।
- उपमा: कल्पना कीजिए कि आप एक लंबी कहानी लिख रहे हैं। हर कुछ पन्नों के बाद, आप पेज के शीर्ष पर एक त्वरित सारांश लिखते हैं: "अब तक, नायक के पास एक तलवार है और वह गुस्से में है।" यह सुनिश्चित करता है कि जब आप पेज 50 पर पहुँचें, तो आप यह न भूलें कि नायक के पास एक तलवार है।
पेपर दिखाता है कि AI को इन निर्भरताओं को "रिकैप" करने के लिए मजबूर करने से वह लंबे, जटिल पहेलियों को हल करने में बहुत स्मार्ट हो जाता है।
मुख्य अंतर्दृष्टि 3: "शॉर्टकट" का जाल
बिना CoT के मॉडल क्यों विफल होते हैं? क्योंकि वे आलसी होते हैं। वे शॉर्टकट खोजते हैं।
- उपमा: यदि आप एक छात्र से पूछते हैं, "2+2 क्या है?" और वे हमेशा "4" को उत्तर के रूप में देखते हैं, तो वे केवल "2+2 = 4" को याद कर सकते हैं। लेकिन यदि आप उनसे पूछते हैं "200+200 क्या है?", तो वे दोगुना होने के पैटर्न को देखकर "400" का अनुमान लगा सकते हैं, न कि जोड़ (addition) को समझकर।
- वास्तविकता: बिना चरण-दर-चरण तर्क के, AI मॉडल सतही पैटर्न (शॉर्टकट) के आधार पर अनुमान लगाना सीख लेते हैं। जब पैटर्न बदलता है (डिस्ट्रीब्यूशन शिफ्ट), तो शॉर्टकट विफल हो जाता है।
- सुधार: CoT मॉडल को समस्या की संरचना को आत्मसात करने के लिए मजबूर करता है। वह शॉर्टकट नहीं ले सकता क्योंकि उसे चरण-दर-चरण पुल बनाना पड़ता है।
सारांश: हमें क्या करना चाहिए?
यह शोध पत्र हमें AI प्रशिक्षण के भविष्य के लिए एक स्पष्ट रोडमैप देता है:
- केवल उत्तर देना बंद करें: यदि आप एक ऐसा AI चाहते हैं जो नई, अजीब स्थितियों को संभाल सके, तो केवल प्रश्न-उत्तर जोड़ों पर उसे प्रशिक्षित न करें।
- चरण सिखाएं: इसे विस्तृत, चरण-दर-चरण तर्क (Chain-of-Thought) पर प्रशिक्षित करें।
- विस्तृत बनें: चरण जितने अधिक विस्तृत (granular) होंगे, उतना ही बेहतर होगा।
- अक्सर रिकैप करें: सुनिश्चित करें कि AI को चलते समय महत्वपूर्ण तथ्यों को याद दिलाने के लिए प्रशिक्षित किया गया है।
निचोड़:
यदि आप एक ऐसा AI चाहते हैं जो एक सच्चा "जनरलिस्ट" (किसी भी चीज़ में अच्छा) हो, तो आपको उसे सोचना सिखाना होगा, न कि केवल बोलना। यह एक ऐसे तोते के बीच का अंतर है जो वाक्यांश दोहराता है और एक ऐसे इंसान के बीच का अंतर है जो कहानी को समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।