On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
यह शोध पत्र प्रकट करता है कि DeepSeek-R1 के लंबे Chain-of-Thought प्रक्षेप पथों (trajectories) पर सुपरवाइज्ड फाइन-ट्यूनिंग करने से gpt-oss-120b डेटा की तुलना में कम प्रशिक्षण हानि (training loss) तो प्राप्त होती है, लेकिन अक्षम और विचलित तर्क पैटर्न के कारण सामान्यीकरण (generalization) खराब हो जाता है, और यह बार-बार शाखाओं में विभाजित होने वाले प्रक्षेप पथों को फ़िल्टर करने का प्रस्ताव देता है जिससे तर्क प्रदर्शन में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।
बड़ी तस्वीर: "परफेक्ट स्टूडेंट" का विरोधाभास
कल्पना कीजिए कि आप एक नए छात्र (एक AI मॉडल) को अविश्वसनीय रूप से कठिन गणित के सवाल हल करना सिखाने की कोशिश कर रहे हैं। आपके पास दो प्रसिद्ध शिक्षक हैं: शिक्षक A (DeepSeek-R1) और शिक्षक B (gpt-oss)।
दोनों शिक्षक प्रतिभाशाली हैं। वे दोनों गणित के ठीक उन्हीं 500,000 सवालों को सही ढंग से हल करते हैं। आप उनकी चरण-दर-चरण सोचने की प्रक्रिया (जिसे "चेन-ऑफ-थॉट" कहा जाता है) को रिकॉर्ड करते हैं और अपने नए छात्र को प्रशिक्षित करने के लिए उनका उपयोग करते हैं।
चौंका देने वाली खोज:
आप उम्मीद करेंगे कि यदि शिक्षक A के नोट्स पढ़ना आसान है या यदि छात्र उन्हें तेजी से सीख लेता है (कम "ट्रेनिंग लॉस"), तो छात्र एक बेहतर समस्या-समाधानकर्ता बन जाएगा।
- शिक्षक A के नोट्स वास्तव में छात्र के लिए याद करने में आसान थे। छात्र बहुत कम प्रयास के साथ उन्हें पूरी तरह से रट सकता था।
- शिक्षक B के नोट्स याद करने में कठिन थे। छात्र अभ्यास के दौरान अधिक संघर्ष करता था।
ट्विस्ट:
जब आपने छात्रों का उन नए सवालों पर परीक्षण किया जो उन्होंने पहले कभी नहीं देखे थे:
- वह छात्र जिसने शिक्षक A (आसान नोट्स) से पढ़ाई की थी, वह बुरी तरह विफल रहा।
- वह छात्र जिसने शिक्षक B (कठिन नोट्स) से पढ़ाई की थी, वह गणित का जादूगर बन गया।
क्यों? क्योंकि शिक्षक A एक "बड़बोला" (chatterbox) था जो हर संभव रास्ते पर भटक जाता था, जबकि शिक्षक B एक "लेजर-फोकस्ड" जासूस था जो सीधे उत्तर तक पहुँचता था।
मुख्य समस्या: "जंगल की खोज करना" बनाम "रास्ते पर चलना"
यह शोध पत्र इस बात की गहराई में जाता है कि ये दोनों शिक्षक कैसे सोचते हैं। वे दो बहुत अलग "तर्क पैटर्न" (reasoning patterns) का उपयोग करते हैं।
1. शिक्षक A (DeepSeek-R1): "शाखाओं वाला खोजकर्ता" (The Branching Explorer)
कल्पना कीजिए कि शिक्षक A एक घने जंगल में चल रहा है। जब उसे एक रास्ता दिखता है, तो वह केवल उस पर चलता नहीं है। वह रुकता है, सोचता है, "क्या होगा अगर मैं बाईं ओर जाऊं?" फिर वह बाईं ओर जाता है, महसूस करता है कि यह एक डेड एंड (बंद रास्ता) है, वापस आता है, और सोचता है, "क्या होगा अगर मैं दाईं ओर जाऊं?" फिर वह दाईं ओर जाता है, महसूस करता है कि वह भी एक डेड एंड है, और फिर से सोचता है।
- शैली: वे लगातार शाखाएं निकालते हैं। वे कई विचार प्रस्तावित करते हैं, उनकी जांच करते हैं, उन्हें छोड़ देते हैं, और नए विचार प्रस्तावित करते हैं।
- परिणाम: उनके नोट्स "क्या होगा अगर," "शायद," और "आइए इसे दूसरे तरीके से आजमाते हैं" जैसे वाक्यों से भरे होते हैं।
- जाल: छात्र इस व्यवहार की नकल करना सीख जाता है। जब छात्र के सामने एक नई समस्या आती है, तो वह जंगल में फंस जाता है, सही रास्ता खोजने से पहले या पूरी तरह से खो जाने से पहले 100 गलत रास्तों को खोजने में समय बर्बाद करता है। वह अकुशल अन्वेषण (inefficient exploration) की आदत को विरासत में पा लेता है।
2. शिक्षक B (gpt-oss): "तार्किक जासूस" (The Deductive Detective)
कल्पना लीजिए कि शिक्षक B उसी जंगल में चल रहा है। वह मानचित्र देखता है, निकास के लिए सीधा रास्ता पहचानता है, और उस पर चलता है। वह हर झाड़ी को देखने के लिए नहीं रुकता। यदि वह किसी दीवार से टकराता है, तो वह तुरंत मुड़ता है और एक ही तार्किक वैकल्पिक रास्ता लेता है।
- शैली: वे निष्कर्ष निकालते हैं (deduce)। वे एक तथ्य को दूसरे से जोड़ते हुए रैखिक रूप से आगे बढ़ते हैं।
- परिणाम: उनके नोट्स सीधे होते हैं: "चूंकि X सत्य है, इसलिए Y सत्य होना चाहिए। इसलिए, Z।"
- लाभ: छात्र ध्यान केंद्रित करना सीखता है। वे बिना विचलित हुए तर्क की एक मजबूत, सीधी रेखा बनाना सीखते हैं।
"ट्रेनिंग लॉस" का भ्रम
छात्र ने शिक्षक A के नोट्स इतनी आसानी से क्यों सीख लिए?
ट्रेनिंग लॉस को "छात्र कितना ऊब रहा है" के माप के रूप में सोचें।
- शिक्षक A के नोट्स सरल, दोहराव वाली गणनाओं और स्पष्ट "क्या होगा अगर" वाले कथनों से भरे होते हैं। इनका अनुमान लगाना आसान है। छात्र जल्दी ही ऊब जाता है क्योंकि उत्तर स्पष्ट हैं, इसलिए उनका "लॉस" (त्रुटि दर) शून्य के करीब गिर जाता है।
- शिक्षक B के नोट्स गहरे तार्किक जंपों से भरे होते हैं। चरणों के बीच संबंध को समझने के लिए छात्र को वास्तव में सोचना पड़ता है। "लॉस" ऊंचा रहता है क्योंकि छात्र अधिक मेहनत कर रहा होता है।
सबक: कम "बोरियत स्कोर" (लो लॉस) का मतलब यह नहीं है कि छात्र सही कौशल सीख रहा है। इसका मतलब सिर्फ यह है कि वे बड़बोलेपन (chatter) को रटने में अच्छे हैं।
समाधान: पेड़ की छंटाई करना (Pruning the Tree)
शोधकर्ताओं ने महसूस किया कि शिक्षक A का "अन्वेषण" वास्तव में संरचनात्मक अतिरेक (structural redundancy) था। यह एक ऐसे पेड़ की तरह था जिसमें बहुत सारी सूखी शाखाएं थीं।
उन्होंने पूछा: क्या होगा यदि हम छात्र को सिखाने से पहले ही उन सूखी शाखाओं को काट दें?
उन्होंने शिक्षक A के विशाल डेटासेट को लिया और उन समस्याओं को फ़िल्टर कर दिया जहाँ शिक्षक सबसे अधिक भटक रहा था। उन्होंने केवल उन्हीं समस्याओं को रखा जहाँ शिक्षक केंद्रित और तार्किक बना रहा।
परिणाम:
जब उन्होंने छात्र को शिक्षक A के इस "छंटे हुए" (pruned) संस्करण का उपयोग करके पुन: प्रशिक्षित किया:
- छात्र का प्रदर्शन काफी बढ़ गया।
- कठिन गणित प्रतियोगिताओं (जैसे AIME) में, छात्र के प्रदर्शन में 5% से 5.5% का सुधार हुआ।
- छात्र जंगल में भटकना बंद कर गया और सीधा रास्ता चलने लगा।
सारांश उपमा
कल्पना कीजिए कि आप गाड़ी चलाना सीख रहे हैं।
- शिक्षक A एक ऐसा प्रशिक्षक है जो कहता है, "ठीक है, चलिए बाईं ओर मुड़ने की कोशिश करते हैं। ओह, यह तो बंद रास्ता है। चलिए दाईं ओर चलते हैं। नहीं, यह तो दीवार है। चलिए पीछे की ओर चलते हैं। चलिए बस यह देखने के लिए फुटपाथ पर चलते हैं कि क्या होता है।" आप सभी गलत चालें सीख जाते हैं, लेकिन आप प्रशिक्षक की आवाज़ को पूरी तरह से रट लेते हैं।
- शिक्षक B एक ऐसा प्रशिक्षक है जो कहता है, "स्टीयरिंग बाईं ओर घुमाएं, दर्पण देखें, गति बढ़ाएं।" सरल, सीधा, प्रभावी।
यह शोध पत्र सिद्ध करता है कि एक जीनियस (शिक्षक A) के "बड़बोलेपन" (chatter) को रटने से आप एक थोड़े कम चमकदार लेकिन अधिक सटीक जीनियस (शिक्षक B) की "सीधी तर्कशक्ति" सीखने की तुलना में एक खराब ड्राइवर बनते हैं। "बड़बोलेपन" (शाखाओं वाले रास्तों) को फ़िल्टर करके, आप एक अच्छे शिक्षक को एक महान शिक्षक में बदल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।