Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
यह शोध पत्र संकुचित चेन-ऑफ-थॉट रीजनिंग (एक्सप्लिसिट, कंपोज़्ड और इम्प्लिसिट) का एक वर्गीकरण प्रस्तुत करता है और नियंत्रित प्रयोगों के माध्यम से यह प्रदर्शित करता है कि जहाँ मोटे तौर पर की गई रीजनिंग के लिए अधिक डेटा की आवश्यकता होती है और इसमें विशिष्ट स्केलिंग एवं मेमोराइजेशन व्यवहार दिखाई देते हैं, वहीं सत्यापन योग्य पुरस्कारों (वेरिफिएबल रिवार्ड्स) के साथ आगामी सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग), सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान सीखे गए इन संकुचित चरणों को प्रभावी ढंग से विघटित कर सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) रोबोट को एक जटिल गणितीय पहेली हल करना सिखा रहे हैं। इस पहेली में चरणों की एक लंबी श्रृंखला शामिल है: "इस संख्या को लें, इसे गुणा करें, वह जोड़ें, इससे विभाजित करें..."
रोबोट को सिखाने के लिए, आप उसे समाधान तीन अलग-अलग तरीकों से दिखा सकते हैं। यह शोध पत्र देखता है कि कौन सा तरीका सबसे अच्छा काम करता है, आपको कितने डेटा की आवश्यकता है, और क्या होता है यदि आप चरणों को छोड़कर रोबोट को "तेजी से सोचने" के लिए प्रेरित करते हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. सिखाने के तीन तरीके (वर्गीकरण)
शोधकर्ताओं ने इस आधार पर वर्गीकृत किया कि उन्होंने रोबोट को समाधान कैसे दिखाया:
- Explicit CoT (धीमी और स्थिर यात्रा): आप रोबोट को हर एक चरण दिखाते हैं। "2 से गुणा करें। अब 5 जोड़ें। अब 3 से विभाजित करें।" यह लंबा है, लेकिन रोबोट देख पाता है कि उत्तर कैसे बनाया गया।
- Composed CoT (समूहीकृत चरण): आप दो चरणों को एक साथ बांध देते हैं। "2 से गुणा करें" और फिर "5 जोड़ें" दिखाने के बजाय, आप कहते हैं, "2 से गुणा करें और 5 जोड़ें।" रोबोट संचालन (operations) तो देखता है, लेकिन बीच की संख्याएँ छिपी रहती हैं।
- Implicit CoT (जादुई ट्रिक): आप बीच के हिस्से को पूरी तरह से छोड़ देते हैं। आप बस शुरुआती संख्या और एक हिस्से का अंतिम परिणाम दिखाते हैं, बिना यह दिखाए कि आप वहां तक कैसे पहुंचे। यह ऐसा है जैसे कहना, "3 से शुरू करें, 15 पर समाप्त करें," और रोबोट को बीच की गणित का अनुमान लगाना पड़ता है।
2. "संपीड़न" लागत (अधिक डेटा की आवश्यकता)
शोध ने पाया: आप निर्देशों को जितना अधिक संपीड़ित (compress) करेंगे, रोबोट को सिखाने के लिए आपको उतने ही अधिक उदाहरणों की आवश्यकता होगी।
- उपमा: कल्पना कीजिए कि आप किसी को केक बनाना सिखा रहे हैं।
- यदि आप उन्हें हर एक चरण के साथ रेसिपी देते हैं (Explicit), तो वे इसे 10 बार देखने के बाद सीख सकते हैं।
- यदि आप उन्हें एक "संपीड़ित" रेसिपी देते जो कहती है "सूखी और गीली सामग्री को मिलाएं" बिना मिश्रण की प्रक्रिया दिखाए (Composed/Implicit), तो वे भ्रमित हो जाते हैं। इसे सीखने के लिए, आपको उन्हें वह संपीड़ित रेसिपी सैकड़ों बार दिखानी होगी (अधिक डेटा) इससे पहले कि वे अंततः पैटर्न को समझ सकें।
- निष्कर्ष: मोटे तौर पर संपीड़ित तर्क (coarser, compressed reasoning) को समान स्तर का कौशल प्राप्त करने के लिए काफी अधिक प्रशिक्षण डेटा की आवश्यकता होती है।
3. पुनरावृत्ति बनाम विविधता (द "ड्रिल" प्रभाव)
एक बार जब आप तय कर लेते हैं कि संपीड़ित डेटा का उपयोग करना है, तो आपको इसे कैसे प्रस्तुत करना चाहिए? क्या आपको रोबोट को बार-बार एक ही 10 समस्याएं दिखानी चाहिए (पुनरावृत्ति), या 10,000 अलग-अलग समस्याएं (विविधता)?
- Composed CoT (समूहीकृत चरण): इस प्रकार को पुनरावृत्ति पसंद है। यदि आप रोबोट को बार-बार वही समूहीकृत चरण दिखाते हैं, तो वह उस विशिष्ट पैटर्न में बहुत अच्छा हो जाता है। यह खेल के एक विशिष्ट मूव का अभ्यास (drill) करने जैसा है; पुनरावृत्ति इसे मांसपेशियों की स्मृति (muscle memory) बना देती है।
- Implicit CoT (जादुई ट्रिक): इस प्रकार को पुनरावृत्ति नापसंद है। यदि आप रोबोट को एक ही "जादुई ट्रिक" बार-बार दिखाते हैं, तो वह केवल उस विशिष्ट ट्रिक के लिए उत्तर रट लेता है। जब आप उसे एक नई पहेली देते हैं, तो वह विफल हो जाता है। उसे वास्तव में अंतर्निहित तर्क सीखने के लिए विविधता (अलग-अलग डेटा) की आवश्यकता होती, अन्यथा वह केवल रटकर नकल (cheat) करता है।
4. "अनलर्निंग" चरण (SFT बनाम RL)
यह सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने पहले रोबोट को संपीड़ित डेटा के साथ सिखाया (SFT), और फिर उसे पुरस्कारों के साथ अपने आप अभ्यास करने दिया (RL)।
- समस्या: संपीड़ित डेटा के साथ सिखाए जाने पर, रोब लड़खड़ाने लगता है। यदि आप इसे एक ऐसी पहेली हल करने के लिए कहते हैं जिसमें एक "आधा-चरण" (एक ऐसा चरण जो संपीड़ित समूहों में फिट नहीं बैठता) की आवश्यकता होती है, तो यह पूरी तरह से विफल हो जाता है। यह ऐसा है जैसे केवल जोड़ों में कदम चलने के लिए प्रशिक्षित रोबोट को, यदि आप इसे एक एकल कदम लेने के लिए कहें, तो यह गिर जाता है।
- समाधान: जब उन्होंने Reinforcement Learning (RL) पर स्विच किया, तो रोबोट फिर से "सोचना" शुरू कर देता है। उसे एहसास हुआ, "रुको, मैं इस बड़े टुकड़े को वापस छोटे टुकड़ों में तोड़ सकता हूँ!"
- उपमा: कल्पना कीजिए कि एक छात्र ने एक गणितीय सूत्र को एक एकल ब्लॉक के रूप में याद कर लिया है। वह उस समस्या को हल नहीं कर सकता जिसके लिए सूत्र को विभाजित करने की आवश्यकता होती है। लेकिन यदि आप उन्हें अपने आप समस्याओं को हल करने का अभ्यास करने देते हैं (RL), तो वे अंततः महसूस करते हैं, "ओह! मैं इस बड़े ब्लॉक को वापस उन छोटे चरणों में तोड़ सकता हूँ जो मैंने पहले सीखे थे।" RL चरण संपीड़ित ज्ञान को डीकंप्रेस (uncompress) करता है।
5. क्रम मायने रखता है (एकतरफा रास्ते)
अंत में, उन्होंने सोचने की दिशा को देखा।
- फॉरवर्ड/बैकवर्ड (एकतरफा): शुरुआत से अंत तक सोचना, या अंत से शुरुआत की ओर सोचना, बहुत अच्छा काम करता है। रोबोट लंबी, कठिन पहेलियों के लिए बेहतर सामान्यीकरण (generalize) करता है।
- Hierarchical (पेड़/वृक्ष): यह वह जगह है जहाँ आप छोटे टुकड़ों को हल करते हैं और फिर उन्हें जोड़ते हैं (जैसे एक पेड़ बनाना)। शोध में पाया गया कि जब पहेलियाँ लंबी हो जाती हैं तो यह विफल हो जाता है। रोबोट एक साथ बहुत सारे मध्यवर्ती "शाखाओं" को अपने दिमाग में रखने की कोशिश में खो जाता है।
- सीख: लंबे तर्क श्रृंखलाओं के लिए, एक सीधी रेखा (एक दिशा) एक जटिल शाखा संरचना (tree structure) की तुलना में बहुत बेहतर है।
सारांश
AI को कुशल (छोटा विचार) बनाने के लिए बिना उसकी बुद्धिमत्ता खोए:
- जब तक आपके पास भारी मात्रा में डेटा न हो, अत्यधिक संपीड़न (over-compress) न करें।
- यदि आप करते हैं, तो Composed चरणों का उपयोग करें (संचालन दिखाना) और उन्हें अक्सर दोहराएं। Implicit चरणों (संचालन छिपाना) से बचें, जब तक कि आपके पास विशाल, विविध डेटा न हो।
- SFT (Supervised Fine-Tuning) रोबोट को संपीड़ित शॉर्टकट सिखाता है, लेकिन जब समस्या अजीब या लंबी हो जाए, तो उन शॉर्टकट को वापस तोड़ने के लिए RL (Reinforcement Learning) की आवश्यकता होती है।
- सर्वोत्तम परिणामों के लिए सोचने की प्रक्रिया को एक सीधी रेखा में रखें, न कि एक जटिल पेड़ के रूप में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।