← नवीनतम पेपर
🤖 machine learning

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

यह शोध पत्र प्रस्तावित करता है कि भाषा मॉडल की तर्क क्षमता को बढ़ाने में सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) और सुदृढीकरण लर्निंग (RL) के संयोजन की सफलता कंपोजिशनल जनरलाइजेशन (संयोजन सामान्यीकरण) से उत्पन्न होती है, जहाँ SFT ट्रेसेस के भीतर कच्चे परमाणु मॉड्यूल (atomic modules) प्रदान करता है और RL उन्हें नवीन कॉन्फ़िगरेशन को हल करने के लिए विघटित और पुनर्संयोजित करता है, एक ऐसा सिद्धांत जिसे प्रयोगों द्वारा मान्य किया गया है जो दिखाते हैं कि कंपाउंड ट्रेसेस पर प्रशिक्षण, आइसोलेटेड मॉड्यूल्स की तुलना में बेहतर सामान्यीकरण प्रदान करता है।

मूल लेखक: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

प्रकाशित 2026-06-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: AI कैसे "सोचना" सीखता है

कल्पना कीजिए कि आप एक रोबोट को एक जटिल पहेली हल करना सिखा रहे हैं। आपके पास इसे सिखाने के दो मुख्य तरीके हैं:

  1. दिखाना और बताना (SFT): आप रोबोट को एक विशिष्ट पहेली का एक आदर्श, चरण-दर-चरण समाधान दिखाते हैं।
  2. गलती और सुधार (RL): आप रोबोट को अपने आप पहेली हल करने की कोशिश करने देते हैं। यदि वह अंत में सही उत्तर प्राप्त करता है, तो आप उसे एक "गोल्ड स्टार" (पुरस्कार) देते हैं। यदि वह विफल रहता है, तो उसे कुछ नहीं मिलता।

लंबे समय से, शोधकर्ताओं ने देखा है कि इन दोनों तरीकों को मिलाना सबसे अच्छा काम करता है। रोबोट "दिखाने और बताने" से चरणों को सीखता है, लेकिन "गलती और सुधार" के बाद वह उन नई पहेलियों को हल करने में बहुत बेहतर हो जाता है जिन्हें उसने पहले कभी नहीं देखा।

प्रश्न: यह संयोजन इतना अच्छा क्यों काम करता है? रोबोट के दिमाग के अंदर वास्तव में क्या हो रहा है?

मुख्य विचार: "लेगो" (Lego) सिद्धांत

इस शोध पत्र के लेखक इस प्रक्रिया को समझने का एक नया तरीका प्रस्तावित करते हैं। वे तर्क देते हैं कि तर्क करना (reasoning) केवल एक लंबी कहानी को याद रखना नहीं है; यह लेगो ब्रिक्स (Lego bricks) के साथ निर्माण करने जैसा है।

वे एक रीजनिंग ट्रेस (रोबोट की सोचने की प्रक्रिया) को दो प्रकार के पुन: प्रयोज्य (reusable) भागों में विभाजित करते हैं:

  1. कौशल (ईंटें/Bricks): ये छोटे, स्थानीय कार्य हैं। उदाहरण: "इन दो संख्याओं को जोड़ें," "इस शब्द को हटाएं," या "जांचें कि क्या यह सत्य है।"
  2. रूटिंग (निर्देश/Instructions): ये ईंटों को जोड़ने के नियमों के लिए हैं। उदाहरण: "चरण 1 के परिणाम को लें और उसे चरण 2 में फीड करें," या "यदि संख्या बड़ी है, तो चरण 4 पर कूदें।"

"दिखाने और बताने" (SFT) के साथ समस्या:
जब आप रोबोट को एक आदर्श समाधान दिखाते हैं, तो "ईंटें" और "निर्देश" एक विशिष्ट क्रम में आपस में जुड़ जाते हैं। रोबक एक लंबी, ठोस लेगो ब्लॉक देखता है। वह पूरे ब्लॉक की नकल करना सीखता है, लेकिन उसे यह एहसास नहीं होता कि वह ब्लॉक अलग-अलग, पुन: प्रयोज्य टुकड़ों से बना है। यदि आप उसे ऐसी पहेली देते हैं जिसमें ईंटों को एक अलग क्रम में लगाने की आवश्यकता हो, तो रोबोट फंस जाता है क्योंकि वह केवल मूल ब्लॉक की नकल करना जानता है।

"गलती और सुधार" (RL) का जादू:
जब रोबोट अपने आप समस्याओं को हल करने की कोशिश करने लगता है और सही उत्तरों के लिए गोल्ड स्टार प्राप्त करता है, तो कुछ अद्भुत होता है। वह महसूस करने लगता है: "रुको, मैंने उसी 'जोड़ने' वाली ईंट का उपयोग तीन अलग-अलग जगहों पर किया, और यह हर बार काम कर गया!"

RL प्रक्रिया एक विघटनकर्ता (deconstructor) की तरह कार्य करती है। यह "दिखाने और बताने" वाले चरण से उन चिपके हुए ब्लॉकों को लेती है और उन्हें वापस व्यक्तिगत, पुन: प्रयोज्य ईंटों और निर्देशों में तोड़ देती है। एक बार जब रोबोट के पास ढीली, पुन: प्रयोज्य ईंटों का एक बॉक्स हो जाता है, तो वह उन पहेलियों को हल करने के लिए उन्हें नए तरीकों से जोड़ सकता है जिन्हें उसने पहले कभी नहीं देखा।

मुख्य निष्कर्ष (सफलता का नुस्खा)

शोध पत्र ने इस सिद्धांत को सिद्ध करने के लिए प्रयोग किए। उन्होंने यह पाया, जिसे सरल भाषा में समझाया गया है:

1. आपको पहले कच्चे माल की आवश्यकता है।
आप रोबोट को लेगो बनाना नहीं सिखा सकते यदि आपने उसे कभी यह नहीं दिखाया कि लेगो की ईंट कैसी दिखती है। "दिखाने और बताने" वाला चरण महत्वपूर्ण है क्योंकि यह कच्चा माल (परमाणु कौशल और रूटिंग तंत्र) प्रदान करता है। इसके बिना, रोबोट के पास तोड़ने के लिए कुछ भी नहीं होगा।

2. चीजों को केवल दिखाने से बेहतर उन्हें तोड़ना है।
यदि आप केवल रोबोट को अलग-अलग ईंटें दिखाते हैं (जैसे, "यहाँ संख्याओं को जोड़ना सिखाया गया है"), तो वह जोड़ना तो सीख जाता है, लेकिन वह जोड़ने को अन्य चरणों के साथ कैसे जोड़ा जाए, यह नहीं सीख पाता।

  • निष्कर्ष: रोबोट को एक पूर्ण, जटिल समाधान (एक कंपाउंड ट्रेस) दिखाना और फिर "गलती और सुधार" चरण को उसे अलग करने देने में बहुत बेहतर है। रोबोट टुकड़ों को फिर से जोड़ने का तरीका बहुत तेज़ी से और अधिक प्रभावी ढंग से सीखता है बजाय इसके कि आप उसे केवल अलग-अलग ईंटों का ढेर दें।

3. "गोंद" को सही जगह पर टूटना चाहिए।
लेखकों ने सर्वोत्तम परिणामों के लिए एक विशिष्ट नुस्खा खोजा:

  • चरण 1 (दिखाना और बताना): रोबोट को कई अलग-अलग जटिल समाधान दिखाएं जो हर संभावित प्रकार की ईंट और निर्देश को कवर करते हों। सुनिश्चित करें कि उसने टूलबॉक्स के सभी औजार देख लिए हैं।
  • चरण 2 (गलती और सुधार): रोबोट को उन पहेलियों पर अभ्यास करने दें जो इन औजारों को नए, अजीब संयोजनों में मिलाती हैं जिन्हें उसने पहले नहीं देखा है।
  • क्यों? यदि आप रोबोट को उन्हीं संयोजनों पर अभ्यास करने देते हैं जो उसने चरण 1 में देखे थे, तो वह उन्हें बस रट लेता है। लेकिन यदि आप उसे नए संयोजनों पर अभ्यास करने देते हैं, तो वह ढीली ईंटों को मौके पर ही आपस में जोड़ने का तरीका सीखने के लिए मजबूर हो जाता है। यहीं पर "सामान्यीकरण" (नई चीजों को हल करने की क्षमता) होता है।

एक सरल उपमा: शेफ (Chef)

कल्पना कीजिए कि आप एक शेफ को प्रशिक्षित कर रहे हैं।

  • SFT (दिखाना और बताना): आप शेफ को "स्पैगेटी कार्बोनारा" की रेसिपी दिखाते हैं। आप उन्हें दिखाते हैं कि अंडे कैसे फोड़े जाते हैं, पास्ता कैसे उबाला जाता है, और सॉस कैसे मिलाया जाता है। शेफ इस एक व्यंजन की पूरी तरह से नकल करना सीख जाता है।
  • RL (गलती और सुधार): अब, आप शेफ से कहते हैं, "मेरे लिए एक स्वादिष्ट रात का खाना बनाओ," लेकिन आप उसे कोई रेसिपी नहीं देते। आप उसे कोशिश करने देते हैं। यदि वह एक शानदार भोजन बनाता है, तो आप कहते हैं, "बहुत अच्छा!"

शोध पत्र का अंतर्दृष्टि:
यदि आप केवल शेफ को कार्बोनारा की रेसिपी दिखाते हैं, तो वे सोच सकते हैं कि "अंडे फोड़ना" और "पास्ता उबालना" एक ही अविभाज्य क्रिया है जिसे "कार्बोनारा बनाना" कहा जाता है।
लेकिन जब आप उन्हें प्रयोग करने देते हैं (RL), तो उन्हें एहसास होता है: "ओह! मैं सलाद के लिए अंडे फोड़ सकता हूँ, या पास्ता उबाल सकता हूँ।" वे समझते हैं कि कौशल (फोड़ना, उबालना) रूटिंग (अगला कदम क्या है) से अलग हैं।

एक बार जब उन्हें यह समझ आ जाता है, तो वे एक बिल्कुल नया व्यंजन (जैसे "पास्ता ऑमलेट") बना सकते हैं जिसे उन्होंने पहले कभी नहीं देखा, क्योंकि उन्होंने सामग्री को एक निश्चित स्क्रिप्ट के बजाय अलग-अलग, पुन: प्रयोज्य उपकरणों के रूप में उपयोग करना सीख लिया है।

सारांश

  • तर्क (Reasoning) मॉड्यूलर है: यह छोटे कौशलों और उन्हें जोड़ने के नियमों से बना है।
  • SFT भाग प्रदान करता है: यह मॉडल को कच्चा माल (कौशल) देता है।
  • RL संयोजन करता है: यह मॉडल को सामग्रियों को तोड़ने और उन्हें नए तरीकों से जोड़ने का अभ्यास करने के लिए मजबूर करता है।
  • सर्वश्रेष्ठ रणनीति: मॉडल को पहले विविध जटिल उदाहरण दिखाएं (सभी भाग प्राप्त करने के लिए), फिर उसे उन भागों के नए संयोजनों पर अभ्यास करने दें (निर्माण करना सीखने के लिए)।

यह पेपर समझाता है कि वर्तमान "दिखाना और बताना फिर गलती और सुधार" पद्धति इतनी शक्तिशाली क्यों है: यह एक कठोर रटने वाली मशीन को एक लचीले निर्माता में बदल देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →