← नवीनतम पेपर
🤖 AI

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

यह शोध पत्र प्रक्षेपवक्र (ट्रैजेक्टरी) और चरण (स्टेप) स्तरों पर तर्क पथों का विश्लेषण करने वाले एक नवीन ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (RLVR) गलत प्रक्षेपवक्रों को संकुचित करता है और तर्क को कम चरणों में केंद्रित करता है, जबकि पर्यवेक्षित सूक्ष्म-ट्यूनिंग (SFT) सही प्रक्षेपवक्रों का विस्तार करता है और तर्क को कई चरणों में वितरित करता है, जिससे वर्तमान दो-चरणीय प्रशिक्षण प्रतिमान की पूरक सफलता की व्याख्या होती है।

मूल लेखक: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

प्रकाशित 2026-05-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs" का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: रोबोट को सोचने का तरीका सिखाने के दो तरीके

कल्पना कीजिए कि आपके पास एक रोबोट है जो बातें करने में तो अच्छा है लेकिन जटिल गणित या कोडिंग की पहेलियों को सुलझाने में उतना अच्छा नहीं है। इसे स्मार्ट बनाने के लिए, शोधकर्ता प्रशिक्षण के दो मुख्य तरीकों का उपयोग करते हैं:

  1. SFT (Supervised Fine-Tuning): यह अनुकरण (Imitation) की तरह है। आप रोबोट को एक मानव विशेषज्ञ द्वारा समस्या को हल करने का एक आदर्श उदाहरण, चरण-दर-चरण दिखाते हैं, और कहते हैं, "बिल्कुल ऐसा ही करो।"
  2. RL (Reinforcement Learning): यह इनाम और स्कोरकार्ड के साथ 'ट्रायल एंड एरर' (परीक्षण और त्रुटि) की तरह है। आप रोबोट को अपने आप समस्या हल करने देते हैं। यदि वह सही उत्तर देता है, तो उसे एक "गोल्ड स्टार" (इनाम) मिलता है। यदि वह गलत होता है, तो उसे कुछ नहीं मिलता। समय के साथ, वह उन रास्तों से बचना सीख जाता है जो विफलता की ओर ले जाते हैं।

शोध यह सवाल पूछता है: जब हम इन दो अलग-अलग तरीकों का उपयोग करते हैं, तो रोबोट के दिमाग के अंदर वास्तव में क्या होता है? क्या वे रोबोट के सोचने के तरीके को बदलते हैं, या केवल उसके उत्तरों को?

लेखकों ने पाया कि ये दोनों तरीके रोबोट की "सोचने की प्रक्रिया" के साथ विपरीत दिशा में काम करते हैं।


उपमा 1: "तर्क का मार्ग" (ट्रेजेक्टरी स्तर)

रोबोट की सोचने की प्रक्रिया को एक हाइकर (पदमयात्री) के रूप में कल्पना करें जो छिपे हुए खजाने (सही उत्तर) को खोजने के लिए एक विशाल, धुंधले जंगल में चल रहा है। वहाँ कई रास्ते हैं: कुछ खजाने तक ले जाते हैं, और कई मृत अंत (dead ends) या ढलानों की ओर।

  • SFT (अनुकरण करने वाला) अच्छे रास्तों को "विस्तारित" (Expands) करता है:
    जब आप रोबट को एक विशेषज्ञ का नक्शा दिखाते हैं (SFT), तो वह सही रास्ते पर चलना सीख जाता है। लेकिन यहाँ एक पेच है: वह उस सही रास्ते के कई अलग-अलग रूपांतरों पर भी चलना शुरू कर देता है। वह खजाना खोजने के तरीकों में बहुत रचनात्मक और विविध हो जाता है।

    • पेच: यह बुरे रास्तों पर चलना बंद नहीं करता है। यदि रोबोट पहले से ही दलदल में भटक रहा था (गलतियाँ कर रहा था), तो SFT उसे चलने के नए तरीके तो सिखाता है, लेकिन वह अभी भी कभी-कभी दलदल में भटक सकता है। यह सही मार्गों की संख्या को "विस्तारित" करता है लेकिन जरूरी नहीं कि बुरे रास्तों को साफ भी करे।
  • RL (स्कोर देने वाला) बुरे रास्तों को "दबाता" (Squeezes) है:
    जब आप रोबोट को इनाम के साथ खेल खेलने देते हैं (RL), तो उसे जल्दी ही समझ आ जाता है कि दलदल वाले रास्ते शून्य अंक की ओर ले जाते हैं। इसलिए, वह वहाँ चलना बंद कर देता है। यह गलत, भ्रमित करने वाले या मृत अंत वाले रास्तों को अस्तित्व से बाहर "दबा" (squeeze) देता है।

    • पेच: यह अच्छे रास्तों को भी "दबा" देता है। यह सही उत्तर के रचनात्मक रूपांतरों को तलाशना बंद कर सकता है और केवल उसी एक रास्ते पर टिक सकता है जो उसे पता है कि काम करता है। यह बहुत केंद्रित हो जाता है, लेकिन कम विविध।
  • जीतने वाली जोड़ी (SFT + RL):
    यह पत्र बताता है कि वर्तमान सर्वोत्तम अभ्यास यह क्यों है कि पहले SFT करें, फिर RL

    1. पहले, SFT का उपयोग रोबोट को खजाना खोजने के नए तरीके सिखाने के लिए करें (अच्छे रास्तों का विस्तार करना)।
    2. फिर, RL का उपयोग रोबोट को दलदल में भटकने के लिए दंडित करने के लिए करें (गलत रास्तों को दबाना)।
    • परिणाम: आपको एक ऐसा रोबोट मिलता है जो समस्या को हल करने के कई तरीके जानता है लेकिन गलतियों से बचने के लिए बहुत अनुशासित भी है।

उपमा 2: "विचारों का शहर" (स्टेप स्तर)

अब, रोबोट की सोचने की प्रक्रिया को एक एकल पथ के रूप में नहीं, बल्कि एक शहर के मानचित्र के रूप में देखें। तर्क का हर "चरण" (जैसे "क्षेत्रफल की गणना करें" या "सूत्र की जाँच करें") इस शहर में एक इमारत है। चरणों के बीच के संबंध सड़कें हैं।

  • RL एक "हब-एंड-स्पोक" (Hub-and-Spoke) शहर बनाता है:
    RL प्रशिक्षण के बाद, शहर बदल जाता है। रोबोट कुछ विशिष्ट, अत्यंत महत्वपूर्ण इमारतों (हब्स) पर बहुत अधिक निर्भर करने लगता है। वह इन प्रमुख चरणों पर बार-बार जाता है।

    • प्रभाव: शहर बहुत कुशल हो जाता है लेकिन इन कुछ जगहों के आसपास भीड़भाड़ वाला हो जाता है। रोबोट अपनी "सोचने की शक्ति" को कुछ महत्वपूर्ण चरणों में केंद्रित कर देता है। यह एक ऐसे यात्री की तरह है जो नदी पार करने के लिए केवल तीन विशिष्ट पुलों का उपयोग करता है, बाकी सभी को अनदेखा कर देता है।
  • SFT एक "वितरित" (Distributed) शहर बनाता है:
    SFT प्रशिक्षण के बाद, शहर अलग दिखता है। रोबोट अपनी सोच को फैला देता है। वह कई अलग-अलग इमारतों में जाता है, और कोई भी एक इमारत RL शहर की तरह इतनी अधिक नहीं देखी जाती।

    • प्रभाव: विचार "समरूप" (homogenized) या समान रूप से फैले हुए होते हैं। यह एक ऐसे शहर की तरह है जहाँ हर कोई कई तरह की सड़कों का उपयोग करता है, और कोई भी एक सड़क ट्रैफिक जाम का कारण नहीं बनती।

मुख्य निष्कर्ष:

  • RL रोबोट की सोच को कुछ प्रमुख चरणों पर तीव्र और केंद्रित (Squeezing) बनाता है।
  • SFT रोबोट की सोच को कई चरणों में व्यापक और वितरित (Expanding) बनाता है।

शहर का आकार (टोपोलॉजी)

शोधकर्ताओं ने ज्यामिति (geometry) का उपयोग करके इन "सोचने वाले शहरों" के आकार को भी देखा।

  • आधार मॉडल (प्रशिक्षण से पहले): शहर अलग-थलग पड़ोसों (communities) में विभाजित है। एक पड़ोस से दूसरे पड़ोस में जाना कठिन है। रोबोट स्थानीय लूपों (local loops) में फंस जाता है।
  • RL: यह पड़ोसों के बीच की दीवारों को तोड़ देता है। यह एक ऐसा शहर बनाता है जो कुछ विशाल "हब्स" द्वारा नियंत्रित है जो सब कुछ जोड़ते हैं। यह रोबोट को उत्तर खोजने में बहुत तेज़ बनाता है यदि वह सही हब तक पहुँच जाए, लेकिन वह उन विशिष्ट हब्स पर निर्भर रहता है।
  • SFT: यह भी दीवारों को तोड़ता है, लेकिन हब्स बनाने के बजाय, यह एक ऐसा जाल (web) बनाता है जहाँ सब कुछ एक-दूसरे से जुड़ा हुआ है। यह शहर को बहुत मजबूत और किसी भी बिंदु से दूसरे बिंदु तक नेविगेट करने में आसान बनाता है।

शोध पत्र के दावों का सारांश

  1. RL एक "दबाने वाला" (Squeezer) है: यह गलत सोचने के रास्तों को कुचल देता है और रोबोट के तर्क को कुछ अत्यधिक कुशल, उच्च-ट्रैफिक वाले चरणों में केंद्रित कर देता है। यह रोबोट को पहली बार में ही सही उत्तर पाने (Pass@1) में बहुत अच्छा बनाता है क्योंकि यह बुरे विकल्पों को खत्म कर देता है।
  2. SFT एक "विस्तार करने वाला" (Expander) है: यह रोबोट को सोचने के नए, सही तरीके सिखाता है और तर्क के भार को कई चरणों में फैला देता है। हालाँकि, यह स्वचालित रूप से उन बुरे रास्तों को नहीं हटाता जिनका रोबोट पहले उपयोग कर रहा था।
  3. SFT + RL क्यों काम करता है: सबसे अच्छे परिणाम तब मिलते हैं जब SFT का उपयोग रोबोट को कैसे सोचना है (अच्छे रास्तों का विस्तार करना) यह सिखाने के लिए किया जाता है और फिर RL का उपयोग उसे गलतियाँ करने से रोकने (बुरे रास्तों को दबाने) के लिए किया जाता है।
  4. संरचना मायने रखती है: RL एक "हब-भारी" (hub-heavy) तर्क संरचना बनाता है, जबकि SFT एक "वितरित" (distributed) संरचना बनाता है। दोनों ही अप्रशिक्षित मॉडल की "खंडित" (fragmented) संरचना से भिन्न हैं।

शोध पत्र यह निष्कर्ष निकालता है कि इन यांत्रिक अंतरों को समझना यह समझाने में मदद करता है कि वर्तमान "दो-चरणीय" (two-stage) प्रशिक्षण विधि (पहले SFT फिर RL) स्मार्ट रीजनिंग AI बनाने के लिए इतनी सफल क्यों है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →