← नवीनतम पेपर
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

यह शोध पत्र PEAR को पेश करता है, जो एक SFT-चरण की विधि है जो ऑफलाइन डेटा और भविष्य की RL नीतियों के बीच बेमेल (mismatch) के आधार पर प्रशिक्षण नुकसान (training losses) को पुन: भारित (reweight) करने के लिए इम्पॉर्टेंस सैंपलिंग का उपयोग करती है, जिससे मानक SFT की तुलना में रीजनिंग कार्यों पर डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक छात्र को गलत परीक्षा के लिए प्रशिक्षित करना

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक AI) को जटिल तर्क पहेलियों (logic puzzles) को हल करने के लिए प्रशिक्षित कर रहे हैं। प्रशिक्षण प्रक्रिया दो अलग-अलग चरणों में होती है:

  1. चरण 1 (SFT - सुपरवाइज्ड फाइन-ट्यूनिंग): छात्र एक कक्षा में बैठता है और हल किए गए उदाहरणों से भरी एक पाठ्यपुस्तक का अध्ययन करता है। वह चरणों को याद करता है और शिक्षक के उत्तरों की पूरी तरह से नकल करने की कोशिश करता है।
  2. चरण 2 (RL - रीइन्फोर्समेंट लर्निंग): छात्र को वास्तविक दुनिया में नई पहेलियों को अपने दम पर हल करने के लिए भेजा जाता है। उसे तुरंत फीडबैक मिलता है: "सही!" या "गलत, फिर से प्रयास करें।" वह प्रयोग करके और उस आधार पर अपनी रणनीति को बदलकर सीखता है जो उस क्षण में वास्तव में काम करती है।

समस्या:
आमतौर पर, शोधकर्ता छात्र को चरण 1 में पूर्ण बनाने की कोशिश करते हैं। वे पाठ्यपुस्तक के पाठों को इस तरह से ट्यून करते हैं कि छात्र अभ्यास परीक्षण (practice test) पर उच्चतम स्कोर प्राप्त कर सके। वे मानते हैं: "यदि छात्र पाठ्यपुस्तक की नकल करने में जीनियस है, तो वह बाद में नई समस्याओं को हल करने में भी जीनियस होगा।"

पेपर की खोज:
लेखकों ने पाया कि यह धारणा अक्सर गलत होती है।
कभी-कभी, एक छात्र जो पाठ्यपुस्तक में परफेक्ट स्कोर प्राप्त करता है (एक "Strong SFT" मॉडल), वास्तव में उस छात्र से खराब प्रदर्शन करता है जिसने पाठ्यपुस्तक में थोड़ा कम स्कोर प्राप्त किया था।

क्यों? क्योंकि पाठ्यपुस्तक (Behavior Policy) और वास्तविक दुनिया (Target Policy) अलग-अलग हैं।

  • पाठ्यपुस्तक (Behavior Policy): पुस्तक में दिए गए उदाहरण एक विशिष्ट शिक्षक द्वारा लिखे गए थे। कभी-कभी, उस शिक्षक ने उत्तर तक पहुँचने के लिए एक अजीब, घुमावदार रास्ता लिया, या एक छोटी सी गलती की जिसे छात्र ने कॉपी कर लिया।
  • वास्तविक दुनिया (Target Policy): चरण 2 में, छात्र को अपना स्वयं का रास्ता बनाना होता है। यदि उन्होंने शिक्षक के अजीब रास्ते का बहुत सख्ती से पालन करना सीख लिया, तो वे फंस जाते हैं जब उन्हें अपने दम पर सोचने की आवश्यकता होती है।

उपमा (Analogy):
कल्पना कीजिए कि एक डांस इंस्ट्रक्टर एक छात्र को डांस सिखा रहा है।

  • मानक प्रशिक्षण (Standard Training): इंस्ट्रक्टर एक मूव दिखाता है। छात्र उसका अभ्यास तब तक करता है जब तक कि वह इंस्ट्रक्टर के सटीक फुटवर्क (footwork) की पूरी तरह से नकल न कर ले।
  • समस्या: इंस्ट्रक्टर का फुटवर्क उनके अपने अद्वितीय शरीर के प्रकार या एक विशिष्ट शैली पर आधारित हो सकता है जो छात्र के शरीर के लिए काम नहीं करता है। यदि छात्र इंस्ट्रक्टर के कदमों को बहुत अधिक सटीकता से याद कर लेता है, तो वह किसी अलग गाने या अलग पार्टनर के साथ नाचने की कोशिश करते समय लड़खड़ा सकता है।
  • परिणाम: वह छात्र जिसने कदमों को पूरी तरह से याद कर लिया था (High SFT score), प्रतियोगिता में गिर जाता है। वह छात्र जिसने लय (rhythm) को समझा और कदमों को अनुकूलित किया (Lower SFT score, लेकिन बेहतर तैयारी), जीत जाता है।

समाधान: PEAR (एक "फ्यूचर-प्रूफ" शिक्षक)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे PEAR (पॉलिसी इवैल्यूएशन-इंस्पायर्ड एल्गोरिदम फॉर ऑफलाइन लर्निंग लॉस रीवेटिंग) कहा जाता है।

केवल छात्र को यह बताने के बजाय कि, "इस उत्तर की पूरी तरह से नकल करो," PEAR एक स्मार्ट कोच की तरह काम करता है जो आगे देख सकता है।

PEAR कैसे काम करता है:

  1. कोच भविष्य की जांच करता है: छात्र द्वारा पाठ्यपुस्तक से एक विशिष्ट कदम का अभ्यास करने से पहले, कोच पूछता है: "यदि छात्र यह कदम उठाता है, तो क्या यह बाकी के डांस के लिए सही होगा?"
  2. पाठों का पुनर्मूल्यांकन (Reweighting the Lessons):
    • यदि पाठ्यपुस्तक का एक कदम किसी डेड एंड (एक ऐसा रास्ता जिसे छात्र वास्तविक दुनिया में लेने की संभावना नहीं रखता) की ओर ले जाता है, तो कोच कहता है, "इस हिस्से की ज्यादा चिंता न करें।" (वे उस सबक का महत्व कम कर देते हैं)।
    • यदि पाठ्यपुस्तक का एक कदम एक सफल परिणाम की ओर ले जाता है जिसका उपयोग छात्र बाद में करने की संभावना रखता है, तो कोच कहता है, "इस पर कड़ी मेहनत करें!" (वे उसका महत्व बढ़ा देते हैं)।

रूपक (Metaphor):
पाठ्यपुस्तक को एक ऐसे पर्यटक द्वारा बनाए गए मानचित्र के रूप में सोचें जो रास्ता भटक गया था।

  • Standard SFT छात्र को पर्यटक के गलत मोड़ों को याद करने के लिए मजबूर करता है।
  • PEAR मानचित्र को देखता है और कहता है, "पर्यटक के रास्ते का यह हिस्सा एक खाई की ओर जाता है। आइए इस सबक के उस हिस्से को अनदेखा करें। लेकिन यह हिस्सा खजाने की ओर ले जाता है? आइए इस हिस्से का दो बार अध्ययन करें।"

परिणाम

लेखकों ने विभिन्न AI मॉडलों का उपयोग करके गणित की समस्याओं और लॉजिक गेम्स पर इसका परीक्षण किया।

  • परिणाम: PEAR के साथ प्रशिक्षित मॉडल शुरुआती अभ्यास परीक्षण पर उच्चतम स्कोर नहीं करते थे। हालांकि, जब वे "वास्तविक दुनिया" (Reinforcement Learning) में गए, तो उनमें बहुत तेजी से सुधार हुआ और अंततः उन्होंने बहुत उच्च अंतिम स्कोर प्राप्त किया।
  • लाभ: कुछ कठिन गणित प्रतियोगिताओं में, PEAR-प्रशिक्षित मॉडलों ने मानक तरीकों के मुकाबले अपनी सफलता दर में 30 प्रतिशत अंक तक सुधार किया।

निष्कर्ष (Takeaway)

"अच्छा SFT, SFT के लिए अनुकूलित होता है, बेहतर SFT, रीइन्फोर्समेंट लर्निंग के लिए तैयार करता है।"

अपने AI को केवल अतीत की नकल करने में सर्वश्रेष्ठ बनने के लिए प्रशिक्षित न करें। इसे भविष्य के लिए तैयार होने के लिए प्रशिक्षित करें। पहले चरण का लक्ष्य होमवर्क पर परफेक्ट स्कोर प्राप्त करना नहीं है; बल्कि एक ऐसा आधार बनाना है जो अगले चरण के सीखने (असली चुनौती) को आसान और अधिक प्रभावी बनाए। PEAR वह उपकरण है जो AI को अतीत की "बुरी आदतों" को अनदेखा करने में मदद करता है ताकि वह भविष्य की "अच्छी आदतों" को सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →