← नवीनतम पेपर
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

यह शोध पत्र बड़े भाषा मॉडलों के लिए एक नवीन पोस्ट-ट्रेनिंग पद्धति प्रस्तुत करता है जो एक फ्रोजन SFT संदर्भ नीति और एक प्रशिक्षण योग्य नीति के लॉजिट्स (logits) का औसत निकालकर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) को बेहतर बनाती है, जिससे KL रेगुलराइजेशन या क्रिटिक की आवश्यकता समाप्त हो जाती है और प्रभावी रूप से RL की तर्क क्षमताओं को SFT की फॉर्मेटिंग स्थिरता के साथ जोड़ा जाता है।

मूल लेखक: Xingwei Gan, Ying Zhu

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingwei Gan, Ying Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

बड़ी तस्वीर: दो शिक्षक, एक छात्र

कल्प Imagine कीजिए कि आप एक बड़े लैंग्वेज मॉडल (एक AI) को गणित की समस्याएं हल करने के लिए प्रशिक्षित कर रहे हैं। आपके पास इसे सिखाने के लिए दो अलग-अलग "शिक्षक" हैं:

  1. फॉर्मेटिंग टीचर (SFT): यह शिक्षक AI को यह सिखाने में उत्कृष्ट है कि उत्तरों को सफाई से कैसे लिखा जाए, सही प्रतीकों का उपयोग कैसे किया जाए, और सख्त नियमों का पालन कैसे किया जाए (जैसे अंतिम उत्तर को बॉक्स में रखना)। हालाँकि, यह शिक्षक वास्तविक गणितीय तर्क (math logic) में गलतियाँ कर सकता है।
  2. रीज़निंग टीचर (RL): यह शिक्षक गणित का जीनियस है जो जटिल समीकरणों को पूरी तरह से हल कर सकता है। लेकिन, यह शिक्षक अव्यवस्थित है; यह अक्सर उत्तर को बॉक्स करना भूल जाता है, चरणों को छोड़ देता है, या एक अजीब फॉर्मेट में लिखता है जो परीक्षा की आवश्यकताओं से मेल नहीं खाता।

समस्या:
पारंपरिक रूप से, जब आप इन दोनों को मिलाने की कोशिश करते हैं, तो आप "KL रेगुलराइजेशन" नामक विधि का उपयोग करते हैं। इसे एक रबर बैंड के रूप में सोचें जो रीज़निंग टीचर को फॉर्मेटिंग टीचर से बांध देता है। रबर बैंड रीज़निंग टीचर को फॉर्मेटिंग टीचर की शैली के करीब रहने के लिए मजबूर करता है।

  • चुनौती: यदि फॉर्मेटिंग टीचर गणित में गलती करता है, तो रबर बैंड रीज़निंग टीचर को भी उसी गलती की ओर खींच लेता है। AI "साफ-सुथरा" बनने की कोशिश में फंस जाता है लेकिन "स्मार्ट" होने में विफल रहता है।

नया समाधान: लॉजिट एवरेजिंग (Logit Averaging)
इस पेपर के लेखक इन दोनों शिक्षकों को मिलाने का एक नया तरीका प्रस्तावित करते हैं। उन्हें एक साथ बांधने के बजाय, वे एक मिश्रित आवाज (Blended Voice) बनाते हैं।

कल्पना कीजिए कि AI एक गाना गाने वाला समूह (choir) है। उन्हें पूर्ण सामंजस्य में रहने के लिए मजबूर करने के बजाय (जो उनकी क्षमता को सीमित करता है), नया तरीका उनकी आवाजों को गाने से पहले मिला देता है।

  • यदि फॉर्मेटिंग टीचर कहता है, "उत्तर को बॉक्स करें," और रीज़निंग टीचर कहता है, "उत्तर 5 है," तो मिश्रित आवाज कहती है, "उत्तर को बॉक्स करें: 5।"
  • यदि फॉर्मेटिंग टीचर गणित में गलती करता है (यह कहते हुए कि उत्तर 6 है), लेकिन रीज़निंग टीचर जानता है कि यह 5 है, तो मिश्रित आवाज फॉर्मेटिंग टीचर के "बॉक्स करने" के निर्देश को बनाए रखते हुए रीज़निंग टीचर के गणित पर भारी झुकाव रखेगी।

यह कैसे काम करता है (लॉजिट का जादू)

AI के संदर्भ में, मॉडल की "आवाज" लॉजिट्स (logits) नामक संख्याओं से बनी होती है (जो यह दर्शाती है कि मॉडल के लिए किसी विशिष्ट शब्द या संख्या को चुनना कितना संभावित है)।

  1. मिश्रण (The Mix): शोधकर्ता फॉर्मेटिंग टीचर और रीज़निंग टीचर से प्राप्त संख्याओं को गणितीय रूप से औसत (average) निकालते हैं।
  2. परिणाम: यह एक नया, अस्थायी "मिश्रित पॉलिसी" (Blended Policy) बनाता है।
  3. प्रशिक्षण (The Training): AI इस मिश्रित पॉलिसी पर अभ्यास करके सीखता है। उसे इनाम (पॉइंट्स) तब मिलता है जब अंतिम उत्तर सही होता है।
    • क्योंकि फॉर्मेटिंग टीचर मिश्रण का हिस्सा है, इसलिए AI कभी यह नहीं भूलता कि सफाई से कैसे लिखना है।
    • क्योंकि रीज़निंग टीचर मिश्रण का हिस्सा है, इसलिए AI फॉर्मेटिंग टीचर की गणितीय त्रुटियों को सुधारने के लिए स्वतंत्र है।

यह बेहतर क्यों है (प्रोडक्ट ऑफ एक्सपर्ट्स)

यह पेपर "प्रोडक्ट ऑफ एक्सपर्ट्स" की अवधारणा का उपयोग करता है। इसे एक समिति के निर्णय की तरह समझें:

  • यदि विशेषज्ञ A (फॉर्मेटिंग) शैली के बारे में आश्वस्त है, और विशेषज्ञ B (रीज़निंग) गणित के बारे में आश्वस्त है, तो अंतिम निर्णय दोनों पर मजबूत होता है।
  • यदि विशेषज्ञ A गणित के बारे में गलत है, तो विशेषज्ञ B का आत्मविश्वास उसे ओवरराइड कर देता है, लेकिन विशेषज्ञ A का शैली पर आत्मविश्वास बना रहता है।

पेपर ने पाया कि यह "मिश्रित आवाज" दृष्टिकोण पारंपरिक "रबर बैंड" विधि की तुलना में बेहतर काम करता है। AI ने गणित की समस्याओं को सही ढंग से हल करना सीखा और अपने साफ-सुथरे फॉर्मेट को भी बनाए रखा, जबकि पुरानी विधि में अक्सर AI या तो फॉर्मेटिंग भूल जाता था या फॉर्मेटिंग टीचर की गणितीय गलतियों में फंस जाता था।

प्रयोग (The Experiments)

शोधकर्ताओं ने तीन अलग-अलग "परीक्षाओं" (डेटासेट्स) पर इसका परीक्षण किया:

  1. MATH: कठिन गणित की समस्याएं।
  2. cn-k12: चीनी मिडिल/हाई स्कूल का गणित।
  3. MMLU: सामान्य ज्ञान और तर्क।

उन्होंने AI मॉडल के तीन अलग-अलग आकारों (छोटे, मध्यम और बड़े) पर भी परीक्षण किया।

परिणाम:

  • लगभग हर मामले में, नया "मिश्रित आवाज" विधि पारंपरिक विधि की तुलना में उच्च स्कोर प्राप्त करती है।
  • यह एक विशिष्ट समस्या को ठीक करने में विशेष रूप से अच्छा था: पारंपरिक विधि अक्सर कठिन गणित सीखते समय AI को उत्तरों को फॉर्मेट करने के तरीके को "भुलने" के लिए मजबूर कर देती थी। नया तरीका गणित कौशल में सुधार करते हुए फॉर्मेटिंग कौशल को बरकरार रखता है।

पेपर से एक ठोस उदाहरण

पेपर एक ज्यामिति (geometry) की समस्या का विशिष्ट उदाहरण देता है:

  • फॉर्मेटिंग टीचर (SFT): समीकरण को सही ढंग से सेट करता है लेकिन गणित में गलती करता है, निष्कर्ष निकालता है कि त्रिज्या (radius) 6 है। वह उत्तर को सफाई से बॉक्स करता है।
  • रीज़निंग टीचर (RL): गणित की सही गणना करता है, त्रिज्या 5 पाता है, लेकिन बॉक्स करना या अंतिम फॉर्मेट में लिखना भूल जाता है।
  • मिश्रित आवाज (Blended Voice): यह रीज़निंग टीचर से सही गणित (5) और फॉर्मेटिंग टीचर से बॉक्स करने का निर्देश लेता है। अंतिम आउटपुट एक सफाई से बॉक्स किया गया 5 होता है।

सारांश

यह पेपर AI मॉडल को प्रशिक्षित करने का एक तरीका पेश करता है जो एक सख्त पदानुक्रम के बजाय एक सहयोगात्मक टीम की तरह कार्य करता है। एक साफ-सुथरे लेकिन अव्यवस्थित शिक्षक और एक स्मार्ट लेकिन अव्यवस्थित शिक्षक के "विचारों" (लॉजिट्स) को गणितीय रूप से औसत करके, AI स्मार्ट और साफ-सुथरा दोनों होना सीखता है, जिससे एक को दूसरे का सख्ती से पालन करने के दबाव से होने वाले नुकसान से बचा जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →