← नवीनतम पेपर
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

यह शोध पत्र RECAP को प्रस्तुत करता है, जो एक एंड-टू-एंड रिप्ले रणनीति है जिसमें डायनेमिक ऑब्जेक्टिव रीवेटिंग (dynamic objective reweighting) शामिल है, जो सुदृढीकरण शिक्षण (reinforcement learning) के साथ प्रशिक्षित बड़े रीजनिंग मॉडल्स में सामान्य-क्षमता विस्मृति (general-capability forgetting) को प्रभावी ढंग से कम करती है और साथ ही लचीले रिवॉर्ड ट्रेड-ऑफ के माध्यम से रीजनिंग प्रदर्शन को बढ़ाती है।

मूल लेखक: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models" का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "विशेषज्ञ" का जाल (The "Specialist" Trap)

कल्पना कीजिए कि आपने एक बहुत ही प्रतिभाशाली और बहुमुखी शेफ (chef) को काम पर रखा है जो कुछ भी बना सकता है: वह एक बेहतरीन केक बना सकता है, सटीकता से सब्जियां काट सकता है, और यहाँ तक कि रसोई में टपकते नल को भी ठीक कर सकता है (यह एक मॉडल की गणित, विज़न और सामान्य ज्ञान को संभालने की क्षमता का रूपक है)।

फिर, आप इस शेफ को विशेष रूप से एक हाई-स्टेक्स पाई-ईटिंग कॉन्टेस्ट (pie-eating contest) जीतने के लिए प्रशिक्षित करने का निर्णय लेते हैं। आप उसे केवल पाई की रेसिपी और काँटे (fork) को पकड़ने के सख्त नियमों के साथ एक कमरे में रखते हैं।

क्या होता है?
कुछ हफ्तों के गहन प्रशिक्षण के बाद, शेफ पाई खाने में विश्व स्तरीय बन जाता है। वह काँटे के नियमों का पूरी तरह से पालन करता है। हालाँकि, क्योंकि उसने अपना सारा समय पाई के अभ्यास में बिताया, वह सब्जियां काटना या नल ठीक करना भूलने लगता है। यदि आप उससे प्याज काटने के लिए कहते हैं, तो वह शून्य में ताकता रह सकता है या उसे बिना काटे पूरा खाने की कोशिश कर सकता है।

AI की दुनिया में, बिल्कुल यही हो रहा है। शोधकर्ता RLVR (Reinforcement Learning with Verifiable Rewards) नामक तकनीक का उपयोग करके लार्ज लैंग्वेज मॉडल्स (LLMs) को "तर्क करने" (गणित की समस्याओं को हल करना, जटिल तर्क का पालन करना) के लिए सिखा रहे हैं। जबकि मॉडल तर्क करने में अद्भुत हो जाते हैं, वे अपने अन्य कौशल भूलने लगते हैं, जैसे कि चित्र में वस्तुओं को पहचानना, चित्र में टेक्स्ट पढ़ना, या सुरक्षित और ईमानदार बने रहना।

शोध पत्र का समाधान: "RECAP"

लेखक एक नई विधि प्रस्तावित करते हैं जिसे RECAP (Replay-Enhanced CApability Preservation) कहा जाता है। RECAP को उस शेफ के लिए एक स्मार्ट ट्रेनिंग शेड्यूल के रूप में सोचें।

केवल शेफ को दिन भर पाई की रेसिपी खिलाने के बजाय, RECAP दो काम करता है:

  1. बुनियादी बातों को दोहराना (Replays the Basics): यह समय-समय पर पुरानी "सब्जियां काटने" और "नल ठीक करने" की रेसिपी वापस लाता है ताकि शेफ उन्हें भूल न जाए।
  2. डायनामिक वेटिंग (Dynamic Weighting): यह एक स्मार्ट कोच की तरह काम करता है जो वास्तविक समय में शेफ की प्रगति पर नज़र रखता है।

"स्मार्ट कोच" कैसे काम करता है (उपमा/Analogy)

कल्पना कीजिए कि शेफ एक साथ तीन चीज़ों का अभ्यास कर रहा है:

  • काँटे का नियम (Format): काँटे को कैसे पकड़ना है।
  • स्वाद (Accuracy): क्या पाई का स्वाद अच्छा है?
  • सफाई (General Skills): रसोई को साफ रखना।

एक सामान्य प्रशिक्षण सत्र में, कोच कह सकता है, "तीनों का समान रूप से अभ्यास करें!" लेकिन यह अक्षम है।

  • काँटे का नियम आसान है। शेफ इसे 5 मिनट में सीख लेता है। यदि कोच उसे एक घंटे तक इसका अभ्यास करने के लिए मजबूर करता है, तो यह समय की बर्बादी है।
  • स्वाद कठिन है। शेफ इसमें संघर्ष करता है।
  • सफाई बिगड़ रही है क्योंकि शेफ विचलित हो रहा है।

RECAP का कोच डेटा को देखता है और कहता है:

"हे, शेफ ने काँटे के नियम में महारत हासिल कर ली है। आइए अब इस पर ध्यान देना कम करें (वेट कम करें)। आइए 'स्वाद' और 'सफाई' पर अधिक समय बिताएं क्योंकि वे अभी भी संघर्ष कर रहे हैं या अस्थिर हो रहे हैं।"

RECAP स्वचालित रूप से पता लगाता है कि कौन से कौशल "सैचुरेटेड" (सीखे जा चुके) हैं और कौन से "वोलेटाइल" (संघर्ष कर रहे या तेजी से बदल रहे) हैं। यह प्रशिक्षण का ध्यान उन कौशलों की ओर मोड़ देता है जो संघर्ष कर रहे हैं, ताकि मॉडल आसान चीजों को ज़रूरत से ज़्यादा न सीख ले और कठिन चीजों को न भूल जाए।

उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने शक्तिशाली AI मॉडल्स (विशेष रूप से Qwen2.5-VL परिवार) पर इसका परीक्षण किया। यहाँ उनकी खोज है:

  1. "भूलना" वास्तविक है: जब उन्होंने मॉडल्स को केवल रीजनिंग कार्यों पर प्रशिक्षित किया, तो मॉडल गणित में बेहतर हो गए लेकिन चित्रों में टेक्स्ट पढ़ने या वस्तुओं को पहचानने जैसे कार्यों में काफी खराब हो गए।
  2. RECAP ने राह दिखाई: अपने डायनामिक शेड्यूल का उपयोग करके, मॉडल्स ने अपने रीजनिंग कौशल को उच्च बनाए रखा (कभी-कभी उनमें सुधार भी हुआ) लेकिन उन्होंने अपने सामान्य कौशल को खोया नहीं। वास्तव में, वे मानक तरीकों से प्रशिक्षित मॉडल्स की तुलना में सामान्य कार्यों पर अक्सर बेहतर प्रदर्शन करते हैं।
  3. दक्षता (Efficiency): RECAP के साथ प्रशिक्षित मॉडल्स न केवल स्मार्ट हुए; वे अधिक कुशल भी बन गए। वे लंबी बातें करने के बजाय छोटे और सीधे उत्तर देने लगे, क्योंकि सिस्टम ने उन कार्यों के लिए उन्हें "सोचने" (लंबे टेक्स्ट लिखना) के लिए मजबूर करना बंद कर दिया जिनमें इसकी आवश्यकता नहीं थी।

मुख्य निष्कर्ष (Takeaway)

यह शोध पत्र तर्क देता है कि हमें केवल AI मॉडल्स को सब कुछ भूलकर "रीजनिंग मशीन" बनाने के लिए मजबूर नहीं करना चाहिए। यदि हम ऐसा करते हैं, तो वे एक ही हुनर वाले (one-trick ponies) बन जाते हैं जो वास्तविक दुनिया में उपयोगी होने का गुण भूल जाते हैं।

RECAP एक सरल, प्लग-इन टूल है जो AI प्रशिक्षण के लिए एक संतुलित आहार के रूप में कार्य करता है। यह सुनिश्चित करता है कि जब मॉडल जटिल पहेलियों को हल करना सीख रहा हो, तो वह देखना, पढ़ना और दुनिया को समझना न भूले। यह AI को एक विशेषज्ञ बनाने के साथ-साथ उसे बहुमुखी बनाए रखने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →