← नवीनतम पेपर
🤖 machine learning

Robust Policy Optimization to Prevent Catastrophic Forgetting

यह शोध पत्र फाइन-ट्यूनिंग रोबस्ट पॉलिसी ऑप्टिमाइज़ेशन (FRPO) को प्रस्तुत करता है, जो एक रोबस्ट RLHF फ्रेमवर्क है जो संभावित पॉलिसी बदलावों के एक पड़ोस (neighborhood) में रिवॉर्ड स्थिरता को अनुकूलित करने के लिए एक मैक्स-मिन फॉर्मूलेशन का उपयोग करता है, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के, बाद के डाउनस्ट्रीम फाइन-ट्यूनिंग के दौरान सुरक्षा और अन्य सीखे गए व्यवहारों की विनाशकारी विस्मृति (catastrophic forgetting) को प्रभावी ढंग से रोका जा सकता है।

मूल लेखक: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है, मान लीजिए हम उन्हें "AI" कहते हैं। आपने इस छात्र को सहायक, विनम्र और सुरक्षित होने के लिए वर्षों तक प्रशिक्षित किया है। वे जानते हैं कि बिना बदतमीजी किए सवालों के जवाब कैसे देना है, और वे खतरनाक अनुरोधों (जैसे "बम कैसे बनाएं") को मना करना भी जानते हैं। यह "सुरक्षा प्रशिक्षण" (safety training) का चरण है।

अब, आप इसी छात्र को एक नया, विशिष्ट कौशल सिखाना चाहते हैं, जैसे उन्नत गणित या कोडिंग। आप एक नई कक्षा शुरू करते हैं (फाइन-ट्यूनिंग)। लेकिन यहाँ समस्या यह है कि जैसे-जैसे छात्र गणित के नए नियम सीखता है, वह अपने पुराने सुरक्षा नियमों को भूलने लगता है। अचानक, जब उनसे गणित का सवाल पूछा जाता है, तो वे अनजाने में एक खतरनाक जवाब दे सकते हैं क्योंकि वे गणित पर इतना ध्यान केंद्रित कर चुके थे कि वे अपने "कोई नुकसान न पहुँचाने" वाले प्रशिक्षण को भूल गए। इस शोध पत्र में, इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा गया है।

इसे ठीक करने के पिछले अधिकांश प्रयास इस तरह थे जैसे छात्र को यह कहना कि, "अरे, गणित करते समय अपने सुरक्षा नियमों को मत भूलना!" गणित की कक्षा शुरू होने के बाद। शोध पत्र का तर्क है कि यह बहुत देर हो चुकी है। इसके बजाय, आपको छात्र को गणित की कक्षा शुरू होने से पहले ही मजबूत (robust) बनाना होगा।

मुख्य विचार: "सपाट" स्थान खोजना

लेखक एक नया प्रशिक्षण तरीका प्रस्तावित करते हैं जिसे FRPO (Fine-tuning Robust Policy Optimization) कहा जाता है। यह समझने के लिए कि यह कैसे काम करता है, पहाड़ियों और घाटियों के परिदृश्य की कल्पना करें:

  • पुराना तरीका (मानक प्रशिक्षण): छात्र परिदृश्य में सबसे ऊँची चोटी की तलाश करता है। यह चोटी वर्तमान कार्य के लिए उच्चतम संभव स्कोर का प्रतिनिधित्व करती है। हालाँकि, यह चोटी एक तीखी, सुई जैसी पर्वत शिखर हो सकती है। यदि छात्र किसी भी दिशा में एक छोटा सा कदम भी लेता है (जैसे कोई नया गणित का नियम सीखना), तो वह शिखर से सीधे फिसल जाएगा और नीचे खाई में गिर जाएगा, जिससे उसके सभी सुरक्षा कौशल खो जाएंगे।
  • FRPO का तरीका: केवल एक एकल सुई जैसी चोटी खोजने के बजाय, FRPO छात्र को एक चौड़े, सपाट पठार (flat plateau) को खोजने के लिए प्रशिक्षित करता है जो अभी भी काफी ऊँचा है। इस पठार पर, छात्र किसी भी दिशा में कुछ कदम चल सकता है (नए कौशल सीख सकता है) बिना किनारे से गिरे। इधर-उधर चलते रहने पर भी रिवॉर्ड (सुरक्षा) ऊँचा बना रहता है।

यह कैसे काम करता है ( "क्या होगा अगर" का खेल)

शोध पत्र इन सपाट पठारों को खोजने के लिए एक चतुर गणितीय युक्ति का उपयोग करता है। केवल यह पूछने के बजाय कि "छात्र अभी कितना अच्छा है?", FRPO पूछता है:

"सबसे खराब स्थिति क्या होगी यदि हम उनके व्यवहार में छोटे, उचित बदलाव करें (जैसे कि एक विशिष्ट गणित की कक्षा में होता है)?"

एल्गोरिदम फिर उस सबसे खराब स्थिति के स्कोर को अधिकतम (maximize) करने की कोशिश करता है। यह छात्र को एक ऐसी रणनीति सीखने के लिए मजबूर करता है जो सुरक्षित हो, भले ही चीजें थोड़ी बदल जाएं। यह एक एथलीट को न केवल एक आदर्श ट्रैक पर तेज़ दौड़ने के लिए प्रशिक्षित करने जैसा है, बल्कि उसे तब भी तेज़ दौड़ने के लिए तैयार करना है जब ट्रैक थोड़ा ऊबड़-खाबड़ या हवादार हो जाए।

परिणाम: सुरक्षा जो बनी रहती है

शोधकर्ताओं ने बड़े भाषा मॉडलों (छात्रों) पर दो मुख्य परिदृश्यों में इसका परीक्षण किया:

  1. सुरक्षा प्रशिक्षण (Safety Training): उन्होंने मॉडलों को सुरक्षित होने के लिए प्रशिक्षित किया, फिर उन्हें गणित की समस्याओं (GSM8K) या सामान्य निर्देशों (Alpaca) पर फाइन-ट्यून करने की कोशिश की।

    • परिणाम: मानक प्रशिक्षण वाले मॉडल अपने सुरक्षा नियमों को भूल गए और खतरनाक हो गए। FRPO-प्रशिक्षित मॉडलों ने अपने सुरक्षा घेरे को बरकरार रखा और गणित सीखते समय भी अपनी सुरक्षात्मक क्षमता बनाए रखी। वे केवल "कम नहीं भूले"; उन्होंने नए कौशल सीखने के बाद भी बुरे अनुरोधों को "ना" कहने की अपनी क्षमता को बनाए रखा।
  2. गणित प्रशिक्षण (Math Training): उन्होंने गणित में कुशल मॉडल को कोडिंग सिखाने का प्रयास किया।

    • परिणाम: आमतौर पर, गणित विशेषज्ञ को कोडिंग सिखाने से वह गणित में कमजोर हो जाता है। हालाँकि, FRPO मॉडल कोडिंग सीखने के बाद भी गणित में अपनी सटीकता बहुत अधिक (लग लगभग 22% बेहतर) बनाए रखते हैं।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि मूल मॉडल को शुरू में ही कैसे प्रशिक्षित किया जाए (इसे "सपाट" और मजबूत बनाकर), इससे हमें बाद में जटिल और महंगे सुधारों की आवश्यकता नहीं होगी। हमें पुराने डेटा को सहेजने या "अभ्यास" करने की आवश्यकता नहीं है, और न ही मस्तिष्क के कुछ हिस्सों को लॉक करने के लिए विशेष सॉफ्टवेयर मॉड्यूल की आवश्यकता है। हम बस मॉडल को शुरुआत से ही मजबूत बनाते हैं।

संक्षेप में: FRPO एआई मॉडलों को एक ऐसा "सुरक्षित क्षेत्र" खोजने के लिए प्रशिक्षित करता है जो इतना चौड़ा हो कि वे बिना खाई में गिरे नई चीजें सीख सकें। यह एक ऐसे आधार के बारे में है जो घर में नया कमरा बनाने पर भी टूटता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →