← नवीनतम पेपर
🤖 machine learning

RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting

RAFT एक दो-चरणीय ढांचा है जो मॉडल-अनुकूल पुनर्लेखन के माध्यम से प्रशिक्षण डेटा को परिष्कृत करके और मॉडल की मूल सामान्य क्षमताओं को संरक्षित करते हुए इन-डोमेन प्रदर्शन में सुधार करने के लिए उत्तर-सशर्त ऑन-पॉलिसी डिस्टिलेशन (answer-conditioned on-policy distillation) का उपयोग करके डोमेन-विशिष्ट फाइन-ट्यूनिंग के दौरान होने वाली कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है।

मूल लेखक: Yuduo Li, Xiaofeng Shi, Qian Kou, Longbin Yu, Hua Zhou

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuduo Li, Xiaofeng Shi, Qian Kou, Longbin Yu, Hua Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विद्वान लाइब्रेरियन (AI मॉडल) है जो सब कुछ थोड़ा-बहुत जानता है: इतिहास, खाना बनाना, कोडिंग और कविता। यह लाइब्रेरियन सामान्य प्रश्नों के उत्तर देने में बहुत कुशल है।

अब, कल्पना कीजिए कि आप इस लाइब्रेरियन को विशेष रूप से कानून (Law) में विशेषज्ञ बनाने के लिए प्रशिक्षित करना चाहते हैं। आप उन्हें कानून की पाठ्यपुस्तकों का एक ढेर देते हैं और कहते हैं, "इसे सीखो!"

समस्या: "विशेषज्ञता का जाल" (The "Specialist Trap")
यदि आप केवल लाइब्रेरियन को इन कानून की किताबों को रटने के लिए मजबूर करते हैं (एक प्रक्रिया जिसे पेपर में Standard SFT कहा गया है), तो वे एक बेहतरीन वकील बन जाते हैं। लेकिन एक पेंच है। वे एक अच्छा सामान्य लाइब्रेरियन होना भूलने लगते हैं। वे कविता लिखना, सरल निर्देशों का पालन करना या मौसम के बारे में बात करना भूल सकते हैं। वे नए नियमों पर इतना अधिक ध्यान केंद्रित करने लगते हैं कि वे अपना मूल व्यक्तित्व और व्यापक ज्ञान खो देते हैं। इसे "विनाशकारी विस्मृति" (Catastrophic Forgetting) कहा जाता है।

यह पेपर तर्क देता है कि ऐसा मुख्य रूप से दो कारणों से होता है:

  1. "शैली का टकराव" (The "Style Clash"): कानून की किताबें एक कठोर, औपचारिक शैली में लिखी गई हैं जो लाइब्रेरियन के बात करने के सामान्य तरीके से मेल नहीं खातीं। उन्हें टेक्स्टबुक की तरह बोलने के लिए मजबूर करने से वे अजीब हो जाते हैं और उनका स्वाभाविक प्रवाह टूट जाता है।
  2. "एकतरफा रास्ता" (The "One-Way Street"): प्रशिक्षण केवल किताबों में दिए गए "सही" उत्तरों को देखता है। इसे इस बात की परवाह नहीं है कि यदि लाइब्रेरियन अपने दम पर किसी प्रश्न का उत्तर देने का प्रयास करता है तो वह भ्रमित हो जाता है या नहीं। यह एक ऐसे शिक्षक की तरह है जो केवल एक बहुविकल्पीय परीक्षा (multiple-choice test) पर छात्र को ग्रेड देता है, लेकिन कभी यह नहीं देखता कि वह समस्या को हल करने के लिए कैसे सोचता है।

समाधान: RAFT (एक "परिष्कृत और अनुकूलन योग्य" कोच)
लेखक RAFT नामक एक नया तरीका प्रस्तावित करते हैं। RAFT को एक दो-चरणीय कोचिंग कार्यक्रम के रूप में सोचें जिसे लाइब्रेरियन को इंसान बने रहना सिखाने के साथ-साथ कानून सिखाने के लिए डिज़ाइन किया गया है।

चरण 1: "अनुवादक" (डेटा रिफाइनमेंट - Data Refinement)

लाइब्रेरियन के पढ़ाई शुरू करने से पहले, RAFT एक अनुवादक के रूप में कार्य करता है।

  • समस्या: कानून की किताबें बहुत कठोर हैं।
  • समाधान: लाइब्रेरियन से उन कानून संबंधी उत्तरों को अपनी स्वयं की स्वाभाविक आवाज़ में फिर से लिखने के लिए कहा जाता है, जबकि तथ्यों को सही रखा जाता है।
  • फ़िल्टर: एक स्मार्ट संपादक जाँच करता है: "क्या लाइब्रेरियन ने शैली बदलते समय अर्थ बदल दिया है?" यदि उत्तर अभी भी सटीक है, तो पुनर्गठित संस्करण को रखा जाता है। यदि वह निरर्थक है, तो मूल संस्करण को रखा जाता है।
  • फ्यूजन (Fusion): अंत में, एक सुपर-स्मार्ट "फ्यूजन मॉडल" (जैसे एक वरिष्ठ संपादक) मूल कानून के उत्तर और लाइब्रेरियन द्वारा पुनर्गठित संस्करण को मिलाकर एक आदर्श, उच्च-गुणवत्ता वाला उत्तर बनाता है जो तथ्यात्मक रूप से सही और लाइब्रेरियन के लिए समझने में आसान दोनों है।

उपमा (Analogy): लाइब्रेरियन को एक शुष्क कानूनी अनुबंध पढ़ने के लिए मजबूर करने के बजाय, आप उन्हें एक "चीट शीट" देते हैं जो सरल अंग्रेजी में लिखी गई है लेकिन जिसमें सभी कानूनी तथ्य मौजूद हैं।

चरण 2: "शैडो कोच" (अनुकूलन योग्य डिस्टिलेशन - Adaptive Distillation)

अब, लाइब्रेरियन इन नए, मित्रवत चीट शीट्स का उपयोग करके अध्ययन शुरू करता है। लेकिन असली जादू यहाँ है:

  • परिदृश्य: लाइब्रेरियन अपने दम पर एक प्रश्न का उत्तर देने का प्रयास करता है (एक "ट्रैजेक्टरी" या विचारों का मार्ग उत्पन्न करता है)।
  • कोच: मूल लाइब्रेरियन (वह जो दुनिया के बारे में सब कुछ जानता है, न कि केवल कानून) इस प्रक्रिया को देखता है।
  • गुप्त हथियार: कोच को संदर्भ के रूप में "परफेक्ट चीट शीट" (चरण 1 से) दी जाती है। जब छात्र-लाइब्रेरियन अटक जाता है या रास्ते से भटक जाता है, तो कोच कहता है, "हे, जो तथ्य हमें पता हैं, उनके आधार पर, यहाँ इसे कहने का एक बेहतर तरीका है," लेकिन वे यह बहुत कोमलता से करते हैं।
  • संतुलन: कोच केवल "गलत" नहीं कहता। वे एक विशेष तकनीक (Top-K Temperature) का उपयोग करते हैं ताकि एक एकल उत्तर थोपने के बजाय कुछ अच्छे विकल्प सुझाए जा सकें। यह छात्र को रोबोटिक बनाने के बजाय रचनात्मक और विविध बनाए रखता है।
  • ऑटो-पायलट: सिस्टम स्वचालित रूप से यह तय करता है कि उसे "कानून" को कितना सुनना चाहिए बनाम "सामान्य ज्ञान" वाले कोच को कितना सुनना चाहिए। यदि छात्र बहुत अधिक कानून पर ध्यान केंद्रित कर रहा है और सामान्य कौशल भूल रहा है, तो कोच स्वचालित रूप से सामान्य ज्ञान की आवाज़ (volume) बढ़ा देता है।

उपमा (Analogy): कल्पना कीजिए कि एक छात्र रेस कार (कानून) चलाना सीख रहा है। एक मानक शिक्षक केवल चिल्लाता है, "लाल बत्ती पर बाएं मुड़ो!" (एक विशिष्ट चाल थोपना)। RAFT एक ड्राइविंग इंस्ट्रक्टर की तरह है जो बगल वाली सीट पर बैठा है, जिसके पास नक्शा (परिष्कृत डेटा) है, और छात्र का मार्गदर्शन करता है: "तुम बहुत तेज़ी से मुड़ रहे हो, याद रखो कि मुड़ने के दौरान अपने दर्पणों (सामान्य कौशल) की जाँच करना न भूलें।"

परिणाम

पेपर ने इसे तीन अलग-अलग प्रकार के "लाइब्रेरियन" (AI मॉडल्स) पर पाँच विषयों (कानून, विज्ञान, संस्कृति, आदि) में परखा।

  • काम में बेहतर: RAFT-प्रशिक्षित लाइब्रेरियन पुराने तरीके से प्रशिक्षित होने वालों की तुलना में कानून के सवालों के जवाब देने में 23% बेहतर थे।
  • बाकी चीज़ें नहीं भूलीं: महत्वपूर्ण रूप से, उन्होंने अपने सामान्य कौशल नहीं खोए। सामान्य तर्क और निर्देशों का पालन करने के परीक्षणों पर, उन्होंने उन कौशलों को 18% और 10% तक वापस प्राप्त किया जो आमतौर पर खो जाते हैं।

संक्षेप में:
RAFT एक प्रशिक्षण पद्धति है जो पहले कठिन नई जानकारी को उस भाषा में अनुवाद (translate) करती है जिसे AI पहले से समझता है, और फिर AI की सीखने की प्रक्रिया को निर्देशित करने के लिए एक स्मार्ट, अनुकूलित कोच का उपयोग करती है। यह सुनिश्चित करता है कि AI एक विशेषज्ञ बन जाए बिना एक सामान्यज्ञ (generalist) होने के अपने गुण खोए। यह किसी को एक नया पेशा सिखाने के बारे में है बिना उन्हें यह भुलाए कि एक इंसान कैसे बने रहना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →