← नवीनतम पेपर
💬 NLP

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

यह शोध पत्र "पॉलिसी स्प्लिट" (Policy Split) का प्रस्ताव करता है, जो एक नया प्रतिमान (paradigm) है जो एक लार्ज लैंग्वेज मॉडल की पॉलिसी को सामान्य और उच्च-एन्ट्रॉपी मोड में विभाजित करता है, जो पैरामीटर्स साझा करते हैं लेकिन कार्य सटीकता से समझौता किए बिना विविध अन्वेषण को बढ़ाने के लिए सहयोगात्मक दोहरे-मोड एन्ट्रॉपी नियमितीकरण (collaborative dual-mode entropy regularization) के साथ अनुकूलित होते हैं।

मूल लेखक: Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान छात्र (Large Language Model) है जो गणित की समस्याओं को हल करने और सख्त नियमों का पालन करने में अविश्वसनीय रूप से कुशल है। हालाँकि, यह छात्र थोड़ा "रोबोटिक" हो गया है: वे उत्तर तक पहुँचने के लिए हमेशा एक ही सटीक मार्ग अपनाते हैं, कभी गलती नहीं करते, लेकिन कभी लीक से हटकर नहीं सोचते। वे सटीक तो हैं, लेकिन उनमें रचनात्मकता का अभाव है।

अब, कल्पना कीजिए कि आप इस छात्र को एक ही समय में दोनों—एक सख्त मुनीम (पूर्णतः सटीक) और एक उन्मत्त कलाकार (रचनात्मक और विविध)—बनने के लिए सिखाना चाहते हैं।

समस्या यह है कि यदि आप छात्र को कहते हैं, "अधिक रचनात्मक बनो!" तो वे इतने उत्साहित हो सकते हैं कि वे बेतुकी बातें (hallucinations) करने लगें, जिससे उनकी सटीकता खो जाए। यदि आप उन्हें कहते हैं, "अधिक सटीक बनो!" तो वे इतने कठोर हो सकते हैं कि वे नए विचारों की खोज करना ही छोड़ दें।

यही वह दुविधा है जिसे "पॉलिसी स्प्लिट" (Policy Split) नामक शोध पत्र हल करता है। यह यहाँ कैसे काम करता है, इसके सरल उदाहरण दिए गए हैं:

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

अतीत में, शोधकर्ताओं ने AI को अधिक स्मार्ट बनाने के लिए उसके प्रशिक्षण में "रचनात्मकता बोनस" जोड़ने का प्रयास किया।

  • उदाहरण: कल्पना कीजिए कि एक शेफ को कहा जाता है, "सबसे अच्छा व्यंजन बनाएँ, लेकिन साथ ही जितना हो सके उतना अजीब और प्रयोगात्मक होने की कोशिश करें।"
  • परिणाम: शेफ भ्रमित हो जाता है। वे या तो ऐसा व्यंजन बना सकते हैं जो इतना अजीब हो कि खाने योग्य ही न रहे (उच्च एंट्रॉपी, कम सटीकता), या वे डर जाते हैं और हर बार वही पुराना व्यंजन बनाते हैं (कम एंट्रॉपी, कम रचनात्मकता)। दोनों लक्ष्य आपस में लड़ते हैं।

समाधान: "पॉलिसी स्प्लिट" (दो टोपी वाली रणनीति)

लेखक एक चतुर तरकीब प्रस्तावित करते हैं: एक समय में दो चीजें बनने की कोशिश न करें। इसके बजाय, छात्र को दो अलग-अलग "मोड" में विभाजित करें जो एक ही मस्तिष्क साझा करते हैं लेकिन अलग-अलग टोपियाँ पहनते हैं।

1. दो टोपियाँ

AI मॉडल को दो अलग-अलग टोपियाँ पहनने के लिए प्रशिक्षित किया जाता है, जिसे एक सरल निर्देश (प्रॉम्ट) द्वारा नियंत्रित किया जाता है:

  • "सामान्य मोड" की टोपी (मुनीम/Accountant): जब AI यह टोपी पहनता है, तो उसे कहा जाता है: "केवल उत्तर सही प्राप्त करने पर ध्यान केंद्रित करें। सटीक रहें, सुरक्षित रहें और जोखिम न लें।" इसका एकमात्र लक्ष्य सटीकता है।
  • "हाई-एंट्रॉपी मोड" की टोपी (कलाकार/Artist): जब AI यह टोपी पहनता है, तो उसे कहा जाता है: "आप 'हाई एंट्रॉपी' मोड में हैं! आपका काम अजीब विचार खोजना, अलग दृष्टिकोण आजमाना और रचनात्मक होना है। बस यह सुनिश्चित करें कि आप अपना मानसिक संतुलन न खो दें।" इसका लक्ष्य विविध होना और नए रास्तों की खोज करना है।

2. गुप्त सूत्र: सहयोगात्मक प्रशिक्षण

यहाँ जादू वाला हिस्सा है। भले ही वे अलग-अलग टोपियाँ पहने हुए हों, वे एक ही व्यक्ति हैं। वे एक ही मस्तिष्क (मॉडल पैरामीटर्स) साझा करते हैं।

  • टीम वर्क: "कलाकार" एक पागलपन भरा, रचनात्मक समाधान खोजने की कोशिश करता है। यदि वे गलती से एक सही उत्तर खोज लेते हैं जिसे "मुनीम" कभी नहीं सोच पाता, तो "मुनीम" उससे सीखता है!
  • सुरक्षा जाल: इसके विपरीत, "मुनीम" स्थिर और सही उत्तर प्रदान करता है। यदि "कलाकार" पटरी से उतरने लगता है और बेतुकी बातें करने लगता है, तो "मुनीम" उन्हें वापस खींच लेता है, यह सुनिश्चित करते हुए कि "कलाकार" पूरी तरह से बेकार न हो जाए।

यह एक जैज़ (Jazz) जोड़ी की तरह है: एक संगीतकार एक स्थिर, अनुमानित लय बजाता है (मुनीम), जबकि दूसरा जंगली,ะ improvisational सोलो बजाता है (कलाकार)। वे एक-दूसरे को सुनते हैं। लय गीत को जमीन से जोड़े रखती है, और सोलो इसे रोमांचक बनाता है।

यह एक बड़ी बात क्यों है

यह शोध पत्र दिखाता है कि यह तरीका पिछले प्रयासों की तुलना में बेहतर काम करता है:

  1. कोई समझौता नहीं: आपको बुद्धिमान होने या रचनात्मक होने में से किसी एक को चुनने की आवश्यकता नहीं है। AI दोनों हो सकता है, यह इस पर निर्भर करता है कि आपने उस पर कौन सी "टोपी" रखी है।
  2. चमक को पुनर्जीवित करना: कई आधुनिक AI मॉडल बहुत कठोर (कम एंट्रॉपी) हो गए हैं। यह तरीका उन्हें "जगा देता है", जिससे वे अपनी गणितीय समस्याओं को हल करने की क्षमता खोए बिना फिर से अन्वेषण करने लगते हैं।
  3. बेहतर परिणाम: परीक्षणों में, "कलाकार" मोड ने बहुत अधिक रचनात्मक कहानियाँ बनाईं और कठिन समस्याओं के अनूठे समाधान खोजे, जबकि "मुनीम" मोड ने अपनी उच्च सटीकता बनाए रखी।

निष्कर्ष

पॉलिसी स्प्लिट एक AI को "स्विच" देने जैसा है।

  • स्विच को नॉर्मल (Normal) पर घुमाएँ, और आपको एक विश्वसनीय, तथ्य-जाँच करने वाला विशेषज्ञ मिलता है।
  • स्विच को हाई एंट्रॉपी (High Entropy) पर घुमाएँ, और आपको एक रचनात्मक, लीक से हटकर सोचने वाला विचारक मिलता है।

उन्हें एक साथ प्रशिक्षित करके, वे एक-दूसरे की खूबियों से सीखते हैं, जिसके परिणामस्वरूप एक अधिक स्मार्ट, अधिक लचीला और अधिक मानव जैसा AI बनता है जिसे रचनात्मकता के लिए सटीकता का त्याग करने की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →