← नवीनतम पेपर
🤖 AI

Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

यह शोध पत्र DMPO को प्रस्तुत करता है, जो एक वितरण-मिलान नीति अनुकूलन (distribution-matching policy optimization) विधि है जो नीति को रिवॉर्ड-अनुपातिक लक्ष्य वितरण के साथ संरेखित करके ऑन-पॉलिसी सुदृढीकरण शिक्षण (on-policy reinforcement learning) में मोड कोलैप्स (mode collapse) को कम करती है, जिससे अन्वेषण (exploration) बना रहता है और NP-हार्ड ऑप्टिमाइज़ेशन और गणितीय तर्क जैसे विविध तर्क कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li, Yongkang Chen, Yichuan Ma, Tianyi Lyu, Linyang Li, Dahua Lin, Qipeng Guo, Qingwen Liu, Kai Chen

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li, Yongkang Chen, Yichuan Ma, Tianyi Lyu, Linyang Li, Dahua Lin, Qipeng Guo, Qingwen Liu, Kai Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Beyond Mode Collapse: Distribution Matching for Diverse Reasoning" का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "एक ही सुर वाला" जीनियस (The "One-Note" Genius)

कल्पना कीजिए कि आप एक छात्र (AI) को एक जटिल पहेली हल करना सिखा रहे हैं, जैसे कि 20 अलग-अलग शहरों की यात्रा करने के लिए सबसे छोटा रास्ता खोजना (एक क्लासिक गणितीय समस्या)।

अतीत में, जब हमने इन AI छात्रों को मानक तरीकों (जैसे GRPO) का उपयोग करके प्रशिक्षित किया, तो वे अक्सर "मोड कोलैप्स" (Mode Collapse) नामक एक जाल में फंस जाते थे।

यह इस प्रकार होता है:

  1. छात्र कई अलग-अलग रास्ते आज़माता है।
  2. शुद्ध भाग्य से, उसे एक ऐसा रास्ता मिल जाता है जो "काफी अच्छा" है और उसे उच्च स्कोर मिलता है।
  3. शिक्षक कहता है, "बहुत बढ़िया! बस यही दोबारा करो!"
  4. छात्र कुछ भी नया करने से डरने लगता है। वह अन्वेषण (exploring) करना बंद कर देता है। उसे एहसास होता है, "अगर मैं इसी एक रास्ते पर टिका रहता हूँ, तो मुझे इनाम मिलेगा। अगर मैं कुछ नया आज़माता हूँ, तो मैं असफल हो सकता हूँ।"
  5. परिणाम: छात्र रचनात्मक होना बंद कर देता है। वह केवल उस एक "काफी अच्छे" रास्ते को ही बार-बार दोहराता है, भले ही कोई "सर्वश्रेष्ठ" रास्ता मौजूद हो। उसने सीखना छोड़ दिया है और केवल दोहराना शुरू कर दिया है।

शोध पत्र का तर्क है कि ऐसा इसलिए होता है क्योंकि AI द्वारा उपयोग किया जाने वाला गणित (जिसे Reverse KL कहा जाता है) स्वाभाविक रूप से "लालची" (greedy) है। इसे केवल पहले मिले अच्छे उत्तर की परवाह होती है और यह बाकी सब कुछ अनदेखा कर देता है।

समाधान: "समूह का वोट" (The "Group Vote" - DMPO)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे DMPO (डिस्ट्रीब्यूशन-मैचिंग पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। केवल अब तक मिले सबसे अच्छे उत्तर को पुरस्कृत करने के बजाय, DMPO खेल के नियमों को बदल देता है ताकि छात्र जिज्ञासु बना रहे।

उपमा: टैलेंट शो बनाम एकल प्रदर्शन (The Talent Show vs. The Solo Act)

  • पुराना तरीका (GRPO): कल्पना कीजिए कि एक टैलेंट शो है जहाँ जज केवल उस एक व्यक्ति को पुरस्कार देते हैं जो सबसे ज़ोर से गाता है। एक बार वह व्यक्ति मिल जाने के बाद, जज बाकी सभी को सुनना बंद कर देते हैं। अन्य गायक घर चले जाते हैं, और शो उबाऊ हो जाता है।
  • नया तरीका (DMPO): कल्पना कीजिए कि जज एक साथ गायकों के पूरे समूह को देखते हैं। वे कहते हैं, "ठीक है, हमारे पास 8 गायक हैं। आइए हम उन सभी को अंक दें, लेकिन बेहतर गायकों को अधिक अंक और ठीक-ठाक गायकों को कम अंक दें। महत्वपूर्ण बात यह है कि जब तक वे बहुत खराब न हों, किसी को भी शून्य अंक नहीं मिलेंगे।"

ऐसा करके, AI को विभिन्न अच्छे समाधानों का एक "पोर्टफोलियो" बनाए रखने के लिए प्रोत्साहित किया जाता है। यह सीखता है कि केवल एक सही उत्तर नहीं होता, बल्कि समस्या को हल करने के कई अलग-अलग तरीके होते हैं, और उसे उन सभी को तलाशते रहना चाहिए।

उन्होंने इसका परीक्षण कैसे किया: "NP-Bench" प्लेग्राउंड

इसे सिद्ध करने के लिए, शोधकर्ताओं ने एक विशेष परीक्षण मैदान बनाया जिसे MM-NP-Bench कहा जाता है।

इसे 10 अलग-अलग प्रकार के कठिन बाधा कोर्स (जैसे पहेलियाँ, ग्राफ कलरिंग और पाथफाइंडिंग) वाले एक जिम के रूप में समझें।

  • टेक्स्ट वर्शन: बाधाओं का वर्णन शब्दों में किया गया है।
  • विजुअल वर्शन: बाधाओं को चित्रों (ग्राफ, मानचित्र, आकृतियों) के रूप में दिखाया गया है।

उन्होंने यह देखने के लिए इनका उपयोग किया कि क्या AI सबसे अच्छा समाधान खोज सकता है या केवल एक "काफी अच्छा" समाधान। उन्होंने दो चीजें मापीं:

  1. सफलता दर (Success Rate): क्या AI बिना दुर्घटना के कोर्स पूरा कर पाया? (क्या उसने नियमों का पालन किया?)
  2. गुणवत्ता अनुपात (Quality Ratio): अंतिम समय (finish time) परफेक्ट रिकॉर्ड के कितने करीब था? (क्या उसने अनुकूलन/optimize किया?)

परिणाम:
पुराना AI (GRPO) नियमों का पालन करने में अच्छा था (उच्च सफलता दर) लेकिन अक्सर औसत दर्जे के समाधानों पर अटक जाता था (कम गुणवत्ता अनुपात)। यह एक ऐसे धावक की तरह था जो दौड़ पूरी तो करता है लेकिन गोल-गोल घूमता रहता है।
नया AI (DMPO) न केवल नियमों का पालन करता है बल्कि बहुत तेज़ और बेहतर रास्ते भी खोजता है। इसने पुराने तरीके की तुलना में समाधानों की गुणवत्ता में 9% से 12% तक सुधार किया।

यह क्यों मायने रखता है (शोध पत्र के अनुसार)

शोध पत्र का दावा है कि AI को अपने मन में समाधानों का एक "विविध" (diverse) सेट रखने के लिए मजबूर करके, यह सामान्य रूप से बेहतर तर्क करने में सक्षम हो जाता है।

  • गणित: यह गणित की समस्याओं को हल करने में बेहतर हो गया क्योंकि यह पहले मिले समाधान पर अटकने के बजाय विभिन्न प्रमाण रणनीतियों (proof strategies) को खोजने में सक्षम था।
  • आउट ऑफ द बॉक्स: उन कार्यों पर परीक्षण किए जाने के बावजूद जिन पर इसे विशेष रूप से प्रशिक्षित नहीं किया गया था (जैसे सामान्य तर्क पहेलियाँ), इसने बेहतर प्रदर्शन किया।

सारांश

शोध पत्र कहता है: "अपने AI को बहुत जल्दी केवल एक 'विजेता' चुनने के लिए मजबूर करना बंद करें। इसके बजाय, एक 'समूह वोट' प्रणाली का उपयोग करें जो विविध अच्छे समाधानों को पुरस्कृत करती है। यह AI को आलसी होने और एक ही उत्तर पर अटक जाने से रोकता है, जिससे अधिक स्मार्ट, अधिक रचनात्मक और अधिक मजबूत तर्क क्षमता आती है।"

मुख्य निष्कर्ष: विविधता केवल एक अच्छी चीज़ नहीं है; यह केवल पहला समाधान खोजने के बजाय सर्वश्रेष्ठ समाधान खोजने का गुप्त मंत्र है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →