Hint-Guided Diversified Policy Optimization for LLM Reasoning
यह शोध पत्र हिंट-गाइडेड डाइवर्सिफाइड पॉलिसी ऑप्टिमाइज़ेशन (HDPO) का प्रस्ताव देता है, जो एक दो-चरणीय ढांचा है जो मानव समस्या-समाधान की नकल करने के लिए "प्रपोज़-सेलेक्ट-थिंक" प्रक्षेपवक्र (ट्रैजेक्टरी) के माध्यम से विविध संभावित समाधान उत्पन्न करने और सबसे विश्वसनीय समाधान को चुनने द्वारा लार्ज लैंग्वेज मॉडल तर्क (रीज़निंग) को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Hint-Guided Diversified Policy Optimization (HDPO) for LLM Reasoning" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।
बड़ी समस्या: AI का "एक ही ढर्रे पर चलने वाला दिमाग" (One-Track Mind)
कल्पना कीजिए कि आप एक बहुत ही कठिन गणित की पहेली सुलझाने की कोशिश कर रहे हैं। यदि आप एक मानक लार्ज लैंग्वेज मॉडल (LLM) से इसे हल करने के लिए कहते हैं, तो यह अक्सर एक एकल-पथ वाली ट्रेन (single-track train) की तरह व्यवहार करता है। यह एक रास्ता चुनता है, पटरियों पर दौड़ना शुरू करता है, और तब तक चलता रहता है जब तक कि वह किसी दीवार से न टकरा जाए या अंत तक न पहुँच जाए।
समस्या यह है कि यदि यह शुरुआत में ही गलत पटरी चुन लेता है, तो इसे अपनी गलती का एहसास शायद ही कभी होता है। यह बस गलत रास्ते पर गणना करना जारी रखता है जब तक कि वह एक आत्मविश्वासपूर्ण लेकिन गलत उत्तर न दे दे। इसे ही शोध पत्र "सॉल्यूशन होमोजेनाइजेशन" (solution homogenization) कहता है—मॉडल सोचने के एक ही तरीके में फंस जाता है और अन्य संभावनाओं को देखने से इनकार कर देता है।
वर्तमान विधियाँ इसे ठीक करने की कोशिश करती हैं, लेकिन वे मॉडल को केवल तभी "पुरस्कार" देती हैं जब वह अंतिम उत्तर सही देता है। लेकिन यह एक छात्र को यह बताने जैसा है कि, "तुम्हें स्वर्ण पदक तभी मिलेगा जब तुम 100% अंक लाओगे," बिना यह बताए कि उन्हें कैसे पढ़ाई करनी चाहिए या उन्हें अलग-अलग अध्ययन विधियों को आज़माने के लिए प्रोत्साहित किए बिना। यदि वे असफल होते हैं, तो उन्हें पता नहीं चलता कि क्या गलत हुआ, और वे अगली बार भी वही गलत उत्तर देने का अनुमान लगा सकते हैं।
समाधान: "प्रपोज़-सेलेक्ट-थिंक" (Propose-Select-Think) रणनीति
इस शोध पत्र के लेखकों ने एक नई प्रशिक्षण विधि प्रस्तावित की है जिसे HDPO (हिंट-गाइडेड डाइवर्सिफाइड पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। वे AI को एक मानव विशेषज्ञ की तरह सोचना सिखाते हैं: प्रपोज़ (प्रस्ताव), सेलेक्ट (चुनना), और थिंक (सोचना)।
कल्पना कीजिए कि एक जासूस अपराध सुलझा रहा है। सीधे एक सिद्धांत पर कूदने के बजाय, एक अच्छा जासूस:
- प्रपोज़ (Propose): कई अलग-अलग संदिग्धों या सिद्धांतों की सूची बनाता है (जैसे, "शायद यह बटलर था," "शायद यह माली था," या "शायद यह लूटपाट का मामला था")।
- सेलेक्ट (Select): सबूतों को देखता है और आगे की जांच के लिए सबसे आशाजनक सिद्धांत को चुनता है।
- थिंक (Think): मामले को सुलझाने के लिए उसी विशिष्ट सिद्धांत में गहराई से उतर जाता है।
HDPO AI को बिल्कुल यही करने के लिए मजबूर करता है। गणित की समस्या को हल करना शुरू करने से पहले, उसे विभिन्न संभावित रणनीतियों (हिंट्स) की एक सूची लिखनी होगी। फिर, उसे उस सूची में से सबसे अच्छे को चुनना होगा और फिर वास्तव में गणित करना होगा।
यह कैसे काम करता है: प्रशिक्षण के दो चरण
शोध पत्र इस नए तरीके से सोचने के तरीके को सिखाने के लिए दो-चरणीय प्रक्रिया का वर्णन करता है:
चरण 1: "कोल्ड स्टार्ट" (स्क्रिप्ट सीखना)
सबसे पहले, AI को यह सीखना होगा कि विचारों की सूची कैसे लिखी जाए और उनमें से एक को कैसे चुना जाए। शोधकर्ता इस "प्रपोज़-सेलेक्ट-थिंक" प्रक्रिया के उदाहरण उत्पन्न करने के लिए एक सुपर-स्मार्ट AI (एक "शिक्षक") का उपयोग करते हैं।
- फ़िल्टर (The Filter): वे केवल किसी भी उदाहरण का उपयोग नहीं करते हैं। वे दो चीजें जाँचते हैं:
- सत्यता (Correctness): क्या अंतिम उत्तर सत्य से मेल खाता है?
- विश्वसनीयता (Reliability): क्या AI ने अपनी सूची से सही रणनीति चुनी? (उदाहरण के लिए, यदि सूची में एक "बुरा" विचार और एक "अच्छा" विचार था, तो क्या AI ने अच्छे वाले को चुना?)
- परिणाम: AI को इन उच्च-गुणवत्ता वाले उदाहरणों पर प्रशिक्षित किया जाता है ताकि वह इस नए सोचने के तरीके के ढांचे को सीख सके।
चरण 2: सुदृढीकरण सीखना (Reinforcement Learning - "खोज का खेल")
एक बार जब AI ढांचा जान जाता है, तो वे इसे बेहतर होने के लिए एक खेल खेलने देते हैं। वे इसे अच्छे व्यवहार के लिए प्रोत्साहित करने के लिए दो विशेष "पुरस्कार" (पॉइंट्स) देते हैं:
विविधता पुरस्कार (The Diversity Reward - "विविधता के अंक"):
- लक्ष्य: यदि AI के सभी संभावित विचार एक जैसे दिखते हैं, तो उसे दंडित किया जाता है।
- उपमा: कल्पना कीजिए कि एक शेफ को अंडे पकाने के 5 तरीके बताने के लिए कहा गया है। यदि शेफ "फ्राई," "फ्राई," "फ्राई," "फ्राई," और "फ्राई" लिखता है, तो उसे शून्य अंक मिलते हैं। लेकिन यदि वे "फ्राई," "उबला हुआ," "स्कैम्बल्ड," "पोच्ड," और "ऑमलेट" लिखते हैं, तो उन्हें बोनस अंक मिलते हैं।
- क्यों? यह AI को विभिन्न समाधान क्षेत्रों (solution space) को खोजने के लिए मजबूर करता है ताकि वह एक ही ढर्रे में न फंसा रहे।
विश्वसनीयता पुरस्कार (The Reliability Reward - "आत्मविश्वास के अंक"):
- लक्ष्य: AI को अंक मिलते हैं यदि वह काम करने के लिए अपनी सूची में से सर्वश्रेष्ठ विचार चुनता है।
- ट्रिक: वे बिना समस्या को दोबारा हल किए यह कैसे जानते हैं कि कौन सा विचार सबसे अच्छा है? वे AI के आत्मविश्वास (confidence) को देखते हैं (कि वह अपने शब्दों के बारे में कितना आश्वस्त है)। यदि AI किसी विशिष्ट विचार के बारे में बहुत आश्वस्त है, तो इसकी संभावना है कि वह एक अच्छा विचार है।
- पुरस्कार: यदि AI उस विचार को चुनता है जिसके बारे में वह सबसे अधिक आश्वस्त है, तो उसे अंक मिलते हैं। यह AI को एक रास्ता चुनने के लिए अपने "अंतर्ज्ञान" (gut feeling) पर भरोसा करना सिखाता है।
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे गणित प्रतियोगिताओं में) पर इस पद्धति का परीक्षण किया।
- "हिट रेट" टेस्ट: उन्होंने AI को सीमित संख्या में प्रयासों (जैसे केवल 1 या 2 अनुमान लगाने की अनुमति) के साथ समस्याओं को हल करने के लिए कहा।
- परिणाम: मानक AI मॉडल (जैसे GRPO) जब केवल एक या दो प्रयासों के साथ थे, तो बुरी तरह विफल रहे क्योंकि वे गलत रास्ते पर फंस गए थे। हालाँकि, HDPO, बहुत कम प्रयासों के साथ भी सही उत्तर प्राप्त करने में सफल रहा।
- क्यों? क्योंकि HDPO ने केवल अनुमान नहीं लगाया; इसने कई रास्तों को देखा, सही रास्ते को चुना और फिर उसे हल किया। यह बहुत अधिक "फॉल्ट-टॉलरेंट" (त्रुटि सहिष्णु) था।
एक वाक्य में सारांश
यह शोध पत्र एक प्रशिक्षण विधि पेश करता है जो AI मॉडलों को संभावित समाधानों की सूची बनाने, सबसे अच्छे को चुनने और फिर उसे हल करने के लिए सिखाती है, जो उन्हें उन मॉडलों की तुलना में बहुत अधिक स्मार्ट और विश्वसनीय बनाती है जो केवल अनुमान लगाकर आगे बढ़ जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।