GraphPO: Graph-based Policy Optimization for Reasoning Models
GraphPO एक नवीन ग्राफ-आधारित सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो तर्क संबंधी रोलआउट्स (reasoning rollouts) को निर्देशित अचक्रीय ग्राफ़ (directed acyclic graphs) के रूप में प्रदर्शित करता है ताकि अर्थपूर्ण रूप से समान पथों को मिलाया जा सके और शाखाओं के बीच सूचना साझा की जा सके, जिससे अनावश्यक अन्वेषण और एडवांटेज-एस्टिमेशन वेरिएंस (advantage-estimation variance) को कम किया जा सके और तर्क संबंधी बेंचमार्क पर मौजूदा चेन- और ट्री-आधारित विधियों से बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े दोहराव वाले छात्र को एक जटिल गणितीय समस्या हल करना या कोड का एक टुकड़ा लिखना सिखा रहे हैं। आप उन्हें चरण-दर-चरण निर्देश नहीं देते; इसके बजाय, आप उन्हें अलग-अलग दृष्टिकोण आज़माने देते हैं, और आप उन्हें अंत में केवल इतना बताते हैं: "सही!" या "गलत।"
इस तरह से वर्तमान AI मॉडल (जिन्हें लार्ज रीजनिंग मॉडल्स कहा जाता है) सीखते हैं। वे अनुमान लगाते हैं, अनुमान लगाते हैं, और अनुमान लगाते हैं जब तक कि उन्हें सही उत्तर न मिल जाए। लेकिन इस पद्धति के साथ दो बड़ी समस्याएँ हैं, जिन्हें पेपर GraphPO ठीक करने का लक्ष्य रखता है।
समस्या: "अकेला खोजकर्ता" और "शाखाओं वाला पेड़"
1. बर्बाद हुई मेहनत (चेन विधि/Chain Method)
कल्पना कीजिए कि आप 100 छात्रों को एक भूलभुलैया में भेजते हैं। प्रत्येक छात्र एक पूरी तरह से अलग रास्ता चलता है।
- समस्या: भले ही वे अलग-अलग रास्तों पर हों, 50 छात्र एक ही डेड एंड (बंद रास्ते) में फंस सकते हैं या एक ही भ्रमित करने वाले गलियारे से गुजर सकते हैं। वे बार-बार एक ही चीज़ करके अपना समय और ऊर्जा बर्बाद कर रहे हैं। AI के संदर्भ में, यह "दोहराव वाली खोज" (redundant exploration) है।
2. "पेड़" विधि (सुधार, लेकिन पूर्ण नहीं) (The "Tree" Method)
इस बर्बादी को ठीक करने के लिए, शोधकर्ताओं ने एक "पेड़" विधि का प्रयास किया। कल्पना कीजिए कि छात्र एक साथ शुरू करते हैं, और रास्ते के पहले मोड़ पर, वे अलग हो जाते हैं। यदि दो छात्र एक ही पहला मोड़ लेते हैं, तो वे कुछ समय के लिए साथ चलते हैं।
- समस्या: यह थोड़ा मदद करता है, लेकिन एक बार जब वे दूसरे मोड़ पर अलग हो जाते हैं, तो वे फिर से अपने आप में खो जाते हैं। यदि पेड़ की दो अलग-अलग शाखाएं अंततः एक ही भ्रमित करने वाले गलियारे की ओर ले जाती हैं (भले ही वे वहां तक अलग-अलग रास्तों से पहुँची हों), तो छात्रों को पता नहीं चलता कि वे एक ही स्थान पर हैं। वे उस गलियारे को अलग-अलग एक्सप्लोर करना जारी रखते हैं, जिससे समय अधिक बर्बाद होता है। वे "अच्छी खबर" भी साझा नहीं कर सकते यदि एक छात्र उस गलियारे से बाहर निकलने का रास्ता खोज लेता है; अन्य छात्र अनुमान लगाना जारी रखते हैं।
समाधान: "स्मार्ट मैप" (GraphPO)
लेखक GraphPO का प्रस्ताव देते हैं, जो केवल एक पेड़ देने के बजाय छात्रों को एक जीवंत, साझा मानचित्र (Map) देने जैसा है।
यह कैसे काम करता है:
- मानचित्र (The Map): केवल रेखाएं (शाखाएं) खींचने के बजाय, AI एक ऐसा मानचित्र बनाता है जहाँ प्रत्येक "कमरा" (तर्क का एक चरण) एक नोड (node) है।
- जुड़वा पहचानना (Semantic Merging): जैसे-जैसे AI खोज करता है, वह उन "कमरों" को देखता है जहाँ विभिन्न पथ पहुँचे हैं। यदि दो अलग-अलग पथ एक ऐसे कमरे में पहुँचते हैं जो एक जैसा महसूस होता है (भले ही वहां तक पहुँचने के लिए उपयोग किए गए शब्द थोड़े अलग हों), तो AI कहता है, "हे, आप दोनों एक ही जगह पर हैं!" और उन्हें मानचित्र पर एक एकल स्थान में मिला देता है।
- अच्छी खबर साझा करना (Suffix Sharing): एक बार जब दो पथ आपस में मिल जाते हैं, तो वे उसके बाद का सब कुछ साझा करते हैं। यदि एक पथ उस विलय किए गए स्थान से सही उत्तर खोज लेता है, तो दूसरे पथ को बिना दोबारा रास्ता चले तुरंत सफलता का श्रेय मिल जाता है।
- "दक्षता" बोनस (The "Efficiency" Bonus): AI एक विशिष्ट "कमरे" तक पहुँचने के लिए सबसे छोटे पथ को प्राथमिकता देना भी सीखता है। यदि पथ A को एक अच्छे स्थान तक पहुँचने में 10 कदम लगते हैं, और पथ B को उसी स्थान तक पहुँचने में 15 कदम लगते हैं, तो AI पथ A को प्राथमिकता देना सीखता है। यह शॉर्टकट लेने वाले छात्र को पुरस्कृत करने जैसा है।
परिणाम: स्मार्ट, तेज़ और कम बर्बादी वाला
इस "स्मार्ट मैप" दृष्टिकोण का उपयोग करके, GraphPO तीन मुख्य चीजें हासिल करता है:
- कोई भी कदम बर्बाद नहीं होता: यह AI को एक ही डेड एंड को दोबारा एक्सप्लोर करने से रोकता है। यह अपनी "बजट" (कंप्यूटिंग पावर) को पुराने को दोहराने के बजाय नए क्षेत्रों को खोजने की ओर मोड़ देता है।
- गलतियों से बेहतर सीखना: क्योंकि यह समान पथों को मिलाता है, यह AI को बहुत पहले ही बता सकता है कि "यह विशिष्ट चरण अच्छा था," भले ही अंतिम उत्तर अभी तक सटीक न हुआ हो। यह एक अस्पष्ट "आपने अंत में सही किया" को एक स्पष्ट "यह विशिष्ट चाल समझदारी भरी थी" में बदल देता है।
- छोटे उत्तर: चूंकि यह समाधान तक पहुँचने के लिए सबसे छोटे पथ को पुरस्कृत करता है, इसलिए AI संक्षिप्त और कुशल होना सीखता है, अनावश्यक बातों को हटा देता है।
निचोड़ (The Bottom Line)
पेपर ने गणितीय समस्याओं, कोडिंग और खोज कार्यों पर तीन अलग-अलग AI मॉडलों का परीक्षण किया। परिणामों ने दिखाया कि GraphPO लगातार पुराने तरीकों (दोनों अकेले खोजकर्ता और शाखाओं वाले पेड़) को पछाड़ देता है। इसने समान कंप्यूटिंग पावर का उपयोग करते हुए अधिक समस्याओं को हल किया, उन्हें करने के लिए कम शब्दों का उपयोग किया और तेजी से सीखा।
संक्षेप में, GraphPO AI को गोल-गोल घूमना बंद करने और एक साझा मानचित्र का उपयोग करना सिखाता है, जिससे सीखने की प्रक्रिया बहुत अधिक स्मार्ट और कम बर्बादी वाली बन जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।