← नवीनतम पेपर
💬 NLP

Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO

यह शोध पत्र सैद्धांतिक और अनुभवजन्य रूप से यह प्रदर्शित करता है कि GRPO में, प्रत्येक विचार (thought) प्रति नमूना लिए गए उत्तरों की संख्या (ब्रांचिंग) को बढ़ाना, विचार-स्तरीय लाभ अनुमान (thought-level advantage estimation) में विचलन (variance) को समाप्त करने के लिए एक आवश्यक तंत्र है, जबकि केवल नमूने लिए गए विचारों की संख्या बढ़ाना इसे प्राप्त नहीं कर सकता है, जिससे ब्रांचिंग को स्थिर और कुशल तर्क अनुकूलन (reasoning optimization) के लिए अनिवार्य स्थापित किया गया है।

मूल लेखक: Hongcheng Wang, Yinuo Huang, Sukai Wang, Guanghui Ren, Hao Dong

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongcheng Wang, Yinuo Huang, Sukai Wang, Guanghui Ren, Hao Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े घबराहट वाले रोबोट को पहेलियाँ सुलझाना सिखा रहे हैं। रोबोट केवल आपको उत्तर नहीं देता; वह पहले अपना "विचार प्रक्रिया" (एक रफ नोटबुक की तरह) लिखता है और फिर अंतिम उत्तर देता है। बेहतर होने के लिए, रोबोट एक खेल खेलता है: वह एक ही पहेली को हल करने के कई अलग-अलग तरीके आज़माता है, प्रत्येक प्रयास के लिए एक स्कोर प्राप्त करता है, और अपने सबसे अच्छे और सबसे खराब प्रयासों के बीच के अंतर से सीखता है।

यह शोध पत्र इस बारे में है कि हम इस रोबोट को कैसे सिखाते हैं: हम यह कैसे जान सकते हैं कि रोबोट की विचार प्रक्रिया अच्छी थी, अंतिम उत्तर देने से पहले भी?

समस्या: "एक बार में एक ही कोशिश" वाला अनुमान

मानक विधि (जिसे GRPO कहा जाता है) में, रोबोट को एक पहेली दी जाती है, वह एक विचार लिखता है, और फिर उसी विचार के आधार पर एक उत्तर उत्पन्न करता है।

  • दोष: यदि वह एकल उत्तर भाग्यशाली या दुर्भाग्यपूर्ण होता है, तो रोबोट को भ्रामक स्कोर मिलता है। उसे लग सकता है कि एक बुरा विचार बहुत अच्छा था क्योंकि उसे एक भाग्यशाली उत्तर मिल गया, या इसके विपरीत। यह "शोर" (noise) रोबोट की सीखने की प्रक्रिया को अस्थिर और धीमा बना देता है। यह एक शेफ की रेसिपी को केवल एक सिंगल कुकी चखकर आंकने जैसा है जो उन्होंने बनाई है। यदि वह कुकी जल गई, तो आप सोच सकते हैं कि रेसिपी खराब थी, भले ही रेसिपी वास्तव में एकदम सही रही हो।

प्रस्तावित समाधान: "टेस्ट-टेस्ट" ब्रांचिंग (शाखा बनाना)

लेखक एक सरल बदलाव का सुझाव देते हैं: ब्रांचिंग (Branching)।
एक विचार लिखने और एक कुकी बेक करने के बजाय, रोबotong एक विचार लिखता है लेकिन फिर उसी विचार के आधार पर कई कुकीज़ (उत्तर) बेक करता है।

  • उपमा: कल्पना करें कि विचार एक रेसिपी है, और उत्तर कुकीज़ हैं।
    • पुराना तरीका: एक रेसिपी लिखें, एक कुकी बेक करें। यदि कुकी जल गई, तो आपको पता नहीं चलेगा कि रेसिपी खराब थी या आपने बस ओवन का तापमान गलत सेट कर दिया था।
    • नया तरीका (GRPO-MA): एक रेसिपी लिखें, चार कुकीज़ बेक करें। यदि तीन बेहतरीन हैं और एक जली हुई है, तो आप जानते हैं कि रेसिपी अच्छी है! आप उस रेसिपी (विचार) के वास्तविक स्तर को मापने के लिए चार कुकीज़ के स्कोर का औसत निकाल सकते हैं।

बड़ी खोज: यह अधिक रेसिपी के बारे में नहीं है, यह अधिक कुकीज़ के बारे में है

शोध पत्र की सबसे महत्वपूर्ण खोज एक विरोधाभासी गणितीय सत्य है कि इस "शोर" को कैसे कम किया जाए:

  1. अधिक विचार जोड़ना (अधिक रेसिपी): यदि आप रोबोट को 16 अलग-अलग विचार लिखने के लिए कहते हैं लेकिन प्रत्येक के लिए केवल एक कुकी बेक करने के लिए कहते हैं, तो शोर कभी खत्म नहीं होता। चाहे आप कितनी भी अलग-अलग रेसिपी आज़मा लें, यदि आप प्रत्येक रेसिपी के लिए केवल एक कुकी चखते हैं, तो आप कभी भी 100% सुनिश्चित नहीं हो पाएंगे कि रेसिपी अच्छी थी। एक अनिश्चितता की एक सीमा (floor) है जिसे आप पार नहीं कर सकते।
  2. अधिक उत्तर जोड़ना (अधिक कुकीज़): यदि आप केवल 4 विचारों के साथ टिके रहते हैं लेकिन प्रत्येक विचार के लिए 4 कुकीज़ बेक करते हैं, तो शोर गायब हो जाता है। जैसे-जैसे आप एक ही रेसिपी के लिए अधिक कुकीज़ बेक करते हैं, आपका औसत स्कोर अविश्वसनीय रूप से सटीक हो जाता है।

रूपक (Metaphor):
सोचें कि "शोर" रेडियो पर आने वाली खरखराहट (static) की तरह है।

  • विचारों को बढ़ाना हर सेकंड स्टेशन बदलने जैसा है। आप बहुत सारे अलग-अलग संगीत सुनेंगे, लेकिन आप किसी भी एक सिग्नल को स्पष्ट रूप से नहीं पकड़ पाएंगे।
  • उत्तरों को बढ़ाना एक ही स्टेशन पर टिके रहने और उसकी आवाज़ बढ़ाने जैसा है। आप जितना अधिक सुनेंगे (सैंपल लेंगे), संगीत उतना ही स्पष्ट होता जाएगा और खरखराहट गायब हो जाएगी।

यह क्यों महत्वपूर्ण है

लेखक इस नए तरीके को GRPO-MA (मल्टी-आंसर) कहते हैं। उन्होंने सिद्ध किया कि यह "ब्रांचिंग" केवल एक किस्मत वाला नुस्खा नहीं है; यह रोबोट को सही ढंग से सीखने के लिए आवश्यक है ताकि उसे किसी "बैसाखी" (एक जटिल वैल्यू फंक्शन) की आवश्यकता न पड़े।

  • स्थिरता (Stability): रोबोट के "भावनात्मक उतार-चढ़ाव" (सीखने में अचानक, जंगली बदलाव) रुक जाते हैं क्योंकि उसके पास इस बात की स्पष्ट तस्वीर होती है कि क्या काम करता है।
  • दक्षता (Efficiency): आश्चर्यजनक रूप से, यह तरीका पुराने तरीके की तुलना में तेज़ और सस्ता है। भले ही रोबोट अधिक कुकीज़ बेक करता है, लेकिन वह इतनी जल्दी सीखता है कि वह 16 अलग-अलग विचार लिखने की तुलना में प्रशिक्षण जल्दी समाप्त कर लेता है।
  • बहुमुखी प्रतिभा (Versatility): उन्होंने इसका परीक्षण गणित, कोडिंग और यहाँ तक कि एक सिमुलेशन में वस्तुओं को हिलाने वाले रोबोट पर भी किया। हर मामले में, यह "ब्रांचिंग" विधि बेहतर और अधिक स्थिर रही।

संक्षेप में

AI को स्पष्ट रूप से सोचना सिखाने के लिए, उसे केवल अधिक बार सोचने के लिए न कहें। उसे एक बार सोचने के लिए कहें, लेकिन उस विचार के परिणाम के लिए कई संभावनाओं को तलाशने के लिए कहें। एक ही विचार के कई परिणामों को चखकर, AI यह सीख जाता है कि कौन से विचार वास्तव में अच्छे हैं, जिससे सीखना तेज़, अधिक स्थिर और स्मार्ट हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →