← नवीनतम पेपर
💬 NLP

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

यह शोध पत्र RC-GRPO का प्रस्ताव करता है, जो एक नवीन ढांचा है जो प्रक्षेपवक्र पीढ़ी (trajectory generation) को अनुकूलित करने और रोलआउट्स में विविधता लाने के लिए डिस्क्रीट रिवॉर्ड टोकन को इंजेक्ट करके LLMs में मल्टी-टर्न टूल कॉलिंग को बढ़ाता है, जिससे कम भीतर-समूह रिवॉर्ड भिन्नता के कारण होने वाली वैनिशिंग अपडेट समस्या पर विजय प्राप्त होती है और BFCLv4 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कठोर रोबोट सहायक को एक जटिल, बहु-चरणीय पहेली को हल करने के लिए उपकरणों (जैसे कैलकुलेटर, कैलेंडर, या सर्च इंजन) का उपयोग करना सिखा रहे हैं।

समस्या: "परफेक्ट स्टूडेंट" का जाल

आमतौर पर, इस रोबोट को सिखाने के लिए, आप पहले उसे आदर्श समाधानों के उदाहरण दिखाते हैं (सुपरवाइज्ड फाइन-ट्यूनिंग, या SFT)। रोबोट इन्हें पूरी तरह से सीख लेता है और एक "ए-ग्रेड छात्र" बन जाता है।

फिर, आप इसे GRPO नामक एक विधि का उपयोग करके और भी बेहतर सिखाने की कोशिश करते हैं। GRPO को ऐसे समझें जैसे एक कोच छात्रों का एक समूह इकट्ठा करता है, उन्हें एक ही पहेली देता है, और उन्हें अलग-अलग समाधान आज़माने के लिए कहता है। कोच उनके परिणामों की तुलना करता है: "तुमने अच्छा किया, तुमने खराब किया, तुम औसत रहे।" जो छात्र बेहतर प्रदर्शन करते हैं उन्हें बढ़ावा मिलता है; जो खराब प्रदर्शन करते हैं उन्हें कुछ और प्रयास करने के लिए प्रेरित किया जाता है।

पकड़ (The Catch): क्योंकि रोबोट को "परफेक्ट" उदाहरणों पर इतनी अच्छी तरह से प्रशिक्षित किया गया था, इसलिए जब भी आप समूह को प्रयास करने के लिए कहते हैं, वे सभी बिल्कुल एक ही समाधान के साथ वापस आते हैं। वे सभी एक ही तरह से "परफेक्ट" और उबाऊ होते हैं।

  • कोच समूह को देखता है और कहता है: "खैर, हर कोई 10/10 लाया है।"
  • चूंकि उनके बीच कोई अंतर नहीं है, इसलिए कोच किसी को भी सुधार करने के लिए नहीं कह सकता। सीखने का संकेत (learning signal) लुप्त हो जाता है। रोबोट एक नए तरीके से पहेली को हल करने के लिए प्रयोग करने में असमर्थ होकर फंस जाता है क्योंकि वह उस "परफेक्ट" रास्ते से भटकने से बहुत डरता है जिसे वह पहले से जानता है।

समाधान: RC-GRPO (द "मूड रिंग" स्ट्रैटेजी)

लेखक इस समस्या को ठीक करने के लिए एक नई विधि प्रस्तावित करते हैं जिसे RC-GRPO कहा जाता है। रोबोट को खुद से कुछ अलग करने की उम्मीद करने के बजाय, वे काम शुरू करने से पहले रोबोट को एक "मूड रिंग" या एक विशिष्ट निर्देश टोकन देते हैं।

चरण 1: रोबोट को आदेश पर अलग व्यवहार करना सिखाना (RCTP)
सबसे पहले, वे रोबोट को कहानियों के एक मिश्रित संग्रह पर प्रशिक्षित करते हैं: कुछ जहाँ वह सफल रहा (High Reward) और कुछ जहाँ वह विफल रहा (Low Reward)। महत्वपूर्ण रूप से, वे प्रत्येक कहानी के साथ एक विशेष टैग जोड़ते हैं, जैसे <|High Reward|> या <|Low Reward|>

  • रोबोट सीखता है: "जब मैं <|High Reward|> टैग देखता हूँ, तो मुझे परफेक्ट होने की कोशिश करनी चाहिए। जब मैं <|Low Reward|> टैग देखता हूँ, तो मुझे एक अलग, शायद अधिक जोखिम भरा या सरल रास्ता अपनाना चाहिए।"
  • अब, रोबोट केवल एक कठोर छात्र नहीं है; वह एक गिरगिट (chameleon) है जो टैग के आधार पर अपने व्यवहार के विभिन्न "मोड्स" के बीच स्विच कर सकता है।

चरण 2: कोच का नया खेल (रिवॉर्ड-कंडीशन्ड GRPO)
अब, जब कोच (RL एल्गोरिदम) पहेली सुलझाने के लिए समूह को इकट्ठा करता है, तो वे केवल "जाओ!" नहीं कहते।

  • वे प्रत्येक छात्र को एक अलग टैग सौंपते हैं।
  • छात्र A को <|High Reward|> मिलता है और वह परफेक्ट होने की कोशिश करता है।
  • छात्र B को <|Low Reward|> मिलता है और वह एक अलग, शायद थोड़ा अस्त-व्यस्त दृष्टिकोण आज़माता है।
  • छात्र C को फिर से <|High Reward|> मिलता है, लेकिन शायद वह एक थोड़ा अलग परफेक्ट रास्ता आज़माता है।
  • क्योंकि छात्र अब अपने टैग के आधार पर अलग व्यवहार करने के लिए अनुकूलित (conditioned) हैं, इसलिए समूह में विविधता होती है।
  • कोच अब देख सकता है: "छात्र A को 10 मिला, छात्र B को 2 मिला, छात्र C को 9 मिला।"
  • अब एक स्पष्ट अंतर है! कोच उपयोगी फीडबैक दे सकता है: "छात्र B, छात्र A की तरह बनने की कोशिश करो।"
  • यह सीखने के इंजन को सुचारू रूप से चलता रहता है।

यह क्यों काम करता है (उपमा)

पुराने तरीके में, रोबोट एक ऐसे गायक दल (choir) की तरह था जहाँ हर कोई बिल्कुल एक ही सुर को पूरी तरह से गा रहा था। कंडक्टर यह नहीं बता सकता था कि कौन बेहतर गा रहा है क्योंकि वे सभी एक जैसे थे।

नई RC-GRPO विधि में, कंडक्टर प्रत्येक गायक को एक अलग शीट म्यूजिक (High बनाम Low reward टैग) देता है। अचानक, गायक दल विविध सुनाई देता है। कंडक्टर अंतर सुन सकता है, सबसे अच्छे सुरों को चुन सकता है, और गायकों को सुधारने के लिए मार्गदर्शन कर सकता है।

परिणाम

पेपर ने इसका परीक्षण BFCLv4 नामक एक बेंचमार्क पर किया, जो उपकरणों का उपयोग करने वाले AI एजेंटों के लिए एक कठिन परीक्षा की तरह है।

  • पुराना तरीका: रोबोट फंस गया और बहुत अधिक सुधार नहीं कर सका।
  • नया तरीका (RC-GRPO): रोबोट बहुत तेज़ी से सीखा और अधिक पहेलियाँ सही ढंग से हल कीं।
  • बड़ी जीत: एक विशिष्ट टेस्ट मॉडल (Qwen-2.5-7B) पर, इस नई विधि ने ओपन-सोर्स रोबोट को उन सभी प्रसिद्ध, महंगे "क्लोज्ड-सोर्स" रोबोट्स (जैसे बड़ी टेक कंपनियों के) को हराने में सक्षम बनाया जो आमतौर पर इन परीक्षाओं में जीतते हैं।

सारांश

यह पेपर इस समस्या को हल करता है जहाँ AI उदाहरणों की नकल करने में बहुत अच्छा हो जाता है और सीखना बंद कर देता है। AI को एक साधारण "रिवॉर्ड टैग" के आधार पर जानबूझकर अलग व्यवहार करने के लिए सिखाकर, वे AI को विभिन्न रास्तों का पता लगाने के लिए मजबूर करते हैं, जिससे वह तेज़ी से सीख पाता है और उपकरणों का उपयोग करने में अधिक स्मार्ट बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →