← नवीनतम पेपर
🤖 machine learning

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

यह शोध पत्र TRIAGE का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) के लिए एक रोल-टाइप्ड क्रेडिट असाइनमेंट फ्रेमवर्क है, जो एक्शन सेगमेंट को सिमेंटिक भूमिकाओं (जैसे, निर्णायक प्रगति, अन्वेषण, प्रतिगमन) में वर्गीकृत करके बाउंडेड प्रोसेस रिवॉर्ड्स लागू करता है ताकि मानक GRPO को बेहतर बनाया जा सके, जिससे परिणाम-मात्र (outcome-only) की कमियों को सुधारा जा सके और विविध बेंचमार्क पर सफलता दर और दक्षता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप खोजकर्ताओं की एक टीम को कोचिंग दे रहे हैं जो एक जटिल पहेली सुलझाने की कोशिश कर रहे हैं, जैसे कि एक विशाल, बिखरे हुए घर में कोई विशिष्ट वस्तु खोजना या ऑनलाइन एक आदर्श उपहार खरीदना। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे एजेंटिक रीइन्फोर्समेंट लर्निंग (Agentic Reinforcement Learning) कहा जाता है। AI एजेंट कार्य को पूरा करने के लिए क्रियाएं (खोजना, क्लिक करना, आगे बढ़ना) करता है।

यह पेपर एक नई विधि पेश करता है जिसे TRIAGE कहा जाता है ताकि इन AI एजेंटों को तेज़ी से और समझदारी से सीखने में मदद मिल सके। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है।

समस्या: "सब कुछ या कुछ भी नहीं" वाला ग्रेड

वर्तमान में, अधिकांश AI प्रशिक्षण प्रणालियाँ एक विधि का उपयोग करती हैं जिसे GRPO कहा जाता है। इसे इस तरह समझें जैसे कोई शिक्षक केवल अंतिम परीक्षा के स्कोर को देखता है।

  • यदि छात्र पास हो जाता है: तो शिक्षक छात्र द्वारा उठाए गए हर एक कदम को एक गोल्ड स्टार देता है, भले ही उन कदमों में वह गलत कमरे में गया हो, गलत बटन पर क्लिक किया हो, या समय बर्बाद किया हो।
  • यदि छात्र फेल हो जाता है: तो शिक्षक हर एक कदम पर लाल "F" ग्रेड देता है, भले ही छात्र ने सही दरवाजा खोला हो या कोई उपयोगी सुराग ढूँढा हो।

यह बुरा क्यों है?

  1. "फॉल्स पॉजिटिव" (False Positive) का जाल: यदि कोई एजेंट कार्य में विफल रहता है लेकिन बीच में कोई शानदार खोज करता है, तो "सब कुछ या कुछ भी नहीं" वाली प्रणाली उस शानदार खोज को दंडित करती है। एजेंट अन्वेषण (exploring) करना बंद कर देता है क्योंकि उसे बुरा ग्रेड मिला।
  2. "फॉल्स नेगेटिव" (False Negative) का जाल: यदि कोई एजेंट सफल होता है लेकिन बीच में कोई मूर्खतापूर्ण गलती करता है (जैसे कि गलत साइज की शर्ट खरीदना) और बाद में उसे ठीक कर देता है, तो सिस्टम उस मूर्खतापूर्ण गलती को पुरस्कृत करता है क्योंकि अंतिम परिणाम एक "जीत" है। एजेंट यह सीख जाता है कि अगर आप अंततः जीत जाते हैं तो गलतियाँ करना ठीक है।

समाधान: TRIAGE (ट्राइएज नर्स)

लेखकों ने TRIAGE का प्रस्ताव दिया है, जिसका नाम चिकित्सा प्रक्रिया (medical process) से लिया गया है जहाँ नर्सें मरीजों को केवल इस आधार पर नहीं, बल्कि इस आधार पर छाँटती हैं कि उन्हें किस प्रकार की देखभाल की आवश्यकता है, न कि केवल इस आधार पर कि वे जीवित हैं या नहीं।

केवल अंतिम परिणाम को देखने के बजाय, TRIAGE एक स्मार्ट "जज" (एक अन्य AI) का उपयोग करता है जो एजेंट द्वारा ली गई हर क्रिया को देखता है और पूछता है: "इस विशिष्ट क्रिया ने पहेली में क्या भूमिका निभाई?"

जज हर क्रिया को चार श्रेणियों (buckets) में बाँट देता है:

  1. निर्णायक प्रगति (The Hero - नायक): क्रिया ने सीधे पहेली के एक हिस्से को हल किया (जैसे, वस्तु खरीदना, उत्तर सबमिट करना)।
    • पुरस्कार: बड़ा गोल्ड स्टार।
  2. उपयोगी अन्वेषण (The Detective - जासूस): क्रिया ने अभी तक पहेली को हल नहीं किया, लेकिन इसने महत्वपूर्ण जानकारी जुटाई (जैसे, मैनुअल पढ़ना, सुराग खोजना)।
    • पुरस्कार: एक छोटा "अच्छा काम किया" वाला स्टिकर। महत्वपूर्ण बात यह है कि यह तब भी दिया जाता है जब एजेंट अंततः विफल हो जाता है। यह एजेंट को सिखाता है कि जानकारी जुटाना मूल्यवान है।
  3. कोई प्रगति नहीं करने वाला बुनियादी ढांचा (The Bureaucrat - नौकरशाह): क्रिया हानिकारक नहीं थी लेकिन बेकार थी (जैसे, ऐसा बटन दबाना जो कुछ नहीं करता, या गोल-गोल घूमना)।
    • पुरस्कार: एक छोटी सी पेनल्टी (जैसे, "समय की बर्बादी" का नोट)।
  4. पतन/गिरावट (The Saboteur - तोड़फोड़ करने वाला): क्रिया ने स्थिति को बदतर बना दिया या एक ज्ञात गलती को दोहराया (जैसे, सही फ़ाइल डिलीट करना, गलत आइटम खरीदना)।
    • पुरस्कार: एक बड़ी लाल पेनल्टी। महत्वपूर्ण बात यह है कि यह पेनल्टी तब भी लगाई जाती है जब एजेंट ने गलती सुधार ली हो और जीत गया हो।

व्यवहार में यह कैसे काम करता है

TRIORGE अंतिम ग्रेड (Verifier) को प्रतिस्थापित नहीं करता है। यह अंतिम ग्रेड को सीखने के मुख्य दिशा के रूप में रखता है लेकिन प्रत्येक चरण के आधार पर एक "बोनस" या "पेनल्टी" जोड़ता है।

  • यदि एजेंट विफल होता है: TRIAGE कहता है, "आप विफल रहे, लेकिन आपने जो खोज की वह बहुत अच्छी थी! खोज करना जारी रखें।"
  • यदि एजेंट जीतता है: TRIAGE कहता है, "आप जीत गए, लेकिन वह गलत क्लिक जो आपने किया था, वह बुरा था। दोबारा ऐसा न करें, भले ही आप अंत में जीत गए हों।"

परिणाम: स्मार्ट, तेज़ एजेंट

पत्रकारों ने इसे तीन अलग-अलग "पहेलियों" पर परखा:

  1. ALFWorld: एक रोबोट जो वस्तुओं को खोजने के लिए घर में घूम रहा है।
  2. Search-QA: एक एजेंट जो सवालों के जवाब देने के लिए वेब पर खोज कर रहा है।
  3. WebShop: एक एजेंट जो विशिष्ट चीजें खरीदने के लिए ऑनलाइन खरीदारी कर रहा है।

निष्कर्ष:

  • उच्च सफलता दर: TRIAGE के साथ प्रशिक्षित एजेंटों ने पुराने "सब कुछ या कुछ भी नहीं" वाले तरीके की तुलना में अधिक पहेलियाँ सुलझाईं।
  • कम गलतियाँ: एजेंटों ने अपने सफल प्रयासों के दौरान कम "मूर्खतापूर्ण" गलतियाँ कीं।
  • तेजी से पूर्णता: एजेंटों ने कम चरणों में कार्य पूरे किए (लगभग 10-15% तेज़) क्योंकि उन्होंने बेकार के लूप या अनावश्यक क्लिक पर समय बर्बाद करना बंद कर दिया।

"सीक्रेट सॉस" (Secret Sauce)

पेपर इस बात पर जोर देता है कि जादू केवल अधिक पुरस्कार जोड़ने में नहीं है; यह वर्गीकरण (categorization) में है।

  • यदि आप बिना यह जाने कि क्रिया की भूमिका क्या है एक सामान्य "प्रगति स्कोर" देते हैं, तो AI अभी भी भ्रमित रहेगा।
  • सिस्टम तब सबसे अच्छा काम करता है जब "जज" जीत के भीतर पतन (Regression inside a Win) को पकड़ने और हार के भीतर अन्वेषण (Exploration inside a Loss) को पहचानने में सक्षम होता है।

संक्षेप में, TRIAGE AI एजेंटों को सिखाता है कि वहां तक पहुँचने के तरीके का महत्व उतना ही है जितना कि वहां पहुँचने का। यह जासूसी कार्य को पुरस्कृत करता है, तोड़फोड़ को दंडित करता है, और उबाऊ नौकरशाही को अनदेखा करता है, जिससे अधिक स्मार्ट और कुशल एजेंट बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →