← नवीनतम पेपर
🤖 AI

TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents

यह शोध पत्र ट्रांज़िशन-वाइज़ रूब्रिक क्रेडिट असाइनमेंट (TRCA) का प्रस्ताव करता है, जो साक्ष्य (Evidence), निष्पादन (Execution) और अमान्यता (Invalidity) रूब्रिक्स के विरुद्ध एक्शन-प्रेरित ट्रांज़िशन का मूल्यांकन करके लॉन्ग-होराइज़न LLM एजेंटों के लिए सूक्ष्म स्टेप-लेवल रिवॉर्ड्स उत्पन्न करने की एक विधि है, जिससे सफल ट्रेजेक्टरीज की कमी को दूर किया जाता है और सीखे गए इवैल्यूएटर्स पर निर्भर किए बिना WebShop और SearchQA जैसे बेंचमार्क पर प्रदर्शन में सुधार किया जाता है।

मूल लेखक: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के तेजी से विकसित होते क्षेत्र में, शोधकर्ता कंप्यूटर प्रोग्रामों को ऐसे एजेंट के रूप में कार्य करने के लिए प्रशिक्षित कर रहे हैं जो लंबी अवधि में योजना बना सकें, खोज कर सकें और दुनिया के साथ अंतःक्रिया कर सकें। एक डिजिटल सहायक की कल्पना करें जिसे एक विशाल ऑनलाइन स्टोर में एक विशिष्ट वस्तु खोजने या घरेलू कार्यों की एक जटिल श्रृंखला को व्यवस्थित करने का कार्य सौंपा गया है; इन कार्यों के लिए एक एकल त्वरित उत्तर के बजाय कई छोटे निर्णयों के क्रम की आवश्यकता होती है। इन एजेंटों को सिखाने के लिए, वैज्ञानिक अक्सर 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक एक विधि का उपयोग करते हैं, जहाँ कंप्यूटर क्रियाएं करके और फीडबैक प्राप्त करके सीखता है। पारंपरिक दृष्टिकोण कार्य के बिल्कुल अंत में एक सरल "हाँ" या "नहीं" पर बहुत अधिक निर्भर करता है: क्या एजेंट सफल हुआ या विफल? यह एक कठिन सीखने का वातावरण बनाता है क्योंकि एजेंट को इस बारे में कोई मार्गदर्शन नहीं मिलता कि कौन से विशिष्ट कदम मददगार थे और कौन से हानिकारक। यह बिल्कुल वैसा ही है जैसे कोई छात्र बिना कभी अपना होमवर्क जाँचा हुआ देखे, केवल अंतिम परीक्षा दे रहा हो।

फीडबैक की यह कमी तब एक बड़ी बाधा बन जाती है जब कार्य जटिल होता है और सफल प्रयास दुर्लभ होते हैं। यदि प्रशिक्षण के शुरुआती चरणों के दौरान एक एजेंट 95% बार विफल होता है, तो एक ऐसी प्रणाली जो केवल अंतिम परिणाम को देखती है, उसके पास काम करने के लिए उपयोगी डेटा लगभग न के बराबर होता है। वह यह अंतर नहीं कर पाता कि एक कदम क्या था जो एक अच्छा विचार था लेकिन अंततः गलत दिशा में ले गया, और एक कदम क्या था जो पूरी तरह से गलत था। यह एजेंट को फंसा हुआ छोड़ देता है, जिससे वह अपनी बार-बार होने वाली गलतियों से सीखने में असमर्थ हो जाता है क्योंकि फीडबैक लूप बहुत ही अस्पष्ट है। चुनौती फिर यह है कि कैसे उन छोटे, सही कार्यों के लिए श्रेय दिया जाए, भले ही समग्र मिशन अंततः विफल हो जाए।

शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'ट्रांजिशन-वाइज रुब्रिक क्रेडिट असाइनमेंट' (Transition-wise Rubric Credit Assignment), या TRCA नामक एक नई विधि प्रस्तावित की है। किसी सफल परिणाम की प्रतीक्षा करने या हर कदम का मूल्यांकन करने के लिए महंगे, पूर्व-प्रशिक्षित जजों पर निर्भर रहने के बजाय, यह प्रणाली सीधे उन तात्कालिक परिवर्तनों को देखती है जो एक क्रिया वातावरण में उत्पन्न करती है। शोधकर्ताओं ने देखा कि विफल प्रयासों में भी, एजेंट अक्सर तार्किक रूप से सुसंगत क्रियाएं करता है, जैसे कि सही जानकारी एकत्र करना या एक वैध कमांड निष्पादित करना, भले ही अंतिम लक्ष्य प्राप्त न हुआ हो। TRCA इन क्षणों को मूल्यवान सीखने के अवसरों के रूप में देखता है। यह एजेंट द्वारा की जाने वाली प्रत्येक चाल का मूल्यांकन तीन विशिष्ट मानदंडों के आधार पर करता है: क्या क्रिया ने नई, प्रासंगिक जानकारी प्रकट की; क्या इसने सफलतापूर्वक एक आवश्यक ऑपरेशन को पूरा किया; या क्या इसके परिणामस्वरूप एक अमान्य या त्रुटिपूर्ण क्रिया हुई?

एजेंट की यात्रा को इन सूक्ष्म जांचों में विभाजित करके, यह प्रणाली अंतिम परिणाम से स्वतंत्र रूप से प्रत्येक चरण को एक स्कोर दे सकती है। यदि एक एजेंट कार्य के लिए आवश्यक साक्ष्य एकत्र करता है, तो उसे सकारात्मक श्रेय मिलता है। यदि वह एक वैध क्रिया करता है जो कार्य को आगे बढ़ाता है, तो उसे अधिक श्रेय मिलता है। यदि वह कुछ ऐसा करने की कोशिश करता है जिसे वातावरण समझ या निष्पादित नहीं कर सकता, तो उसे दंड (penalty) मिलता है। महत्वपूर्ण रूप से, यह प्रणाली "ब्रेकथ्रू" (breakthroughs) को भी पुरस्कृत करती है, जो वे क्षण हैं जहाँ एजेंट एक ऐसी स्थिति को संतुष्ट करता है जिसे उसने पहले पूरा नहीं किया था, जैसे कि सही उत्पाद का रंग ढूंढना या सही आकार चुनना। यह एजेंट को यह सीखने में मदद करता है कि प्रगति हो रही है, भले ही अंतिम खरीदारी या कार्य पूरा न हुआ हो।

शोधकर्ताओं ने कई चुनौतीपूर्ण बेंचमार्क पर इस दृष्टिकोण का परीक्षण किया, जिसमें एक सिम्युलेटेड ऑनलाइन शॉपिंग वातावरण और एक टेक्स्ट-आधारित दुनिया शामिल है जहाँ एजेंटों को घरेलू कार्य पूरे करने होते हैं। उन्होंने पाया कि TRCA ने अन्य अग्रणी विधियों की तुलना में एजेंटों के प्रदर्शन में लगातार सुधार किया। ऑनलाइन शॉपिंग परीक्षणों में, एक विशिष्ट मॉडल आकार का उपयोग करते हुए, इस नई विधि ने प्रतिस्पर्धी बेसलाइन की तुलना में कार्य स्कोर में 6.0% से 12.6% तक सुधार किया। खोज-आधारित प्रश्न-उत्तर कार्यों में, सुधार 1.9% से 18.3% के बीच था, जिसमें औसत स्कोर काफी बढ़ गया। ये लाभ बिना किसी बड़ी संख्या में सफल उदाहरणों की आवश्यकता के प्राप्त किए गए, जिससे सिद्ध हुआ कि यह प्रणाली विफल प्रयासों में पाए जाने वाले प्रचुर डेटा से प्रभावी ढंग से सीख सकती है।

यह अध्ययन सुझाव देता है कि लंबे समय तक चलने वाले (long-horizon) एजेंटों को सिखाने की कुंजी यह पहचानना है कि विफलता एक खाली स्लेट नहीं है। भले ही एजेंट मिशन को पूरा न कर पाए, लेकिन उसके द्वारा लिया गया मार्ग अक्सर स्पष्ट संकेत देता है कि क्या सही किया गया था और क्या नहीं। अंतिम सफलता की प्रतीक्षा करने के बजाय तात्कालिक, अवलोकन योग्य परिवर्तनों पर ध्यान केंद्रित करके, यह नई विधि मार्गदर्शन की एक निरंतर धारा प्रदान करती है जो एजेंट को बहुत तेज़ी से सुधार करने में मदद करती है। यह दृष्टिकोण सिस्टम को अनुभवों की एक विस्तृत श्रृंखला से सीखने की अनुमति देता है, जिससे विफल प्रयासों के विशाल बहुमत को बेकार डेटा के बजाय निर्देश के एक समृद्ध स्रोत में बदल दिया जाता है। परिणाम संकेत देते हैं कि जटिल, बहु-चरणीय कार्यों के लिए, अंतिम निर्णय की प्रतीक्षा करने की तुलना में चरण-दर-चरण प्रगति का मूल्यांकन करना कहीं अधिक प्रभावी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →