← नवीनतम पेपर
🤖 machine learning

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TRACE एक सघन, क्रिटिक-मुक्त क्रेडिट असाइनमेंट पद्धति पेश करता है जो लॉग-रेश्यो स्टेट वैल्यूज में टेम्पोरल-डिफरेंस परिवर्तनों से प्रति-टर्न रिवॉर्ड्स प्राप्त करता है, जिससे लॉन्ग-होराइजन एजेंटों के लिए शुद्ध सुदृढीकरण शिक्षण (reinforcement learning) जटिल सर्च बेंचमार्क पर टूल-यूज़ प्रदर्शन को महत्वपूर्ण रूप से सुधारने में सक्षम होता है, जिसके लिए सुपरवाइज्ड फाइन-ट्यूनिंग या लाइव-वेब डेटा की आवश्यकता नहीं होती है।

मूल लेखक: Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

प्रकाशित 2026-07-16
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, बहु-चरणीय रहस्य सुलझाना सिखा रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "एजेंटिक रीइन्फोर्समेंट लर्निंग" कहा जाता है। इस रोबोट को एक जासूस के रूप में सोचें जो केवल एक बार उत्तर का अनुमान नहीं लगाता, बल्कि अंत में "मुझे अपराधी मिल गया!" चिल्लाने से पहले घंटों तक पुस्तकालयों में खोज करता है, फाइलें खोलता है, सवाल पूछता है और सुराग इकट्ठा करता है। पेचीदा हिस्सा इस जासूस को सिखाना है। यदि जासूस अंत में गलत उत्तर देता है, तो एक साधारण शिक्षक केवल यह कह सकता है, "बुरा काम," और शून्य दे सकता है। लेकिन यह अनुचित है! शायद जासूस ने पहला घंटा सही सुराग खोजने में बिताया, लेकिन अंतिम मिनट में एक ढीले फर्श के तख्ते से टकराकर लड़खड़ा गया। यदि आप पूरे एक घंटे की कड़ी मेहनत को केवल अंतिम गलती के कारण दंडित करते हैं, तो जासूस भ्रमित हो जाता है और सुराग इकट्ठा करना बंद कर देता है। यह "क्रेडिट असाइनमेंट" (श्रेय निर्धारण) की समस्या है: जब इनाम केवल अंत में आता है, तो अच्छे कदमों के लिए श्रेय कैसे दिया जाए और बुरे कदमों के लिए दोष कैसे तय किया जाए?

यह शोध पत्र, जिसका शीर्षक TRACE है, इस सटीक सिरदर्द को हल करता है जो उन AI एजेंटों के लिए होता है जिन्हें किसी समस्या को हल करने के लिए कई चरणों (turns) से गुजरना पड़ता है। शोधकर्ता एक चतुर तरीका प्रस्तावित करते हैं जिससे जासूस को हर एक कदम (जैसे हर खोज या फाइल खोलना) के बाद "थम्स अप" या "थम्स डाउन" दिया जा सके, न कि अंत तक प्रतीक्षा की जाए। वे ऐसा बिना किसी मानव द्वारा हर कदम को ग्रेड दिए या किसी सुपर-स्मार्ट जज द्वारा पूरी फिल्म देखे, कर सकते हैं। इसके बजाय, वे एक "फ्रोजन रेफरेंस मॉडल" (जमे हुए संदर्भ मॉडल) का उपयोग करते हैं—इसे एक शांत, अपरिवर्तनीय लाइब्रेरियन के रूप में सोचें जो उत्तर कुंजी (answer key) जानता है। जासूस द्वारा प्रत्येक चाल चलने के बाद, लाइब्रेरियन जांचता है: "क्या यह नया सुराग अंतिम उत्तर का अनुमान लगाना आसान बनाता है?" यदि हाँ, तो जासूस को एक छोटा इनाम मिलता है। यदि नहीं, तो उसे एक छोटी सी पेनल्टी मिलती है। यह विधि, जिसे TRACE कहा जाता है, AI को अंत में ग्रेड मिलने की प्रतीक्षा करने के बजाय बहुत तेज़ी से और बेहतर तरीके से सीखने में मदद करती है।

जासूस की दुविधा

कल्पना कीजिए कि आप एक काल्पनिक लेखक "एलेना क्रूज़" के जन्मस्थान को खोजने के लिए एक रोबोट को प्रशिक्षित कर रहे हैं। रोबोट को ब्राउज़र का उपयोग करके खोजने, पृष्ठ खोलने और टेक्स्ट पढ़ने के लिए मजबूर होना पड़ेगा। वहां पहुँचने के लिए उसे 20 क्लिक करने पड़ सकते हैं। इन रोबोटों को प्रशिक्षित करने के पुराने तरीके (जिसे "आउटकम-ओनली" प्रशिक्षण कहा जाता है) में, रोबोट उन सभी 20 क्लिकों से गुजरेगा, शायद गलत उत्तर देगा, और फिर कंप्यूटर कहेगा, "विफल।" रोबलेट फिर से प्रयास करेगा, लेकिन उसे यह पता नहीं चलेगा कि उन 20 क्लिकों में से कौन से क्लिक सहायक थे। हो सकता है कि पहले 15 क्लिकों ने सही किताब ढूंढ ली हो, लेकिन 16वें क्लिक ने किसी दूसरी एलेना के बारे में एक पेज खोल दिया, जिससे गलत उत्तर मिला। पुराना तरीका उन सहायक पहले 15 क्लिकों और उस बेकार 16वें क्लिक के साथ एक जैसा व्यवहार करता है: दोनों को दंडित किया जाता है। यह वैसा ही है जैसे गणित के टेस्ट में अंत में एक छोटी सी अंकगणितीय त्रुटि के कारण खराब ग्रेड मिलना, भले ही आपने कठिन बीजगणित (algebra) को सही ढंग से हल किया हो।

शोधकर्ताओं ने पाया कि यह "सब-या-कुछ-नहीं" वाला दृष्टिकोण इन रोबोटों के लिए जटिल, लंबे कार्यों को सीखना बहुत कठिन बना देता है। रोबोट भ्रमित हो जाता है, प्रशिक्षण में बहुत समय लगता है, और वह अक्सर नए विचारों को खोजने (exploring) से कतराता है क्योंकि उसे अंत में गलती करने का डर होता है।

TRACE समाधान: हर कदम के लिए एक स्कोरकार्ड

इस पेपर के लेखकों ने TRACE (टर्न-लेवल रिवॉर्ड असाइनमेंट वाया क्रेडिट एस्टीमेशन) बनाया है। अंत में उत्तर का इंतजार करने के बजाय, TRACE रोबोट को हर एक टूल कॉल (हर खोज, हर ओपन, हर क्लिक) के बाद एक स्कोर देता है।

यह कैसे काम करता है, हमारे जासूसी उदाहरण का उपयोग करते हुए:

  1. फ्रोजन लाइब्रेरियन: सिस्टम एक "फ्रोजन रेफरेंस मॉडल" का उपयोग करता है। कल्पना करें कि एक लाइब्रेरियन है जिसने पहले से ही उत्तर कुंजी पढ़ ली है और वह अपना निर्णय कभी नहीं बदलेगा। यह लाइब्रेरियन "फ्रोजन" है, जिसका अर्थ है कि वे सीखते या भ्रमित नहीं होते; वे बस एक स्थिर मापदंड के रूप में कार्य करते हैं।
  2. प्रगति की जाँच: रोबोट द्वारा कोई चाल चलने के बाद (जैसे "एलेना क्रूज़" के लिए खोजना), लाइब्रेरियन रोबोट के वर्तमान नोट्स की जांच करता है। लाइब्रेरियन पूछता है, "अब तक रोबोट ने जो पाया है, उसके आधार पर सही उत्तर का अनुमान लगाना कितना आसान है?"
  3. स्कोर में बदलाव: यदि रोबोट की नई खोज उत्तर का अनुमान लगाना आसान बनाती है, तो रोबोट को सकारात्मक स्कोर मिलता है। यदि खोज किसी मृत अंत (dead end) या भ्रमित करने वाले पृष्ठ की ओर ले जाती है, तो स्कोर कम हो जाता है।
  4. "टेलीस्कोपिंग" का जादू: पेपर एक गणितीय ट्रिक का उपयोग करता है जिसे "टेम्पोरल-डिफरेंस" (TD) कहा जाता है। इसे एक सीढ़ी की तरह समझें। यदि आप एक पायदान ऊपर चढ़ते हैं, तो आपको उस पायदान के लिए श्रेय मिलता है। यदि आप ऊपर चढ़ते हैं और फिर गलती से नीचे फिसल जाते हैं, तो आप फिसलने के लिए श्रेय खो देते हैं। सिस्टम इन छोटे बदलावों को जोड़ता है। यदि रोबोट 10 टर्न अच्छे सुराग इकट्ठा करने में बिताता है और फिर एक गलत चाल चलता है, तो सिस्टम 10 अच्छे कदमों को सकारात्मक और एक बुरे कदम को नकारात्मक के रूप में देखता है। यह 10 अच्छे कदमों को केवल इसलिए दंडित नहीं करता क्योंकि अंतिम उत्तर गलत था।

यह विधि विशेष है क्योंकि इसे हर कदम के बाद "अच्छा काम किया" लिखने के लिए किसी मानव की आवश्यकता नहीं है, और न ही इसे रोबोट को देखने और ग्रेड देने के लिए किसी दूसरे, अत्यंत बुद्धिमान AI की आवश्यकता है। यह केवल यह देखने के लिए "फ्रोजन लाइब्रेरियन" का उपयोग करता है कि क्या रोबोट सच्चाई के करीब पहुँच रहा है।

उन्होंने क्या पाया

शोधकर्ताओं ने TRACE का परीक्षण एक बहुत ही कठिन कार्य पर किया: दस्तावेजों के एक विशाल संग्रह के भीतर छिपे विशिष्ट तथ्यों को खोजना (एक "क्लोज्ड-वेब" सर्च)। उन्होंने AI मॉडल्स के दो अलग-अलग आकार का उपयोग किया: एक छोटा मॉडल (Qwen3-4B) और एक बड़ा मॉडल (Qwen3-30B-A3B)।

परिणाम प्रभावशाली थे। TRACE का उपयोग करने से पहले, छोटा मॉडल कठिन खोज प्रश्नों को केवल 7.2% ही हल कर पाता था। TRACE के साथ प्रशिक्षण के बाद, यह उछलकर 35.6% पर पहुँच गया। बड़ा मॉडल 8.4% से 42.6% पर चला गया। ये बहुत बड़े सुधार हैं, विशेष रूप से यह देखते हुए कि उन्होंने किसी "कोल्ड-स्टार्ट" प्रशिक्षण (जहाँ आप पहले से ही रोबोट को सटीक उदाहरणों के साथ सिखाते हैं) या लाइव इंटरनेट डेटा का उपयोग नहीं किया। उन्होंने केवल कच्चे मॉडल पर TRACE विधि का उपयोग किया।

पेपर यह भी दिखाता है कि TRACE तब भी काम करता है जब रोबोट का परीक्षण खुले इंटरनेट पर किया जाता है, न कि केवल उस अभ्यास लाइब्रेरी पर जिस पर उन्हें प्रशिक्षित किया गया था। रोबोट ने खोजने और पढ़ने का एक सामान्य कौशल सीखा जो नई जगहों पर भी प्रभावी रहा। उदाहरण के लिए, बड़े मॉडल ने BrowseComp नामक बेंचमार्क पर 12.9, GAIA पर 52.0, और एक चीनी डीप-सर्च टेस्ट पर 45.0 का स्कोर किया।

यह क्यों महत्वपूर्ण है और इसकी सीमाएं क्या हैं

पेपर सुझाव देता है कि यह विधि सीखने को बहुत तेज़ बनाती है। उनके प्रयोगों में, TRACE के साथ प्रशिक्षित रोबोटों ने पुराने "अंत तक प्रतीक्षा करने वाले" तरीके से प्रशिक्षित रोबोटों की तुलना में बहुत जल्दी बेहतर प्रदर्शन करना शुरू कर दिया और अपने शिखर प्रदर्शन तक तेजी से पहुँचे। लर्निंग कर्व्स ने दिखाया कि रोबोट साक्ष्य एकत्र करने और अन्वेषण करने में अधिक प्रभावी ढंग से सीख रहे थे।

हालाँकि, लेखक अपने काम की सीमाओं को स्पष्ट करने में सावधानी बरतते हैं। यह विधि तब सबसे अच्छा काम करती है जब अंतिम उत्तर छोटा और स्पष्ट हो, जैसे कि कोई नाम, तारीख या संख्या। यदि रोबोट का काम एक लंबी, जटिल कहानी लिखना या एक टूटे हुए कंप्यूटर प्रोग्राम को ठीक करना है जहाँ "सही" उत्तर खुला (open-ended) और परिभाषित करना कठिन है, तो यह विधि उतनी अच्छी तरह काम नहीं कर सकती है। "फ्रोजन लाइब्रेरियन" को जांच करने के लिए एक स्पष्ट उत्तर कुंजी की आवश्यकता होती है। यदि उत्तर अस्पष्ट है, तो लाइब्रेरियन यह नहीं बता सकता कि रोबमा सही उत्तर के करीब पहुँच रहा है या नहीं।

संक्षेप में, TRACE AI एजेंटों को एक अच्छा जासूस बनने के तरीके से सिखाने का एक नया तरीका है। मामले के अंत तक "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, यह हर मिले हुए सुराग के बाद एक स्कोरकार्ड देता है। यह AI को यह समझने में मदद करता है कि साक्ष्य जुटाना मूल्यवान है, भले ही अंतिम अनुमान एकदम सही न हो, जिससे अधिक स्मार्ट, तेज़ और विश्वसनीय खोज एजेंट बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →