TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो इंटरैक्शन को ट्री-स्ट्रक्चर्ड नोड्स के रूप में मॉडल करके और रिवॉर्ड कंट्रास्ट एवं पॉलिसी लर्निंग दक्षता को बढ़ाने के लिए मिश्रित टर्मिनल रिवार्ड्स के साथ प्रॉम्प्ट रूट्स और इंटरमीडिएट प्रीफिक्स दोनों को गतिशील रूप से लक्षित करके मल्टी-टर्न एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) में रोलआउट बजट आवंटन को अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो एक बहुत ही बुद्धिमान लेकिन अनुभवहीन छात्र (एक AI) को जटिल पहेलियाँ, जैसे गणित की समस्याएँ या एक विशाल पुस्तकालय में उत्तर ढूँढना, हल करना सिखाने की कोशिश कर रहे हैं। छात्र प्रयोग करके, गलतियाँ करके और अंत में एक सरल "हाँ" या "नहीं" प्राप्त करके सीखता है।
समस्या यह है कि शिक्षक के पास छात्र को अभ्यास करने देने के लिए सीमित समय (एक "बजट") है। यदि शिक्षक छात्र को एक ही आसान पहेली 100 बार करने देता है, या एक ही असंभव पहेली 100 बार करने देता है, तो छात्र कुछ भी नहीं सीखता। उन्हें ऐसी पहेलियों की आवश्यकता है जो बिल्कुल सही हों—जहाँ वे सफल भी हो सकते हैं या विफल भी हो सकते हैं—ताकि वे अंतर सीख सकें।
यह शोध पत्र इस समस्या को हल करने के लिए एक नई विधि पेश करता है जिसे TRACE कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "उबाऊ" रास्तों पर समय बर्बाद करना
अतीत में, जब AI को सिखाया जाता था, तो शोधकर्ता एक पहेली चुनते थे और AI को उसे शुरू से अंत तक हल करने देते थे।
- समस्या: यदि पहेली बहुत आसान है, तो AI हमेशा जीत जाता है। यदि वह बहुत कठिन है, तो AI हमेशा हार जाता है। दोनों ही मामलों में, अंत में मिलने वाला "हाँ/नहीं" जवाब AI को यह नहीं बताता कि वह कहाँ गलत हुआ।
- पुराना तरीका: शोधकर्ताओं ने बेहतर पहेलियाँ चुनने की कोशिश की, लेकिन एक बार जब AI ने किसी पहेली को हल करना शुरू कर दिया, तो वे बस उसे अंत तक चलने देते थे। वे यह जाँचने के लिए नहीं रुकते थे कि क्या AI बीच में ही अटक रहा है।
2. समाधान: "शाखाओं वाला रास्ता" (TRACE)
TRACE खेल को बदल देता है क्योंकि यह AI के प्रयास को केवल एक सीधी रेखा के रूप में नहीं, बल्कि कई शाखाओं वाले एक पेड़ (tree) के रूप में देखता है।
कल्पना कीजिए कि AI खजाना (सही उत्तर) खोजने के लिए एक पहाड़ पर चढ़ रहा है।
- जड़ें (शुरुआत): सबसे पहले, TRACE शुरुआती बिंदु (पहेली) को देखता है। यह अनुमान लगाता है: "क्या यह पहेली सफलता और विफलता का मिश्रण होने की संभावना रखती है?" यदि यह बहुत आसान या बहुत कठिन है, तो यह इसे छोड़ देता है। यदि यह एक अच्छा "सीखने वाला" पहेली है, तो यह AI को पहाड़ पर भेज देता है।
- शाखाएँ (मध्य): यही असली जादू है। जैसे-जैसे AI चढ़ाई करता है, वह रास्ते के एक मोड़ (एक "मोड़" जहाँ वह निर्णय लेता है) पर पहुँचता है। TRACE रुकता है और पूछता है: "यदि AI इस विशिष्ट पथ पर चलता है, तो क्या इसके जीत या हार की ओर ले जाने की संभावना है?"
- यदि पथ ऐसा दिखता है कि वह निश्चित रूप से जीत या निश्चित रूप से हार की ओर ले जाएगा, तो TRACE उस पर और अधिक समय बर्बाद नहीं करता है।
- यदि पथ अनिश्चित दिखता है (सफलता या विफलता की 50/50 संभावना), तो TRACE कहता है, "आइए हम इस विशिष्ट पथ पर और अधिक हाइकर्स (हाइकर) भेजते हैं ताकि देखते हैं कि क्या होता है!"
3. "क्रिस्टल बॉल" (भविदर्शक)
TRACE को कैसे पता चलता है कि कौन से पथ अनिश्चित हैं? यह एक "क्रिस्टल बॉल" (एक प्रेडिक्शन मॉडल) का उपयोग करता है।
- यह क्रिस्टल बॉल अब तक की चढ़ाई के इतिहास (AI के विचारों और कार्यों) को देखता है।
- यह सफलता की संभावना का अनुमान लगाता है।
- यदि क्रिस्टल बॉल कहता है, "यहाँ सफलता की 50% संभावना है," तो यह अधिक समय बिताने के लिए एकदम सही जगह है। इसका मतलब है कि AI एक "लर्निंग ज़ोन" में है जहाँ वह एक जीतने वाले पथ की तुलना एक हारने वाले पथ से कर सकता है।
4. परिणाम: कम प्रयास के साथ स्मार्ट लर्निंग
अपने सीमित समय को केवल "अनिश्चित" हिस्सों पर केंद्रित करके, TRACE तुलनाओं (contrasts) का एक समृद्ध मानचित्र बनाता है।
- केवल यह जानने के बजाय कि "मैं हार गया," AI सीखता है, "मैं इसलिए हारा क्योंकि मैंने मोड़ पर बायाँ रास्ता लिया था, लेकिन यदि मैं दायाँ रास्ता लेता तो मैं सफल हो जाता।"
- यह AI के सीखने के लिए एक बहुत मजबूत संकेत बनाता है, भले ही अभ्यास करने के लिए खर्च किया गया कुल समय (बजट) पहले के समान ही हो।
सारांश में
TRACE को एक स्मार्ट कोच के रूप में सोचें जो केवल एथलीट को बेतरतीब ढंग से चक्कर लगाने के लिए नहीं छोड़ देता।
- सही दौड़ चुनता है: यह ऐसी दौड़ चुनता है जो चुनौतीपूर्ण लेकिन जीतने योग्य हो।
- कठिन मोड़ों पर रुकता है: यह एथलीट को दौड़ते हुए देखता है। यदि एथलीट एक ऐसे कठिन मोड़ पर पहुँचता है जहाँ वह फिसल सकता है या नहीं भी सकता, तो कोच अधिक एथलीटों को उसी ठीक उसी मोड़ को आज़माने के लिए भेजता है ताकि फिसलने और पैर संभालने के बीच का अंतर देखा जा सके।
- समय बचाता है: यह आसान सीधे रास्तों और असंभव चट्टानोंों को अनदेखा करता है।
शोध पत्र दिखाता है कि इस पद्धति का उपयोग करके, AI मॉडल (विशेष रूप से Qwen3) गणित, बहु-चरणीय प्रश्नों और टूल का उपयोग करने में बेहतर हो गए, जबकि उन्होंने पुराने तरीकों की तुलना में समान कंप्यूटिंग पावर का उपयोग किया। यह एक सपाट, उबाऊ अभ्यास सत्र को एक गतिशील, शाखाओं वाले अन्वेषण में बदल देता है जहाँ हर कदम कुछ नया सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।