← नवीनतम पेपर
💬 NLP

PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

यह शोध पत्र PORTool को प्रस्तुत करता है, जो एक महत्व-जागरूक (importance-aware) नीति अनुकूलन एल्गोरिदम है जो शुद्धता और निष्पादन वैधता के आधार पर चरण-स्तरीय पुरस्कारों को निर्दिष्ट करने के लिए पुरस्कृत रोलआउट पेड़ों (rewarded rollout trees) का लाभ उठाता है, जिससे क्रेडिट-असाइनमेंट अस्पष्टता का समाधान होता है और मल्टी-टूल-एकीकृत तर्क एजेंटों की सटीकता और दक्षता दोनों में सुधार होता है।

मूल लेखक: Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन सहायक को विभिन्न उपकरणों (जैसे मौसम ऐप, मैप, कैलकुलेटर या न्यूज़ फीड) से भरे टूलबॉक्स का उपयोग करके जटिल समस्याओं को हल करना सिखा रहे हैं। लक्ष्य यह है कि सहायक सही उत्तर प्राप्त करने के लिए कार्यों के सही क्रम को समझ सके।

यह शोध पत्र PORTool नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इस सहायक को इन उपकरणों का उपयोग करने में बहुत बेहतर बनाया जा सके। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

समस्या: पुरस्कारों का "ब्लैक बॉक्स" (The "Black Box" of Rewards)

अतीत में, इन सहायकों को प्रशिक्षित करते समय, शोधकर्ता एक ऐसी विधि का उपयोग करते थे जो छात्र की अंतिम परीक्षा ग्रेड करने के समान थी।

  • पुराना तरीका: सहायक एक समस्या को हल करने का प्रयास करता है। यदि वह सही उत्तर प्राप्त करता है, तो उसे एक गोल्ड स्टार (+1) मिलता है। यदि वह गलत होता है, तो उसे एक रेड 'X' (-1) मिलता है।
  • खामी: यह एक छात्र को यह बताने जैसा है कि, "आपने फाइनल में A ग्रेड प्राप्त किया," लेकिन उसे यह नहीं बताया कि उसके अध्ययन की कौन सी विशिष्ट प्रक्रियाओं ने उसे सफल होने में मदद की या किन कारणों से वह विफल हुआ।
  • परिणाम: सहायक संयोग से सही उत्तर तक पहुँच सकता है, या वह शुरुआत में एक बड़ी गलती कर सकता है लेकिन फिर भी बाद में सही उत्तर तक पहुँच सकता है। क्योंकि प्रशिक्षण केवल अंतिम परिणाम को देखता है, इसलिए सहायक यह नहीं सीख पाता कि वह क्यों सफल हुआ या क्यों विफल हुआ। वह उन सही चरणों को भी भूल सकता है जो उसने लिए थे क्योंकि "पुरस्कार" बहुत अधिक बिखरा हुआ था।

समाधान: PORTool (द "ब्रांचिंग पाथ" ट्रेनर)

PORTool केवल मंजिल को नहीं, बल्कि यात्रा को देखता है। यह एक चतुर तकनीक का उपयोग करता है जिसे रिवॉर्डेड ट्री (Rewarded Tree) कहा जाता है।

1. "चूज़ योर ओन एडवेंचर" (Choose Your Own Adventure) सादृश्य
कल्पना कीजिए कि आप सहायक को एक ही समय में कई रास्तों पर भेजकर प्रशिक्षित कर रहे हैं, जो बिल्कुल एक ही स्थान से शुरू होते हैं।

  • सेटअप: आप सहायक को एक प्रश्न देते हैं (जैसे, "7 बजे मौसम कैसा है?")।
  • शाखाएँ (Branching): सहायक को अकेले भटकने देने के बजाय, आप उसे महत्वपूर्ण क्षणों पर अलग-अलग टूल चुनने के लिए मजबूर करते हैं।
    • पथ A: वह "7 AM" का अनुमान लगाता है और वेदर टूल को कॉल करता है।
    • पथ B: वह "7 PM" का अनुमान लगाता है और वेदर टूल को कॉल करता है।
    • पथ C: उसे एहसास होता है कि उसे समय नहीं पता है, इसलिए वह पहले एक "करंट टाइम" टूल पूछता है।
  • तुलना: क्योंकि ये सभी पथ एक ही प्रश्न और इतिहास से शुरू हुए थे, इसलिए आप सीधे उनकी तुलना कर सकते हैं। आप देख सकते हैं कि पथ C (पहले समय की जाँच करना) सही उत्तर की ओर ले गया, जबकि पथ A और B त्रुटियों की ओर ले गए।

2. श्रेय देना जहाँ उचित हो (Giving Credit Where It's Due)
पथों के चलने के बाद, PORTool परिणामों को देखता है:

  • यह देखता है कि जिस पथ में सहायक ने पहले समय की जाँच की थी (पथ C), वही विजेता था।
  • यह उस "समय की जाँच करें" वाले चरण को एक उच्च पुरस्कार (High Reward) देता है।
  • यह उन चरणों को कम पुरस्कार (Low Reward) देता है जहाँ सहायक ने समय का गलत अनुमान लगाया था।
  • महत्वपूर्ण रूप से, यह "डेड एंड्स" (गलत अनुमानों) को अनदेखा करता है और सहायक को यह सिखाने पर ध्यान केंद्रित करता है कि यही विशिष्ट निर्णय सफलता की कुंजी था।

3. गलतियों के लिए "सुरक्षा जाल" (The "Safety Net" for Mistakes)
शोध पत्र यह भी नोट करता है कि कभी-कभी उपकरण विफल हो जाते हैं (जैसे मौसम ऐप द्वारा एरर लौटाना)। PORTool यह समझने में स्मार्ट है कि यदि टूल कॉल का फॉर्मेट सही है लेकिन स्वयं टूल खराब है, तो सहायक को बहुत अधिक दंडित नहीं किया जाना चाहिए। यह "क्या आपने टूल की भाषा सही ढंग से बोली?" और "क्या आपको सही उत्तर मिला?" के बीच अंतर करता है।

यह क्यों महत्वपूर्ण है

लेखकों ने वास्तविक दुनिया के प्रश्नों (मौसम, खेल और यात्रा से संबंधित) पर PORTool का परीक्षण किया।

  • बेहतर सटीकता: PORTool के साथ प्रशिक्षित सहायक पुराने तरीकों की तुलना में बहुत अधिक बार सही उत्तर प्राप्त करते हैं।
  • कम गलतियाँ: वे अनावश्यक टूल कॉल कम करते हैं। बेतहाशा अनुमान लगाने के बजाय, वे रुकना, संदर्भ (जैसे वर्तमान समय) की जाँच करना और फिर कार्य करना सीखते हैं।
  • मजबूती (Robustness): जब वास्तविक दुनिया अव्यवस्थित होती है (जैसे, कोई टूल एरर देता है या प्रश्न अस्पष्ट होता है), तो PORTool-प्रशिक्षित सहायक बेहतर तरीके से रिकवर करने और सही रास्ता खोजने में सक्षम होते हैं, जबकि पुराने तरीके अक्सर हार मान लेते हैं या अटक जाते हैं।

संक्षेप में

PORTool को एक ऐसे कोच के रूप में सोचें जो मैच के अंत में केवल "अच्छा खेल" या "बुरा खेल" नहीं कहता। इसके बजाय, कोच खेल को देखता है, हर महत्वपूर्ण निर्णय बिंदु पर टेप को रोकता है, और कहता है, "आपने यहाँ सही चुनाव किया क्योंकि यह गोल की ओर ले गया," और "आपने यहाँ बुरा चुनाव किया क्योंकि यह पेनल्टी की ओर ले गया।" खेल को इन विशिष्ट, तुलनीय क्षणों में तोड़कर, खिलाड़ी बहुत तेज़ी से सीखता है और अधिक समझदारी से खेलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →