← नवीनतम पेपर
💬 NLP

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

यह शोध पत्र PROVE को प्रस्तुत करता है, जो एक स्टेटफुल सर्वर लाइब्रेरी, एक डिपेंडेंसी-गाइडेड डेटा सिंथेसिस पाइपलाइन और एक नवीन प्रोग्रामेटिक रिवॉर्ड सिस्टम को संयोजित करके लाइव वातावरण में मल्टी-स्टेप टूल उपयोग के लिए प्रभावी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाता है, जिसके परिणामस्वरूप कई बेंचमार्क और मॉडल परिवारों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

मूल लेखक: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु (apprentice) को एक असली घर में चीजें ठीक करने के लिए एक विशाल, जटिल टूलबॉक्स का उपयोग करना सिखा रहे हैं। लक्ष्य यह नहीं है कि प्रशिक्षु केवल सही उपकरण चुने, बल्कि यह भी है कि वे उन्हें सही क्रम में उपयोग करें, गलतियों को संभालें, और जब उन्हें समझ न आए तो रुक जाएं।

यह शोध पत्र, जिसका शीर्षक PROVE है, AI मॉडल्स (प्रशिक्षुओं) को बिल्कुल यही करने के लिए प्रशिक्षित करने का एक नया तरीका बताता है। लेखकों ने पाया कि पिछली विधियाँ तीन मुख्य कारणों से विफल हो रही थीं, और उन्होंने इसे ठीक करने के लिए एक नई प्रणाली बनाई।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

वे तीन समस्याएँ जिन्हें उन्होंने ठीक किया

  1. "नकली घर" की समस्या (The "Fake House" Problem):

    • पुराना तरीका: अधिकांश प्रशिक्षण एक "सिमुलेशन" या एक स्थिर मानचित्र (static map) में होता था। यह एक घर के रेखाचित्र पर अभ्यास करने जैसा था। यदि प्रशिक्षु एक ऐसा दरवाजा खोलने की कोशिश करता जो वास्तव में उस रेखाचित्र में मौजूद नहीं था, तो सिस्टम को बहुत देर से पता चलता कि वह गलत था।
    • समाधान: PROVE Live MCP Environments का उपयोग करता है। इसे ऐसे समझें जैसे आप प्रशिक्षु को एक असली घर में प्रशिक्षित कर रहे हैं जिसमें असली प्लंबिंग और बिजली है। यदि वे एक ऐसी लाइट चालू करने की कोशिश करते जिसमें बल्ब नहीं है, तो सिस्टम तुरंत कहता है, "यह काम नहीं किया।" यह वास्तविक समय में, वास्तविक परिणामों के साथ होता है।
  2. "काल्पनिक फर्नीचर" की समस्या (The "Imaginary Furniture" Problem):

    • पुराना तरीका: अभ्यास प्रश्न उत्पन्न करते समय, कंप्यूटर अक्सर काल्पनिक विवरण बना देते थे। वे प्रशिक्षु से कह सकते थे कि "कमरा 404 में लाल कुर्सी को हिलाएं," लेकिन कमरा 404 अस्तित्व में ही नहीं था, और वहां कोई लाल कुर्सी भी नहीं थी। प्रशिक्षु आदेश का पालन करने की कोशिश करता और तुरंत विफल हो जाता क्योंकि वह वस्तु वास्तविक नहीं थी।
    • समाधान: उन्होंने एक Grounded Data Pipeline बनाया। प्रश्न पूछने से पहले, सिस्टम "घर" की जांच करता है कि वास्तव में कौन सा फर्नीचर मौजूद है। यदि कमरा 101 में एक लाल कुर्सी है, तो सिस्टम पूछेगा, "कमरा 101 में लाल कुर्सी को हिलाएं।" यह सुनिश्चित करता है कि प्रत्येक अभ्यास कार्य पूरा करने योग्य हो।
  3. "बड़बोलेपन" की समस्या (The "Chatterbox" Problem):

    • पुराना तरीका: रिवॉर्ड सिस्टम (पुरस्कार प्रणाली) एक ऐसे शिक्षक की तरह था जो केवल तभी गोल्ड स्टार देता था जब छात्र चेकलिस्ट के हर आइटम को पूरा कर लेता था। इसने छात्र को आलसी होने और बस उन सभी टूल्स को कॉल करने के लिए प्रोत्साहित किया जिन्हें वे जानते थे, इस उम्मीद में कि वे गलती से सही टूल्स तक पहुँच जाएंगे, बजाय इसके कि वे सावधानी से सोचें।
    • समाधान: उन्होंने एक Programatic Reward System बनाया। केवल यह जांचने के बजाय कि सही टूल्स का उपयोग किया गया या नहीं, नया सिस्टम प्रशिक्षु को निम्नलिखित के लिए पुरस्कृत करता है:
      • वैधता (Validity): क्या टूल वास्तव में काम आया?
      • कवरेज (Coverage): क्या उन्होंने सभी आवश्यक कदम पूरे किए?
      • दक्षता (Efficiency): क्या उन्होंने बिना समय बर्बाद किए या अतिरिक्त, अनावश्यक कॉल किए बिना काम किया? (यह "बड़बोलेपन" के खिलाफ नियम है)।
      • सटीकता (Precision): क्या उन्होंने सही टूल का नाम और सही सेटिंग्स का उपयोग किया?

यह प्रणाली कैसे काम करती है (The "Coach")

लेखकों ने एक "कोच" (एक state-machine orchestrator) बनाया है जो प्रशिक्षण सत्रों को चलाता है:

  1. मैप: कोच पहले एक मैप बनाता है कि टूल्स एक-दूसरे पर कैसे निर्भर हैं (जैसे, आप "पैसे ट्रांसफर" करने से पहले "बैलेंस चेक" करना चाहिए)।
  2. स्कौटिंग (Scouting): कोच प्रश्नों में उपयोग किए जाने वाले वास्तविक आइटम्स को खोजने के लिए लाइव वातावरण को देखता है।
  3. अभ्यास: कोच AI को एक बहु-चरणीय (multi-step) प्रश्न पूछता है। AI टूल्स को कॉल करके उसे हल करने की कोशिश करता है।
  4. स्कोरकार्ड: सिस्टम ग्रेडिंग के लिए दूसरे AI का उपयोग नहीं करता (जो धीमा और महंगा है)। इसके बजाय, यह तुरंत जांचने के लिए कोड का उपयोग करता है: "क्या टूल चला? क्या इसने सही डेटा लौटाया? क्या आपने बहुत अधिक चरणों का उपयोग किया?"
  5. लूप: AI को एक स्कोर मिलता है और वह फिर से प्रयास करता है, और हर बार बेहतर होता जाता है।

परिणाम

टीम ने चार अलग-अलग AI मॉडल्स (छोटे से मध्यम आकार के) पर इसका परीक्षण किया। उन्हें लाखों उदाहरणों की आवश्यकता नहीं पड़ी; उन्होंने लगभग 13,000 उच्च-गुणवत्ता वाले अभ्यास सत्रों का उपयोग किया।

परिणाम प्रभावशाली थे:

  • मॉडल्स बहु-चरणीय समस्याओं को हल करने में काफी बेहतर हो गए।
  • उन्होंने तीन प्रमुख टेस्ट (BFCL, τ 2-bench, और T-Eval) में 10 अंक तक सुधार किया।
  • महत्वपूर्ण रूप से, मॉडल्स ने दक्षता (efficiency) सीखी। उन्होंने अनावश्यक टूल कॉल करना बंद कर दिया और वे यह सीख गए कि कब रुकना है जब उनके पास पर्याप्त जानकारी न हो, बजाय इसके कि वे अंधाधुंध अनुमान लगाएं।

निष्कर्ष (The Bottom Line)

यह पेपर सिद्ध करता है कि रोबोट को टूल्स का उपयोग करना सिखाने के लिए आपको मानव एनोटेटर्स की एक बड़ी सेना या एक बहुत ही स्मार्ट "जज AI" की आवश्यकता नहीं है। इसके बजाय, यदि आप उन्हें अभ्यास करने के लिए एक वास्तविक वातावरण देते हैं, काम करने के लिए वास्तविक डेटा देते हैं, और एक स्मार्ट स्कोरिंग सिस्टम बनाते हैं जो दक्षता को पुरस्कृत करता है, तो वे बहुत तेज़ी से जटिल कार्यों को संचालित करना सीख सकते हैं।

मुख्य बात यह है कि जब वास्तविक दुनिया में टूल्स का उपयोग करने के लिए AI को सिखाने की बात आती है, तो डेटा की मात्रा से अधिक प्रशिक्षण की गुणवत्ता (वास्तविक स्थिति, वास्तविक रिवॉर्ड्स) मायने रखती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →