← नवीनतम पेपर
🤖 machine learning

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

यह शोध पत्र TAO-RL का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (agentic reinforcement learning) के लिए एक एकीकृत ढांचा है, जो उच्च गुणवत्ता वाले डेटा को सुनिश्चित करने के लिए टूल-अवेयर ट्रैजेक्टरी फ़िल्टरिंग को उच्च-गुणवत्ता वाले डेटा के साथ संयोजित करके और महत्वपूर्ण टूल-इंटरैक्शन बिंदुओं पर विविध अन्वेषण को प्रोत्साहित करने के लिए एक एंट्रॉपी-गाइडेड बोनस को जोड़कर प्रशिक्षण स्थिरता और तर्क क्षमताओं को बढ़ाता है।

मूल लेखक: Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी अनाड़ी छात्र (एक लार्ज लैंग्वेज मॉडल) को एक शक्तिशाली कैलकुलेटर (कोड इंटरप्रेटर टूल) का उपयोग करके कठिन गणित की समस्याओं को हल करना सिखा रहे हैं।

अतीत में, जब आपने छात्र को कैलकुलेटर का उपयोग करने दिया, तो दो बड़ी समस्याएँ हुईं:

  1. "टूटा हुआ कैलकुलेटर" की समस्या: कभी-कभी छात्र ने कैलकुलेटर का उपयोग करने की कोशिश की, लेकिन उसके द्वारा लिखा गया कोड गलत था, और कैलकुलेटर क्रैश हो गया। छात्र इन क्रैश से सीखने की कोशिश करता रहा, जिसने उन्हें केवल भ्रमित किया और उनके प्रशिक्षण को अस्थिर बना दिया।
  2. "बोरियत या फंस जाने" की समस्या: कभी-कभी छात्र ने अभ्यास के हर एक सवाल को सही हल कर लिया (तो सीखने के लिए कुछ नया नहीं बचा था), या उसने हर एक सवाल गलत किया (तो उसे पता ही नहीं चला कि आगे क्या करना है)। दोनों ही मामलों में, सीखने की प्रक्रिया रुक गई क्योंकि कोई उपयोगी फीडबैक नहीं मिल रहा था।

यह शोध पत्र एक नया शिक्षण तरीका पेश करता है जिसे TAO-RL कहा जाता है। इसे एक दो-चरणीय कोचिंग सिस्टम के रूप में समझें जिसे इन समस्याओं को ठीक करने के लिए डिज़ाइन किया गया है।

चरण 1: "गुणवत्ता नियंत्रण" फ़िल्टर (ट्रैजेक्टरी फ़िल्टरिंग)

छात्र के अभ्यास सत्र के ग्रेड में गिने जाने से पहले, कोच (TAO-RL) काम की समीक्षा करता है और "कचरा" डेटा को बाहर निकाल देता है।

  • नियम: यदि छात्र ने कैलकुलेटर का उपयोग करने की कोशिश की और वह पूरी तरह से विफल रहा, तो उस प्रयास को बाहर निकाल दिया जाता है। यह एक गणित के होमवर्क को फेंकने जैसा है जहाँ छात्र ने कैलकुलेटर का उपयोग करने की कोशिश की लेकिन कैलकुलेटर प्लग इन नहीं था; यह उन्हें कुछ भी नहीं सिखाता।
  • दूसरा नियम: यदि छात्र ने किसी समस्या के सभी संस्करणों को सही हल किया, या सभी को गलत किया, तो उस समस्या को भी बाहर निकाल दिया जाता है।
    • यदि उन्होंने सभी को सही किया, तो वे पहले से ही जानते हैं; अभ्यास करने की कोई आवश्यकता नहीं है।
    • यदि उन्होंने सभी को गलत किया, तो वे पूरी तरह से खो गए हैं; उन्हें उसी चीज़ पर और अधिक अभ्यास करने के बजाय किसी अलग प्रकार की मदद की आवश्यकता है।
  • परिणाम: छात्र केवल "गोल्डिलॉक्स" (Goldilocks) उदाहरणों से सीखते हैं: ऐसी समस्याएँ जहाँ कैलकुलेटर कम से कम एक बार काम कर गया, और जहाँ छात्र "पूरी तरह से खोए हुए" और "पहले से ही मास्टर बने हुए" के बीच कहीं था। यह प्रशिक्षण डेटा को स्वच्छ और उपयोगी रखता है।

चरण 2: "जिज्ञासा प्रोत्साहन" (एन्ट्रॉपी-गाइडेड एक्सप्लोरेशन)

एक बार जब छात्र अच्छे सवालों पर काम करने लगता है, तो कोच चाहता है कि यह सुनिश्चित हो कि छात्र हर बार केवल एक ही उत्तर का अनुमान न लगाए। वे चाहते हैं कि छात्र समस्या को हल करने के विभिन्न तरीकों का पता लगाए, विशेष रूप से कैलकुलेटर का उपयोग करने के तुरंत बाद।

  • रूपक (Metaphor): कल्पना कीजिए कि छात्र ने अभी-अभी कैलकुलेटर का उपयोग किया और एक परिणाम प्राप्त किया। अब उसे यह तय करना है कि आगे क्या करना है।
    • यदि छात्र अगले कदम के बारे में 100% आश्वस्त है, तो कोच कहता है, "ठीक है, आगे बढ़ो।"
    • लेकिन यदि छात्र अनिश्चित है (उच्च "एन्ट्रॉपी" या भ्रम) कि आगे क्या करना है, तो कोच उन्हें एक बोनस देता है। यह बोनस छात्र को अलग-अलग रास्तों को आज़माने और अधिक गहराई से सोचने के लिए प्रोत्साहित करता है।
  • यह क्यों मायने रखता है: यह छात्र को हर जगह बेतरतीब ढंग से अनुमान लगाने के लिए प्रोत्साहित नहीं करता है। यह विशेष रूप से उस महत्वपूर्ण क्षण के बाद उन्हें गहराई से सोचने के लिए प्रोत्साहित करता है जब कैलकुलेटर एक उत्तर देता है। यह वह महत्वपूर्ण क्षण है जहाँ छात्र को परिणाम की व्याख्या करने और अगला कदम तय करने की आवश्यकता होती है।

जादुई संयोजन

शोध पत्र तर्क देता है कि ये दोनों चरण मिलकर सबसे अच्छा काम करते हैं:

  1. फ़िल्टरिंग यह सुनिश्चित करती है कि छात्र खराब या बेकार उदाहरणों से न सीखे (स्थिरता)।
  2. जिज्ञासा प्रोत्साहन यह सुनिश्चित करता है कि छात्र समाधान के सबसे दिलचस्प और कठिन हिस्सों की खोज करे (प्रभावशीलता)।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने तीन अलग-अलग आकारों के "छात्रों" (AI मॉडल) पर इस पद्धति का परीक्षण किया और सात बहुत कठिन गणितीय बेंचमार्क (जैसे AIME और MATH प्रतियोगिताएं) का उपयोग किया।

  • बेहतर स्कोर: TAO-RL पद्धति ने अन्य विधियों की तुलना में लगातार उच्च स्कोर प्राप्त किए।
  • अधिक स्थिर प्रशिक्षण: सीखने की प्रक्रिया सुचारू थी, बिना उन उतार-चढ़ाव के जो अन्य विधियों में देखे जाते हैं।
  • गहरा चिंतन: TAO-RL के साथ प्रशिक्षित छात्रों ने लंबा, अधिक विस्तृत कोड लिखा और कैलकुलेटर का अधिक प्रभावी ढंग से उपयोग किया। उन्होंने केवल टूल का उपयोग नहीं किया; उन्होंने यह भी सीखा कि जब टूल गलती करता है (जैसे कोड में "NameError" आने पर) तो कैसे सुधार करना है और आगे बढ़ना है।

संक्षेप में: TAO-RL टूल्स का उपयोग करने के लिए AI एजेंटों को प्रशिक्षित करने का एक स्मार्ट तरीका है। यह खराब अभ्यास सत्रों को फ़िल्टर करता है और AI को ठीक उसी समय रचनात्मक रूप से सोचने के लिए प्रोत्साहित करता है जब उसे टूल के परिणामों की व्याख्या करने की आवश्यकता होती है, जिससे बेहतर, अधिक स्थिर तर्क कौशल प्राप्त होते है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →