← नवीनतम पेपर
🤖 AI

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

यह शोध पत्र स्पार्स आउटकम (sparse outcome) और डेंस प्रोसेस रिवार्ड्स (dense process rewards) के माध्यम से एंट्रॉपी रिडक्शन (entropy reduction) को एक सुपरवाइजरी सिग्नल के रूप में उपयोग करने का प्रस्ताव देता है ताकि अत्यधिक टूल कॉल्स को प्रभावी ढंग से कम किया जा सके और लंबी ट्रेजेक्टरीज (long trajectories) में लार्ज लैंग्वेज मॉडल एजेंटों के प्रदर्शन को बढ़ाया जा सके।

मूल लेखक: Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा चिंतित सहायक (एक AI) है जो एक जटिल पहेली, जैसे कि गणित की समस्या या कोई रहस्य, को हल करने की कोशिश कर रहा है। इस सहायक के पास एक सुपरपावर है: यह मदद के लिए बाहरी उपकरणों (tools) का उपयोग कर सकता है, जैसे कि कैलकुलेटर, सर्च इंजन या कोड इंटरप्रेटर।

हालाँकि, एक पेच है। कभी-कभी, यह सहायक इतना घबरा जाता है या भ्रमित हो जाता है कि यह इन उपकरणों को बहुत अधिक बुलाने लगता है। यह एक ही सवाल को सर्च इंजन से पाँच बार पूछ सकता है, या ऐसी समस्या के लिए कैलकुलेटर चला सकता है जिसकी ज़रूरत ही नहीं थी। यह एक छात्र की तरह है जो केवल एक आरेख (diagram) देखने के लिए पूरी किताब के हर पन्ने को पागलों की तरह पलट रहा है। इससे समय बर्बाद होता है, पैसा खर्च होता है, और वास्तव में यह सहायक को और भी अधिक भ्रमित कर देता है।

यह शोध पत्र इस बारे में है कि सहायक को मदद मांगना कब बंद करना है और मदद मांगने का सही तरीका क्या है, यह कैसे सिखाया जाए।

गुप्त संकेत: "शांत होने वाला" मीटर (The Calm Down Meter)

शोधकर्ताओं ने AI के मस्तिष्क के भीतर एक छिपे हुए संकेत की खोज की जिसे एन्ट्रॉपी (Entropy) कहा जाता है। एन्ट्रॉपी को एक "भ्रम मीटर" (Confusion Meter) या AI के विचारों की अराजकता के माप के रूप में समझें।

  • उच्च एन्ट्रॉपी (High Entropy): AI अपने पहिए घुमा रहा है (एक ही जगह अटक गया है), वह अनिश्चित है कि आगे क्या करना है। यह एक भीड़ भरे कमरे में चिल्लाते हुए व्यक्ति की तरह है, "मुझे नहीं पता कि कहाँ जाना है!"
  • कम एन्की (Low Entropy): AI शांत है, केंद्रित है, और अपने अगले कदम के बारे में निश्चित है। यह उसी व्यक्ति की तरह है जिसने एक स्पष्ट रास्ता ढूंढ लिया है और आत्मविश्वास से चल रहा है।

बड़ी खोज:
टीम ने कुछ प्रयोग चलाए और एक सुनहरा नियम पाया:

जब AI एक अच्छा टूल कॉल करता है, तो उसका भ्रम कम हो जाता है (एन्ट्रॉपी नीचे जाती है)। जब वह एक खराब टूल कॉल करता है, तो उसका भ्रम वास्तव में बढ़ जाता है (एन्ट्रॉपी ऊपर जाती है)।

यह अंधेरे कमरे में टॉर्च जलाने जैसा है। एक अच्छा टूल कॉल टॉर्च जलाने जैसा है; अचानक, सब कुछ स्पष्ट हो जाता है, और "अंधेरा" (अनिश्चितता) गायब हो जाता है। एक खराब टूल कॉल गलत दीवार पर टॉर्च मारने जैसा है; आप अभी भी रास्ता नहीं देख पाते हैं।

समाधान: दो नई प्रशिक्षण रणनीतियाँ

इस "भ्रम मीटर" के आधार पर, शोधकर्ताओं ने एक नया प्रशिक्षण तरीका बनाया जिसे TEPO (Tool-enhanced Entropy-guided Policy Optimization) कहा जाता है। उन्होंने AI की ज़रूरत के आधार पर दो अलग-अलग "कोचिंग शैलियाँ" डिज़ाइन कीं:

1. "दक्षता कोच" (The Efficiency Coach - TEPO-sparse)

  • लक्ष्य: AI को उपकरणों का अत्यधिक उपयोग करने से रोकना।
  • यह कैसे काम करता है: यह कोच अंत में पूरी यात्रा को देखता है। वे कहते हैं, "समस्या सुलझाने के लिए बहुत बढ़िया! लेकिन आपने सर्च इंजन को 10 बार बुलाया। यदि आप इसे 2 कॉल्स में कर सकते थे, तो आपको बड़ा बोनस मिलता।"
  • उपमा: कल्पना कीजिए कि एक डिलीवरी ड्राइवर है। बॉस कहता है, "आपने पैकेज सही ढंग से पहुँचाया, लेकिन आपने तीन अलग-अलग शहरों के चक्कर लगाए। अगली बार, छोटा रास्ता खोजने की कोशिश करें।"
  • परिणाम: AI अच्छे तरीके से आलसी बनना सीख जाता है। यह अनावश्यक रूप से टूल्स को बुलाना बंद कर देता है। प्रयोगों में, इसने सही उत्तर प्राप्त करते हुए भी टूल कॉल्स को 72% तक कम कर दिया!

2. "प्रदर्शन कोच" (The Performance Coach - TEPO-dense)

  • लक्ष्य: AI को अधिक स्मार्ट और सटीक बनाना।
  • यह कैसे काम करता है: यह कोच हर एक कदम पर नज़र रखता है। हर बार जब AI एक टूल का उपयोग करता है और "भ्रम मीटर" नीचे गिरता है (रोशनी जल उठती है), तो कोच तुरंत उसे हाई-फाइव देता है और बोनस पॉइंट देता है। यदि टूल कॉल ने मदद नहीं की, तो कोई बोनस नहीं।
  • उपमा: कल्पना कीजिए कि एक गोल्फ कोच आपके ठीक बगल में खड़ा है। हर बार जब आप गेंद को छेद की ओर बिल्कुल सही मारते हैं, तो वे खुशी मनाते हैं। यदि आप गेंद को रेत में मार देते हैं, तो वे तुरंत आपकी मुद्रा (stance) को ठीक करते हैं।
  • परिणाम: AI यह पहचानना सीख जाता है कि कौन से टूल कॉल वास्तव में मददगार हैं। इसने AI को कठिन समस्याओं को हल करने में 22% बेहतर बना दिया।

यह क्यों मायने रखता है

इससे पहले, AI को टूल का उपयोग करना सिखाना एक कुत्ते को स्टिक लाने के बाद "गुड बॉय" कहने जैसा था। यदि कुत्ता पहले 10 मिनट तक गोल-गोल घूमता रहा, तो कुत्ते को यह पता नहीं चलता कि दौड़ने का कौन सा हिस्सा अच्छा था।

यह शोध पत्र AI को उसके अपने आंतरिक "भ्रम मीटर" को सुनने के लिए सिखाता है।

  • यदि टूल का उपयोग करने से आप अधिक शांत और स्पष्ट महसूस करते हैं, तो इसे फिर से करें।
  • यदि टूल का उपयोग करने से आप अधिक भ्रमित महसूस करते हैं, तो इसे करना बंद कर दें।

निष्कर्ष

शोधकर्ताओं ने दिखाया कि केवल इस बात पर ध्यान देकर कि टूल का उपयोग करने के बाद AI की "अनिश्चितता" ऊपर जाती है या नीचे, हम इसे प्रशिक्षित कर सकते हैं कि वह:

  1. अधिक कुशल बने (कम टूल कॉल करे)।
  2. अधिक स्मार्ट बने (बेहतर टूल कॉल करे)।

यह एक सरल, हल्का तरीका है जिसमें जटिल मानवीय नियमों या महंगे निर्णायकों की आवश्यकता नहीं होती है। यह बस AI को "स्पष्टता" की अपनी भावना से सीखने देता है, जिससे यह गणित की समस्याओं को हल करने या इंटरनेट पर गहरी जानकारी खोजने जैसे वास्तविक दुनिया के कार्यों के लिए एक बेहतर साथी बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →