← नवीनतम पेपर
🤖 AI

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

यह शोध पत्र निर्णय लेने के सिद्धांत (decision-making theory) पर आधारित एक सुव्यवस्थित ढांचे को प्रस्तुत करता है जो मॉडलों की कथित और वास्तविक आवश्यकता तथा उपयोगिता के बीच के बेमेल (misalignment) का विश्लेषण करके LLM टूल-कॉलिंग निर्णयों का मूल्यांकन और अनुकूलन करता है, और अंततः यह प्रदर्शित करता है कि हिडन स्टेट्स (hidden states) पर प्रशिक्षित हल्के अनुमानक (lightweight estimators) कार्य प्रदर्शन में महत्वपूर्ण सुधार कर सकते हैं।

मूल लेखक: Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, जानकार सहायक (एक AI) है जो आपके सवालों के जवाब देने की कोशिश कर रहा है। कभी-कभी, यह सहायक उत्तर अपने दिमाग में ही जानता है। अन्य समय में, तथ्यों को सही रखने के लिए इसे एक पुस्तकालय (इंटरनेट) में कुछ खोजने की आवश्यकता होती है।

बड़ा सवाल जो यह शोध पत्र पूछता है वह यह है: सहायक को यह कैसे पता चलता है कि कब सोचना बंद करना है और कब चीजें खोजनी शुरू करनी हैं?

शोधकर्ताओं ने पाया कि हालांकि ये AI सहायक स्मार्ट होते जा रहे हैं, लेकिन वे यह तय करने में काफी खराब हैं कि कब अपने "लाइब्रेरी कार्ड" का उपयोग करना है। वे अक्सर तब लाइब्रेरी बुलाते हैं जब उन्हें जरूरत नहीं होती (समय और पैसा बर्बाद करते हैं) या तब लाइब्रेरी बुलाने में विफल रहते हैं जब उन्हें वास्तव में मदद की जरूरत होती है।

यहाँ उनके निष्कर्षों और समाधान का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. एक अच्छे निर्णय के तीन नियम

लेखकों ने एक ढांचा बनाया है जिससे यह परखा जा सके कि क्या AI का "खोजने के लिए" निर्णय लेना सही है। वे इन तीन कारकों को कहते हैं:

  • आवश्यकता (क्या मुझे मदद चाहिए?): क्या AI केवल अपनी याददाश्त का उपयोग करके समस्या को हल कर सकता है? यदि वह पहले से ही उत्तर जानता है, तो लाइब्रेरी बुलाना अनावश्यक है।
  • उपयोगिता (क्या इससे मदद मिलेगी?): यदि AI कुछ खोजता भी है, तो क्या उत्तर वास्तव में बेहतर होगा? कभी-कभी, तथ्य खोजना AI को भ्रमित कर सकता है या त्रुटियां पैदा कर सकता है, जिससे अंतिम उत्तर उसके अनुमान लगाने से भी बदतर हो सकता है।
  • सामर्थ्य (क्या मैं इसे वहन कर सकता हूँ?): चीजें खोजने में पैसा और समय लगता है। एक स्मार्ट निर्णय लेने वाला केवल तभी पैसा खर्च करता है जब लाभ लागत के लायक हो।

2. समस्या: AI "अति-आत्मविश्वासी" या "अल्प-आत्मविश्वासी" है

शोधकर्ताओं ने तीन प्रकार के कार्यों (जैसे सामान्य ज्ञान के प्रश्नों का उत्तर देना या विशिष्ट विषयों पर लिखना) पर छह अलग-अलग AI मॉडल का परीक्षण किया। उन्होंने तीन परिदृश्यों की तुलना की:

  • कोई लाइब्रेरी नहीं: AI केवल अपनी याददाश्त से उत्तर देता है।
  • हमेशा लाइब्रेरी: AI हमेशा चीजें खोजता है, चाहे कुछ भी हो।
  • स्व-निर्णय: AI खुद तय करता है कि उसे कब चीजें खोजनी हैं।

चौंकाने वाली बात: "स्व-निर्णय" मोड अक्सर सबसे खराब रहा।
AI की यह आंतरिक "अंतर्ज्ञान" (gut feeling) कि उसे मदद की आवश्यकता है या नहीं, अक्सर गलत थी।

  • "गलत अलार्म" (False Alarm): कभी-कभी AI सोचता था, "मुझे यह नहीं पता, मुझे खोजना चाहिए!" लेकिन वास्तव में उसे उत्तर पता था। उसने संसाधनों को बर्बाद किया।
  • "छूटा हुआ अवसर" (Missed Opportunity): कभी-कभी AI सोचता था, "मैं यह जानता हूँ!" लेकिन वह वास्तव में गलत था। उसने खोजने से इनकार कर दिया, और एक गलत उत्तर दिया।
  • "खराब खोज" (Bad Search): भले ही AI ने खोजा, लेकिन खोज के परिणाम कभी-कभी उसे भ्रमित कर देते थे, जिससे उत्तर उसकी याददाश्त पर भरोसा करने की तुलना में भी बदतर हो जाता था।

उपमा: एक शेफ की कल्पना करें जो भोजन पकाने की कोशिश कर रहा है। कभी-कभी शेफ एक कुकबुक (उपकरण) उठा लेता है भले ही वह एक मास्टर शेफ हो और उसे रेसिपी पूरी तरह से पता हो। दूसरी ओर, शेफ के पास एक मुख्य सामग्री गायब होती है लेकिन वह पेंट्री (भंडार) की जांच करने से इनकार कर देता है, जिसके परिणामस्वरूप खाना जल जाता है। शेफ का "सहज ज्ञान" कि उसे कब पेंट्री चेक करनी चाहिए, टूटा हुआ है।

3. समाधान: एक "छिपे हुए संकेत" का पता लगाना

शोधकर्ताओं ने महसूस किया कि जबकि AI का बोला गया निर्णय (यह कहना कि "मुझे खोजने की आवश्यकता है") अविश्वसनीय था, AI के आंतरिक मस्तिष्क तरंगें (उसकी छिपी हुई गणितीय अवस्थाएं) वास्तव में सच रखती थीं।

इसे एक झूठ पकड़ने वाले टेस्ट (lie detector test) की तरह समझें। AI कह सकता है, "मैं ठीक हूँ, मुझे मदद की ज़रूरत नहीं है," लेकिन उसके आंतरिक संकेत (जैसे तेज़ धड़कन) चिल्ला रहे हो सकते हैं, "मैं भ्रमित हूँ! मुझे मदद चाहिए!"

सुधार:
AI से निर्णय लेने के लिए पूछने के बजाय, शोधकर्ताओं ने एक छोटा, हल्का "ट्रैफिक पुलिस" (एक सरल कंप्यूटर प्रोग्राम) बनाया जो AI की आंतरिक मस्तिष्क तरंगों को देखता है।

  • यह ट्रैफिक पुलिस AI के छिपे हुए संकेतों को देखता है और भविष्यवाणी करता है: "क्या इस AI को वास्तव में मदद की आवश्यकता है?" और "क्या इसे खोजने से वास्तव में उत्तर बेहतर होगा?"
  • इस "सत्यपूर्ण" संकेत के आधार पर, ट्रैफिक पुलिस AI को बताती है: "हाँ, जाओ और इसे खोजो" या "नहीं, अपनी याददाश्त पर टिके रहो।"

4. परिणाम

जब उन्होंने AI को निर्देशित करने के लिए इस "ट्रैफिक पुलिस" का उपयोग किया:

  • AI ने कम गलतियाँ कीं।
  • इसने अनावश्यक खोजों पर पैसा बर्बाद करना बंद कर दिया।
  • इसने ठीक उसी समय खोजना शुरू किया जब यह सबसे अधिक सहायक था।
  • दिलचस्प बात यह है कि यह छोटे, कम शक्तिशाली AI मॉडल के लिए भी और भी बेहतर काम कर गया, जिससे वे बड़े मॉडलों के समान प्रदर्शन करने में सक्षम हुए।

सारांश

शोध पत्र निष्कर्ष निकालता है कि वर्तमान में AI मॉडल अपने ज्ञान और बाहरी उपकरणों के मूल्य का आकलन करने में बहुत खराब हैं। वे अक्सर असंगत और अक्षम होते हैं। हालाँकि, AI के "छिपे हुए विचारों" को पढ़ने के बजाय उसके "बोले गए शब्दों" को सुनकर एक सरल बाहरी प्रणाली बनाकर, हम इन बुरे निर्णयों को ठीक कर सकते हैं, पैसा बचा सकते हैं और बहुत बेहतर उत्तर प्राप्त कर सकते हैं।

यह शोध पत्र क्या दावा नहीं करता है:

  • यह नहीं कहता कि यह चिकित्सा निदान या कानूनी सलाह के लिए काम करेगा।
  • यह दावा नहीं करता कि AI अब "चेतन" या "आत्म-जागरूक" है।
  • यह यह सुझाव नहीं देता कि AI अंततः इसे अपने आप पूरी तरह से करना सीख जाएगा; शोध पत्र सुझाव देता है कि हमें AI को तर्कसंगत विकल्प बनाने में मदद करने के लिए इन बाहरी "नियंत्रकों" की आवश्यकता होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →