← नवीनतम पेपर
💬 NLP

Eta Given Delta: Defining LLM Tool Efficiency With Marginal Tool Utility

यह शोध पत्र एलएलएम (LLM) एजेंट प्रक्षेप पथों (trajectories) में उपयोगी टूल कॉल्स की दर का सीधे मूल्यांकन और अनुकूलन करने के लिए "टूल एफिशिएंसी" (tool efficiency) और "मार्जिनल टूल यूटिलिटी" (marginal tool utility) को नए मात्रात्मक मेट्रिक्स के रूप में प्रस्तुत करता है, जिसका उद्देश्य पारंपरिक सटीकता-आधारित मूल्यांकनों के पूरक के रूप में लीन (leaner) टूल सूट्स के निर्माण को निर्देशित करना है।

मूल लेखक: Nyx Iskandar

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nyx Iskandar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए एक ऐसी दुनिया की जहाँ कंप्यूटर सिर्फ बातें नहीं करते, बल्कि वास्तव में काम भी करते हैं। यह AI एजेंट्स (AI Agents) का क्षेत्र है। एक मानक लार्ज लैंग्वेज मॉडल (LLM) के बारे में सोचें जो एक बहुत ही बुद्धिमान लेकिन किताबी छात्र की तरह है जिसे बहुत सारी बातें पता हैं लेकिन वह लाइब्रेरी से बाहर नहीं निकल सकता। इस छात्र को वास्तविक दुनिया में उपयोगी बनाने के लिए, हम उन्हें "टूल्स" (उपकरणों) का एक सेट देते हैं—जैसे कि कैलकुलेटर, सर्च इंजन, या कोड एडिटर—ताकि वे समस्याओं को हल कर सकें, बग्स ठीक कर सकें, या जानकारी खोज सकें। यह आधुनिक AI का रोमांचक मोर्चा है: एक निष्क्रिय मस्तिष्क को एक सक्रिय कार्यकर्ता में बदलना।

हालाँकि, इसमें एक पेंच है। सिर्फ इसलिए कि आपके पास एक टूलबॉक्स है, इसका मतलब यह नहीं है कि हर टूल मददगार होगा। कभी-कभी, जब आपको पेचकस की जरूरत होती है तो हथौड़ा उठा लेना सिर्फ समय बर्बाद करता है और कार्यकर्ता को भ्रमित करता है। अतीत में, वैज्ञानिक मुख्य रूप से इस बात की परवाह करते थे कि अंतिम काम सही ढंग से पूरा हुआ या नहीं ("सटीकता")। लेकिन उन्होंने शायद ही कभी पूछा: "रोबोट ने वहां तक पहुँचने के लिए कितने गलत मोड़ लिए?" या "क्या उसने उन टूल्स का उपयोग करके समय बर्बाद किया जो मददगार नहीं थे?" यह शोध पत्र उस कमी को भरने के लिए आता है, जो एक सरल लेकिन शक्तिशाली प्रश्न पूछता है: AI के टूल उपयोग की दक्षता (Efficiency) कितनी है? लेखक न केवल यह मापना चाहते हैं कि क्या AI सफल रहा, बल्कि यह भी कि वहां तक पहुँचने के लिए उसने अपने टूल्स का कितनी अच्छी तरह से उपयोग किया, जिससे भविष्य के लिए अधिक चुस्त, तेज़ और स्मार्ट AI कार्यकर्ता बनाए जा सकें।


"बेकार टूल" का जासूस

इस शोध पत्र में, लेखक AI द्वारा अपने टूल्स के उपयोग को देखने का एक नया तरीका पेश करते हैं। वे अपने इस नए मीट्रिक को "टूल एफिशिएंसी" (Tool Efficiency - टूल दक्षता) कहते हैं। इसे समझने के लिए, कल्पना कीजिए कि आप एक जासूस को रहस्य सुलझाते हुए देख रहे हैं। उस जासूस के पास गैजेट्स का एक बैग है: एक आवर्धक लेंस (magnifying glass), एक फिंगरप्रिंट किट, एक वॉकी-टॉकी और एक क्रिस्टल बॉल।

यदि जासूस सुराग खोजने के लिए आवर्धक लेंस का उपयोग करता है, तो वह एक उपयोगी कदम है। यदि वह उत्तर का अनुमान लगाने के लिए क्रिस्टल बॉल का उपयोग करता है और वह गलत साबित होता है, तो वह एक बर्बादी है। लेखकों ने महसूस किया कि जबकि हम आमतौर पर केवल यह देखते हैं कि क्या जासूस ने मामला सुलझा लिया, हम आमतौर पर यह नहीं गिनते कि उसने कितनी बार गलत गैजेट उठाया। वे "अच्छे" टूल उपयोग बनाम "बुरे" टूल उपयोग को गिनने का एक तरीका चाहते थे।

गुप्त सामग्री: मार्जिनल टूल यूटिलिटी (Marginal Tool Utility)

यह पता लगाने के लिए कि टूल का उपयोग अच्छा था या बुरा, लेखकों ने "मार्जिनल टूल यूटिलिटी" नामक एक अवधारणा बनाई। यह सुनने में भारी लग सकता है, लेकिन यह वास्तव में काफी सरल है। यह पूछता है: "क्या इस विशिष्ट टूल कॉल ने AI को सही उत्तर के करीब पहुँचने में मदद की, या इसने केवल शोर (noise) पैदा किया?"

इसे परखने के लिए, उन्होंने "LLM-as-a-Judge" नामक एक चतुर तकनीक का उपयोग किया। कल्पना कीजिए कि एक सुपर-स्मार्ट रेफरी जासूस की हर हरकत को देख रहा है। टूल के उपयोग के बाद, रेफरी टूल के उपयोग से पहले की स्थिति और टूल के उपयोग के बाद की स्थिति को देखता है।

  • यदि स्थिति अधिक स्पष्ट दिखती है और जासूस के मामला सुलझाने की संभावना बढ़ जाती है, तो रेफरी थम्स अप (सकारात्मक उपयोगिता) देता है।
  • यदि जासूस केवल भ्रमित हो गया या चक्कर काट रहा है, तो रेफरी थम्स डाउन (गैर-सकारात्मक उपयोगिता) देता है।

लेखकों ने पाया कि उन्हें इस बात की सटीक गणितीय गणना करने की आवश्यकता नहीं थी कि चीजें कितनी बेहतर हुईं; उन्हें केवल परिवर्तन के चिह्न (धनात्मक या ऋणात्मक) को जानने की आवश्यकता थी। इसने उन्हें AI की यात्रा में प्रत्येक टूल कॉल को "उपयोगी" या "उपयोगी नहीं" के रूप में लेबल करने की अनुमति दी।

प्रयोग: अव्यवस्था की सफाई

अपने विचार को सिद्ध करने के लिए, लेखकों ने APEX-SWE Observability नामक एक बेंचमार्क का उपयोग करके एक वास्तविक दुनिया का परीक्षण सेट किया। यह एक कठिन चुनौती है जहाँ AI एजेंटों को लॉग्स (logs) देखकर और अन्य सिस्टम से बात करके कंप्यूटर कोड में बग्स को ठीक करना होता है।

एजेंटों को एक "टूल सूट" दिया गया जिसमें शामिल थे:

  1. Grafana/Lumki: सिस्टम लॉग पढ़ने के लिए एक टूल (जैसे अपराध स्थल की तस्वीरों को देखना)।
  2. Mattermost: टीम के चैट संदेश पढ़ने के लिए एक टूल (जैसे संदिग्धों की गपशप पढ़ना)।
  3. Plane: प्रोजेक्ट टिकट पढ़ने के लिए एक टूल (जैसे केस फाइल पढ़ना)।

लेखकों को संदेह था कि वास्तविक लॉग (Grafana/Loki) पढ़ना बहुत मददगार होगा, लेकिन चैट और टिकट पढ़ना AI को विचलित कर सकता है। इसे परखने के लिए, उन्होंने अलग-अलग टूल सेट के साथ समान 25 कठिन कार्यों को तीन बार चलाया:

  • फुल किट (The Full Kit): तीनों टूल्स उपलब्ध हैं।
  • लॉग-ओनली किट (The Log-Only Kit): केवल लॉग टूल (Grafana/Loki) उपलब्ध है।
  • नो-एक्स्ट्रा-टूल्स किट (The No-Extra-Tools Kit): कोई चैट या टिकट टूल्स नहीं।

उन्हें क्या मिला

परिणाम उनके परिकल्पना की स्पष्ट पुष्टि थे।

1. "चैटर" (बातचीत) को हटाने पर सटीकता में गिरावट नहीं आई।
जब उन्होंने चैट (Mattermost) और टिकट (Plane) टूल्स को हटा दिया, तो AI की सफलता दर लगभग समान रही। वास्तव में, एक मॉडल (GPT-5.3-Codex) के लिए, अतिरिक्त टूल्स हटाने पर सटीकता 0.32 से बढ़कर 0.36 हो गई। इसने साबित कर दिया कि वे अतिरिक्त टूल्स मदद नहीं कर रहे थे; वे केवल अव्यवस्था (clutter) थे।

2. "लॉग" टूल असली हीरो था।
जब उन्होंने लॉग टूल (Grafana/Loki) को हटाया, तो AI का प्रदर्शन गिर गया। GPT मॉडल के लिए सटीकता गिरकर 0.24 और Gemini मॉडल के लिए 0.20 हो गई। इसने पुष्टि की कि लॉग टूल आवश्यक था, जबकि अन्य केवल "बोझ" थे।

3. सफाई करने पर दक्षता (Efficiency) आसमान छू गई।
यहीं पर नया मीट्रिक चमक उठा। बेकार टूल्स को हटाकर, "टूल एफिशिएंसी" नाटकीय रूप से बढ़ गई।

  • GPT मॉडल के लिए, दक्षता फुल किट में 0.359 (लगभग 36% टूल कॉल उपयोगी थे) से बढ़कर लॉग-ओनली किट में 0.720 (72% उपयोगी) हो गई।
  • Gemini मॉडल के लिए, यह 0.367 से 0.593 हो गई।

साधारण शब्दों में: जब AI ने चैट संदेश और प्रोजेक्ट टिकट चेक करने में समय बर्बाद करना बंद कर दिया, तो उसने अपना लगभग दोगुना समय वास्तव में मददगार चीजों करने में बिताया।

"मिडल कॉल" (मध्यम कॉल) का रहस्य

लेखकों ने यह भी गौर किया कि AI गलतियाँ कब करता है। उन्होंने पाया कि AI अक्सर शुरुआत में मजबूत होता है, सही टूल्स (जैसे लॉग पढ़ना) का उपयोग करता है। लेकिन अपने काम के मध्य में, वह अक्सर विचलित हो जाता है, ऐसे टूल्स का उपयोग करता है जो मदद नहीं करते (जैसे चैट पढ़ना) और कदम बर्बाद करता है। यह एक ऐसे जासूस की तरह है जो पहले अपराध स्थल को देखता है, फिर संदिग्ध की डायरी पढ़ने में एक घंटा बिताता है, और उसके बाद ही वापस दृश्य पर जाता है। लेखक सुझाव देते हैं कि भविष्य के AI सिस्टम को इस "मिडल स्लम" (मध्यम गिरावट) को पहचानने के लिए प्रोग्राम किया जा सकता है और उन टूल्स का उपयोग करना बंद करने के लिए कहा जा सकता है जो मदद नहीं कर रहे हैं, जिससे प्रभावी रूप से AI को बहुत अधिक समय बर्बाद करने से पहले "बैकट्रैक" करना सिखाया जा सके।

यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हमें केवल हर संभव टूल के साथ AI एजेंट नहीं बनाने चाहिए। इसके बजाय, हमें इन नए मीट्रिक्स का उपयोग करके "लीन" (Lean - चुस्त) टूल सूट्स बनाने चाहिए। जिस तरह एक बढ़ई ढीले पेंच को ठीक करने के लिए हथौड़ा, आरी और ड्रिल लेकर नहीं जाता, उसी तरह एक AI को उन टूल्स को ले जाने की ज़रूरत नहीं है जिनकी उसे आवश्यकता नहीं है।

लेखक सुझाव देते हैं कि मार्जिनल टूल यूटिलिटी और टूल एफिशिएंसी को मापकर, डेवलपर्स ऐसे AI एजेंट बना सकते हैं जो न केवल सटीक हैं, बल्कि चलाने में तेज़ और सस्ते भी हैं। उनका तर्क है कि यह AI एजेंटों को वास्तव में कुशल बनाने की दिशा में एक महत्वपूर्ण कदम है, न कि केवल "बुद्धिमान लेकिन अनाड़ी" बनाने की। वे यह दावा नहीं करते कि उन्होंने सब कुछ हल कर दिया है, लेकिन उन्होंने समुदाय को यह मापने के लिए एक नया पैमाना दे दिया है कि हमारे AI कार्यकर्ता वास्तव में कितना अच्छा काम कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →