← नवीनतम पेपर
🤖 AI

Uncertainty Decomposition for Clarification Seeking in LLM Agents

यह शोध पत्र इंटरैक्टिव LLM एजेंटों के लिए शास्त्रीय अनिश्चितता ढांचों की सीमाओं को संबोधित करते हुए एक प्रॉम्प्ट-आधारित अपघटन प्रस्तावित करता है जो सक्रिय स्पष्टीकरण चाहने में सक्षम करने के लिए क्रिया आत्मविश्वास (action confidence) को अनुरोध अनिश्चितता (request uncertainty) से अलग करता है, जो कई मॉडल बैकबोन पर जानबूझकर कम-निर्दिष्ट कार्यों वाले बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Gregory Matsnev

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gregory Matsnev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अति-आत्मविश्वासी, व्यक्तिगत सहायक (personal assistant) को काम करने के लिए रख रहे हैं। आप उन्हें निर्देशों की एक सूची देते हैं, जैसे "एक शर्ट खरीदो" या "मग को डेस्क पर रख दो।"

कभी-कभी, आप उन्हें महत्वपूर्ण विवरण बताना भूल जाते हैं, जैसे शर्ट का रंग या कौन सा डेस्क। अतीत में, यदि इस सहायक को नहीं पता होता था कि क्या करना है, तो वे या तो:

  1. मनमाना अनुमान लगाते थे और एक लाल शर्ट खरीद लेते थे जबकि आपको नीली चाहिए थी, और फिर पूरे आत्मविश्वास से कहते थे, "मुझे 90% यकीन है कि यह सही है!" (यह एक गलती है)।
  2. कहते थे कि वे भ्रमित हैं लेकिन कोई कारण भी नहीं बताते थे, जिससे आपके लिए यह जानना मुश्किल हो जाता था कि वे केवल एक कठिन कार्य के कारण संघर्ष कर रहे हैं या आपने वास्तव में उन्हें पर्याप्त जानकारी नहीं दी है।

यह शोध पत्र इन AI सहायकों को इस भ्रम को बेहतर ढंग से संभालने के लिए प्रशिक्षित करने का एक नया तरीका पेश करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

मुख्य समस्या: एक संख्या पर्याप्त नहीं है

वर्तमान में, अधिकांश AI सहायक हर कार्य के लिए आपको एक एकल "कॉन्फिडेंस स्कोर" (जैसे 0 से 100 तक का ग्रेड) देते हैं।

  • दोष: यदि सहायक कहता है, "मैं केवल 40% आश्वस्त हूँ," तो आपको पता नहीं चलता कि क्यों
    • क्या यह इसलिए है क्योंकि कार्य कठिन है? (जैसे, "वहाँ 500 शर्ट्स हैं जिनमें से चुनने के लिए, और मुझे यकीन नहीं है कि आपको कौन सी पसंद आएगी।")
    • या इसलिए क्योंकि आपने पर्याप्त जानकारी नहीं दी? (जैसे, "आपने मुझे एक शर्ट खरीदने के लिए कहा, लेकिन आपने रंग या आकार नहीं बताया!")
      यदि सहायक इसलिए भ्रमित है क्योंकि आप विवरण देना भूल गए हैं, तो उन्हें केवल अनुमान नहीं लगाना चाहिए; उन्हें आपसे पूछना चाहिए, "हे, आप कौन सा रंग चाहते हैं?" पुराना सिस्टम "यह कठिन है" और "आप कुछ बताना भूल गए हैं" के बीच अंतर नहीं कर सका।

समाधान: "कॉन्फिडेंस" को दो भागों में बांटना

लेखक एक सरल ट्रिक का प्रस्ताव करते हैं: AI से केवल एक कॉन्फिडेंस स्कोर मांगने के बजाय, वे इसकी आंतरिक सोच प्रक्रिया में दो अलग-अलग स्कोर मांगते हैं:

  1. एक्शन कॉन्फिडेंस (Action Confidence): "मैं इस विशिष्ट कार्य के सफल होने के प्रति कितना आश्वस्त हूँ, यह मानते हुए कि मैं लक्ष्य को सही ढंग से समझ रहा हूँ?"
    • उपमा: "मुझे 90% यकीन है कि मैं स्टोर तक जा सकता हूँ, लेकिन मुझे नहीं पता कि आप कौन सा स्टोर चाहते हैं।"
  2. रिक्वेस्ट अनसर्टेन्टी (Request Uncertainty): "आपके निर्देशों में कितनी जानकारी गायब है?"
    • उपमा: "आपने मुझे स्टोर का नाम या रंग नहीं बताया। मैं 100% अनिश्चित हूँ क्योंकि आपने विवरण छोड़ दिए।"

इन दोनों को अलग करके, AI को एक समर्पित "चैनल" मिलता है यह कहने के लिए कि, "मैं जानता हूँ कि क्या करना है, लेकिन मुझे आपसे अधिक जानकारी चाहिए," बजाय इसके कि वह केवल यह कहे कि "मैं भ्रमित हूँ।"

प्रयोग: "मिसिंग डिटेल्स" टेस्ट

यह साबित करने के लिए कि यह काम करता है, शोधकर्ताओं ने दो नए वीडियो-गेम जैसे परीक्षण (WebShop और ALFWorld) बनाए जहाँ उन्होंने जानबूझकर 5ों निर्देशों में से 50% छिपा दिए

  • सेटअप: उन्होंने AI को बताया, "एक शर्ट खरीदें," लेकिन प्रॉम्प्ट से "काला" और "साइज लार्ज" शब्द हटा दिए।
  • लक्ष्य: वे देखना चाहते थे कि क्या AI रुककर पूछेगा, "रंग और साइज क्या है?" बजाय इसके कि वह केवल अनुमान लगाए।

उन्होंने इस "दो-स्कोर" पद्धति का परीक्षण पुराने तरीकों (जो केवल एक स्कोर का उपयोग करते थे) के मुकाबले पांच अलग-अलग शक्तिशाली AI मॉडल्स का उपयोग करके किया।

परिणाम

  • पूछने में बेहतर: नया तरीका गायब जानकारी को पहचानने में बहुत बेहतर था। औसतन, इसने पुराने तरीकों की तुलना में स्पष्टीकरण मांगने की क्षमता में 73% सुधार किया। इसने परीक्षण किए गए लगभग हर AI मॉडल में छूटे हुए विवरणों की सफलतापूर्वक पहचान की।
  • कौशल में कोई कमी नहीं: महत्वपूर्ण रूप से, AI को यह अतिरिक्त "सोचने का चरण" देने से वह कार्यों को करने में खराब नहीं हुआ। इसने समस्याओं को हल करने की अपनी क्षमता नहीं खोई; यह बस यह जानने में बेहतर हो गया कि कब रुकना है और पूछना है।

कमी: "ब्रेन ड्रेन" (Brain Drain)

शोध में एक खामी भी मिली, जिसे वे "कैपेबिलिटी डाइल्यूशन" (Capability Dilution) कहते हैं।

  • रूपक: कल्पना कीजिए कि AI के पास सीमित मानसिक ऊर्जा (जैसे एक बैटरी) है। आमतौर पर, वह कार्य को हल करने के लिए अपनी 100% बैटरी का उपयोग करता है। अब, उसे अपनी बैटरी को बांटना होगा: कुछ कार्य को हल करने के लिए, कुछ अपने कॉन्फिडेंस को चेक करने के लिए, और कुछ यह चेक करने के लिए कि क्या आपने पर्याप्त जानकारी दी है।
  • परिणाम: क्योंकि वह अपनी ऊर्जा को विभाजित कर रहा है, इसलिए वह कभी-कभी पहले की तुलना में कार्य थोड़ा खराब करता है। यह एक ऐसे धावक की तरह है जो स्प्रिंट करने में बहुत अच्छा है लेकिन थोड़ा धीमा हो जाता है क्योंकि वह साथ ही अपनी घड़ी भी देख रहा है और कोच से बात भी कर रहा है।

बड़ा निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि हालांकि यह "दो-स्कोर" ट्रिक अभी के लिए अच्छी है, लेकिन यह एक 'हैक' (जुगाड़) है। यह AI को प्रॉम्प्ट में शब्दों को बदलकर अतिरिक्त सोचने के लिए मजबूर करता है।

उनका तर्क है कि भविष्य बेहतर प्रॉम्प्ट्स के बारे में नहीं है, बल्कि AI को खुद फिर से प्रशिक्षित करने के बारे में है। उनका मानना है कि अगली पीढ़ी के AI को बुनियादी स्तर से ही ऐसा बनाया जाना चाहिए कि वह स्वाभाविक रूप से "यह कठिन है" और "आप कुछ बताना भूल गए हैं" के बीच अंतर समझ सके, बिना किसी प्रॉम्प्ट द्वारा ठगे गए।

संक्षेप में: यह पेपर दिखाता है कि यदि आप एक AI को यह सिखाते हैं कि "मुझे उत्तर नहीं पता" और "आपने मुझे सवाल नहीं दिया" को अलग कैसे करना है, तो वह मदद मांगने में बहुत बेहतर हो जाता है। लेकिन इसे सरल टेक्स्ट निर्देशों के माध्यम से करने से उसकी समग्र मानसिक शक्ति (brainpower) थोड़ी कम हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →