← नवीनतम पेपर
💬 NLP

Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity

यह शोध पत्र यह प्रकट करता है कि वर्तमान LLM-आधारित एजेंटों में "पर्यावरणीय जिज्ञासा" (environmental curiosity) का अभाव है, जो उच्च पहचान दरों के बावजूद अपने परिवेश में खोजे गए अप्रत्याशित, कार्य-प्रासंगिक सूचनाओं को पहचानने और उनका लाभ उठाने में अक्सर विफल रहते हैं, जो एक ऐसी सीमा है जो टूल की उपलब्धता, कंप्यूट और प्रशिक्षण डेटा जैसे कारकों द्वारा संचालित होती है और अंततः उनके समग्र प्रदर्शन को बाधित करती है।

मूल लेखक: Leon Engländer, Sophia Althammer, Ahmet Üstün, Matthias Gallé, Tom Sherborne

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leon Engländer, Sophia Althammer, Ahmet Üstün, Matthias Gallé, Tom Sherborne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "स्मार्ट लेकिन लापरवाह" जासूस

कल्पना कीजिए कि आपने एक रहस्य सुलझाने के लिए एक शानदार जासूस (एक AI एजेंट) को काम पर रखा है। आप उन्हें एक आवर्धक लेंस (magnifying glass) और एक नक्शा देते हैं। वे इधर-उधर देखने में बहुत माहिर हैं। उन्हें फर्श पर एक छिपा हुआ नोट मिलता है जिस पर लिखा है, "इस रहस्य का उत्तर ठीक इसी नोट में लिखा है।"

एक आदर्श दुनिया में, जासूस को वह नोट उठाना चाहिए, उसे पढ़ना चाहिए और तुरंत केस सुलझा लेना चाहिए।

लेकिन इस शोध पत्र में, लेखकों ने पाया कि वर्तमान AI जासूस अजीब तरह से जिद्दी हैं। वे नोट को पाते हैं, उस पर एक नज़र डालते हैं, और फिर तुरंत उसे वापस रख देते हैं और कमरे में इधर-उधर घूमते रहते हैं, जैसे कि उन्होंने नोट देखा ही न हो, और पहेली को "कठिन तरीके" से सुलझाने की कोशिश करते रहते हैं।

यह शोध पत्र इस गायब गुण को "एन्वायरमेंटल क्यूरियोसिटी" (पर्यावरणीय जिज्ञासा) कहता है। यह यह कहने की क्षमता है कि, "रुको, मुझे कुछ अप्रत्याशित मिला है जो मेरी मदद कर सकता है। मुझे इसकी जांच करनी चाहिए!" बजाय इसके कि वे केवल एक पूर्व-निर्धारित स्क्रिप्ट पर चलते रहें।


प्रयोग: "चीट कोड" टेस्ट

इसे साबित करने के लिए, शोधकर्ताओं ने तीन अलग-अलग प्रकार की पहेलियों (जिन्हें बेंचमार्क कहा जाता है: Terminal-Bench, SWE-Bench, और AppWorld) के साथ एक गेम सेट किया।

सेटअप:
उन्होंने पहेली का पूरा समाधान गुप्त रूप से AI की नाक के ठीक सामने छिपा दिया था।

  • कुछ मामलों में, उन्होंने एक फोल्डर में solution.sh नाम की एक फाइल छोड़ी (जैसे कि एक चीट कोड)।
  • अन्य मामलों में, उन्होंने एक मेनू में एक विशेष कमांड जोड़ा जिसमें स्पष्ट लिखा था, "उत्तर पाने के लिए इसे टाइप करें।"

परिणाम:

  1. खोज (Discovery): AI लगभग हर बार (80-90% बार) चीट कोड को ढूंढ लेता था। उसने फाइल देखी। उसने मेनू को पढ़ा।
  2. इंटरैक्शन (Interaction): लेकिन फिर? उसने इसे अनदेखा कर दिया।
    • "AppWorld" टेस्ट पर, AI ने "Get Solution" बटन को 97% बार देखा, लेकिन उसे 1% से भी कम बार क्लिक किया।
    • यह एक ऐसे शेफ की तरह था जिसे एक रेसिपी कार्ड मिलता है जिस पर लिखा है "यहाँ तैयार केक है" लेकिन वह फिर भी केक को शुरू से बनाने का फैसला करता है क्योंकि वह अपनी दिनचर्या को तोड़ना नहीं चाहता।

ऐसा क्यों होता है? (तीन मुख्य कारण)

शोधकर्ताओं ने जांच की कि AI ऐसा व्यवहार क्यों करता है और उन्हें तीन मुख्य कारण मिले:

1. बहुत अधिक टूल्स (द "स्विस आर्मी नाइफ" समस्या)

जब AI के पास एक सरल टूल (केवल एक बेसिक कमांड लाइन) होता है, तो उसे समझने के लिए इधर-उधर देखना पड़ता है। लेकिन जब आप उसे शानदार टूल्स (जैसे कि एक सुपर-पावरफुल फाइल एडिटर) देते हैं, तो वह आलसी हो जाता है।

  • उपमा (Analogy): यदि आप एक बच्चे को एक साधारण छड़ी देते हैं, तो वह इधर-उधर देखने लगेगा कि वह क्या कुरेद सकता है। यदि आप उन्हें एक हाई-टेक लेजर पॉइंटर देते हैं, तो वे बिना आसपास देखे बस बटन दबाना शुरू कर देते हैं। उनके पास जितने अधिक टूल्स होंगे, वे अपने परिवेश को उतना ही कम देखेंगे।

2. पर्याप्त गहराई से न सोचना (द "स्पीड बनाम डेप्थ" ट्रेड-ऑफ)

जब AI को "कठोरता से सोचने" या अधिक समय देने के लिए कहा जाता है, तो वह थोड़ा अधिक जिज्ञासु हो जाता है।

  • उपमा: यदि आप किसी को जल्दबाजी में रखते हैं, तो वे दीवार पर लगे संकेत को मिस कर सकते हैं। यदि आप उनसे कहते हैं, "समय लें और वास्तव में चारों ओर देखें," तो उनके द्वारा संकेत को नोटिस करने की संभावना अधिक होती है। लेकिन जब वे गहराई से सोचते हैं, तब भी वे अक्सर स्पष्ट चीट कोड को मिस कर देते हैं।

3. खराब ट्रेनिंग (द "नैरो स्पेशलिस्ट" समस्या)

यह सबसे बड़ी समस्या है। AI को विशिष्ट प्रकार के कार्यों पर प्रशिक्षित किया जाता है। यदि यह केवल कोड ठीक करना सीखता है, तो यह कोड ठीक करने में बहुत अच्छा हो जाता है लेकिन यह भूल जाता है कि किसी भी अन्य चीज़ के प्रति जिज्ञासु कैसे होना है।

  • उपमा: कल्पना कीजिए कि एक कुत्ते को केवल टेनिस बॉल लाने के लिए प्रशिक्षित किया गया है। यदि आप उसकी ओर एक फ्रिसबी फेंकते हैं, तो कुत्ता उसे अनदेखा कर सकता है क्योंकि उसे कभी फ्रिसबी के प्रति जिज्ञासु होने के लिए नहीं सिखाया गया है। AI को एक विशिष्ट पथ का पालन करने के लिए प्रशिक्षित किया जाता है, इसलिए जब वह एक शॉर्टकट देखता है, तो वह सोचता है, "यह वह रास्ता नहीं है जिस पर मुझे प्रशिक्षित किया गया था," और वह लंबे रास्ते पर चलता रहता है।

"मैजिक प्रॉम्प्ट" फिक्स (और यह पर्याप्त क्यों नहीं है)

शोधकर्ताओं ने AI को एक विशेष निर्देश देकर इसे ठीक करने की कोशिश की: "जिज्ञासु बनो! कार्य करने से पहले जो कुछ भी तुम पाते हो उसे देखो!"

  • अच्छी खबर: इससे मदद मिली! AI ने चीट कोड्स को अधिक बार देखना शुरू कर दिया, और इसने वास्तव में पहेलियों को बेहतर ढंग से हल किया।
  • बुरी खबर: सबसे अच्छे निर्देशों, सबसे अच्छे टूल्स और सोचने के सबसे अधिक समय के बावजूद, AI अभी भी आधे से अधिक समय में समाधान को अनदेखा कर देता था।

निष्कर्ष: हमें इसकी परवाह क्यों करनी चाहिए?

शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI एजेंट ओपन-लूप जनरेटर्स (open-loop generators) हैं। वे एक ट्रैक पर चलने वाली ट्रेन की तरह हैं: वे आगे बढ़ते हैं, अगले स्टेशन की तलाश करते हैं जिसकी वे अपेक्षा करते हैं, और चलते रहते हैं। उनके पास यह कहने की क्षमता नहीं है कि, "रुको, मैं देख रहा हूँ कि यहाँ एक नया ट्रैक अलग हो रहा है। शायद मुझे उस तरफ जाना चाहिए।"

यह क्यों मायने रखता है?

  • वास्तविक जीवन अव्यवस्थित है: वास्तविक दुनिया में, आप सब कुछ अनुमानित नहीं कर सकते। आपको एक ऐसे एजेंट की आवश्यकता है जो किसी आश्चर्य को पहचान सके और अनुकूलित हो सके।
  • भंगुर AI (Brittle AI): यदि कोई AI केवल एक स्क्रिप्ट का पालन करता है, तो वह विफल हो जाएगा जैसे ही दुनिया थोड़ी सी बदल जाएगी।
  • भविष्य: वास्तव में स्मार्ट AI बनाने के लिए, हमें उन्हें केवल कार्य करना ही नहीं, बल्कि यह नोटिस करना भी सिखाना होगा कि कब कुछ अप्रत्याशित होता है और अपने प्लान को बदलना है।

संक्षेप में: हमारे AI एजेंट निर्देशों का पालन करने में अविश्वसनीय रूप से स्मार्ट हैं, लेकिन वे आश्चर्यजनक रूप से जिज्ञासु होने में बहुत खराब हैं। वे "चीट कोड्स" को पाते हैं लेकिन उनका उपयोग करने से इनकार कर देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →