← नवीनतम पेपर
💬 NLP

Planning to Explore: Curiosity-Driven Planning for LLM Test Generation

यह शोध पत्र CovQValue को प्रस्तुत करता है, जो एक जिज्ञासा-संचालित (curiosity-driven) योजना पद्धति है जो कोड ब्रांच संरचना को एक अज्ञात वातावरण के रूप में मानती है और सूचनात्मक परीक्षण जनरेशन योजनाओं को चुनने के लिए LLM-अनुमानित Q-मानों का उपयोग करती है, जो मौजूदा और नए प्रस्तावित दोनों बेंचमार्क पर उच्च ब्रांच कवरेज प्राप्त करने में ग्रीडी (greedy) दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Alfonso Amayuelas, Firas Laakom, Piotr Piękos, Wenyi Wang, Yifan Xu, Yuhui Wang, Jürgen Schmidhuber, William Wang

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alfonso Amayuelas, Firas Laakom, Piotr Piękos, Wenyi Wang, Yifan Xu, Yuhui Wang, Jürgen Schmidhuber, William Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Planning to Explore" पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: "लालची" खोजकर्ता (The "Greedy" Explorer)

कल्पना कीजिए कि आप एक विशाल, अज्ञात महल की खोज कर रहे हैं एक खजाना खोजने वाले (treasure hunter) हैं। आपका लक्ष्य हर एक छिपे हुए कमरे और गुप्त रास्ते को खोजना है।

कंप्यूटर टेस्ट लिखने के लिए इस्तेमाल किए जाने वाले अधिकांश वर्तमान AI टूल्स (LLMs) "लालची खोजकर्ताओं" (greedy explorers) की तरह काम करते हैं।

  • ये कैसे काम करते हैं: ये अपने ठीक सामने वाले गलियारे को देखते हैं। यदि वे एक ऐसा दरवाज़ा देखते हैं जो उन्हें एक ऐसे कमरे तक ले जाता है जहाँ वे अभी तक नहीं गए हैं, तो वे तुरंत उसके अंदर चले जाते हैं।
  • खामी: क्या होगा अगर सबसे कीमती खजाना महल के बहुत अंदर किसी कमरे में हो, लेकिन वहाँ पहुँचने के लिए आपको पहले एक लंबे, उबाऊ गलियारे से होकर गुजरना पड़े जहाँ कोई भी दरवाज़ा न हो?
  • परिणाम: लालची खोजकर्ता शुरुआती कुछ कमरों में ही फंस कर रह जाता है। वे बार-बार उन्हीं आसान दरवाजों को खोलते रहते हैं क्योंकि उन्हें केवल अभी इसी वक्त कुछ नया खोजने की परवाह होती है। उन्हें कभी यह अहसास नहीं होता कि उस उबाऊ गलियारे से गुजरना ही बाद में गुप्त तिजोरी को खोलने का एकमात्र रास्ता है।

कंप्यूटर की भाषा में, इसे "करिडोर प्रॉब्लम" (Corridor Problem) कहा जाता है। गहरे, जटिल कोड तक पहुँचने के लिए, आपको अक्सर चरणों का एक क्रम सेट करने की आवश्यकता होती है (जैसे लॉग इन करना, डेटाबेस को इनिशियलाइज़ करना, या विशिष्ट फ़ाइलों को इम्पोर्ट करना)। यदि आप ये चरण नहीं करते हैं, तो आपको शून्य "कवरेज" (coverage) मिलेगा (यानी आप नए कोड को देख ही नहीं पाएंगे)। लालची AI कोशिश करना छोड़ देता है क्योंकि उसे लगता है कि वह अपना समय बर्बाद कर रहा है।

समाधान: "जिज्ञासु योजनाकार" (The "Curious Planner" - CovQValue)

इस पेपर के लेखकों ने CovQValue नामक एक स्मार्ट दृष्टिकोण प्रस्तावित किया है। केवल अगले कदम को देखने के बजाय, यह AI एक नक्शे के साथ रणनीतिक खोजकर्ता की तरह काम करता है।

यह हमारे महल वाली उपमा का उपयोग करते हुए कैसे काम करता है, यहाँ बताया गया है:

1. नक्शा (The Coverage Map)

हर बार जब AI एक टेस्ट आज़माता है, तो वह महल का एक "नक्शा" अपडेट करता है। यह नक्शा दिखाता है कि कौन से कमरे (कोड ब्रांचेस) देखे जा चुके हैं और कौन से अभी भी अंधेरे और अज्ञात हैं।

  • पुराना तरीका: AI हर कदम के बाद नक्शा भूल जाता है।
  • नया तरीका: AI लगातार नक्शे को देखता रहता है कि वह कहाँ गया है और उसे कहाँ जाने की ज़रूरत है।

2. "क्या होगा अगर" का खेल (Planning)

केवल एक दरवाज़ा खोलने के बजाय, AI एक साथ तीन अलग-अलग साहसिक योजनाओं (adventure plans) की कल्पना करता है:

  • योजना A: सामने के दरवाजे को तोड़ने की कोशिश करें (आसान, लेकिन शायद इसके पीछे कुछ नया न मिले)।
  • योजना B: लाइब्रेरी तक जाने के लिए लंबे, उबाऊ गलियारे से होकर गुजरें (शुरुआत में उबाऊ, लेकिन यह एक खजाने के कमरे की ओर ले जाता है)।
  • योजना C: मीनार पर चढ़ें (जोखिम भरा, गिर सकते हैं, लेकिन एक नया नज़ारा मिलेगा)।

3. "जिज्ञासा स्कोर" (The "Curiosity Score" - Q-Value)

यही असली जादू है। AI केवल यह नहीं पूछता, "कौन सी योजना अभी एक नया कमरा ढूंढती है?"
बल्कि यह पूछता है: "कौन सी योजना मुझे लंबे समय में महल के बारे में सबसे अधिक सिखाएगी?"

यह प्रत्येक योजना को दो चीजों के आधार पर एक स्कोर देता है:

  1. तत्काल लाभ (Immediate Gain): यह योजना आज कितने नए कमरे खोलती है?
  2. भविष्य की क्षमता (Future Potential): यदि मैं इस योजना को अपनाता हूँ, तो क्या यह उन भविष्य के दरवाजों को खोलेगा जो वर्तमान में बंद हैं?

उपमा:

  • लालची AI लंबे गलियारे को देखता है और कहता है, "यहाँ कोई नया कमरा नहीं है! मैं इसे छोड़ दूँगा।"
  • CovQValue AI उस गलियारे को देखता है और कहता है, "इस गलियारे में अभी कोई दरवाजे नहीं हैं, लेकिन अगर मैं अंत तक चलता हूँ, तो मैं मास्टर बेडरूम की चाबी पा लूँगा। मैं इस योजना को चुनूँगा!"

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने RepoExploreBench नामक एक नया "प्रशिक्षण मैदान" बनाया। कल्पना कीजिए कि यह 93 अलग-अलग, जटिल सॉफ्टवेयर "महलों" (Flask, Requests, और Pydikeant जैसे Python पैकेज) का एक सेट है।

उन्होंने तीन अलग-अलग AI मॉडल्स (Gemini, GPT, और Mistral) का उपयोग करके लालची AI को जिज्ञासु योजनाकार (CovQValue) के खिलाफ खड़ा किया।

परिणाम:

  • लालची AI जल्दी ही फंस गया। उसने आसान कमरों को खोजा और हार मान ली, जिससे केवल 30-50% महल कवर हुआ।
  • जिज्ञासु योजनाकार चलता रहा। वह गहरे रहस्यों को खोलने के लिए "उबाऊ" चरणों को उठाने के लिए तैयार था। इसने लालची दृष्टिकोण की तुलना में कोड के 40% से 77% अधिक हिस्से को कवर किया।
  • समझौता (Trade-off): जिज्ञासु योजनाकार थोड़ा अधिक "जोखिम भरा" था। इसने अधिक कठिन और अजीब चीजें आज़माईं, इसलिए इसके कुछ टेस्ट फेल (क्रैश) हो गए। लेकिन क्योंकि यह सच खोजने के लिए क्रैश होने को भी तैयार था, इसने लालची AI की तुलना में कहीं अधिक छिपा हुआ कोड खोज निकाला।

यह क्यों महत्वपूर्ण है

यह पेपर साबित करता है कि AI को केवल प्रतिक्रिया देने वाला नहीं, बल्कि धैर्यवान और रणनीतिक होना चाहिए।

  • सॉफ्टवेयर के लिए: इसका मतलब है कि हम कोड के उन गहरे, जटिल हिस्सों में बग्स (bugs) को स्वचालित रूप से ढूंढ सकते हैं जिन्हें इंसान और वर्तमान टूल्स मिस कर देते हैं।
  • भविष्य के लिए: यह "जिज्ञासा" केवल कोड के लिए नहीं है। यह रोबोटों को अज्ञात वातावरण की खोज करने, वैज्ञानिकों को नए प्रयोगों को डिजाइन करने, या AI एजेंटों को केवल तात्कालिक क्षण पर प्रतिक्रिया देने के बजाय आगे की योजना बनाकर जटिल वास्तविक दुनिया के सिस्टम को नेविगेट करने में मदद कर सकती है।

संक्षेप में: केवल अपने सामने वाले दरवाजे को न देखें। नक्शे को देखें, भविष्य की कल्पना करें, और उस उबाऊ गलियारे से गुजरने के लिए तैयार रहें यदि इसका अर्थ अंत में खजाना पाना है। यही Curiosity-Driven Planning की शक्ति है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →