← नवीनतम पेपर
💻 computer science

When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation

यह अन्वेषणात्मक अध्ययन प्रकट करता है कि जहाँ प्रॉम्प्ट का अल्प-निर्धारण (under-specification) आमतौर पर संरचनात्मक रूप से न्यूनतम बेंचमार्क पर कोड जनरेशन को खराब कर देता है, वहीं यह भ्रामक संकेतों को बाधित करके लाइवकोडबेंच (LiveCodeBench) जैसे समृद्ध कार्यों पर आश्चर्यजनक रूप से शुद्धता में सुधार कर सकता है, जो यह दर्शाता है कि प्रॉम्प्ट सुदृढ़ता (robustness) मॉडल के एक निश्चित गुण के बजाय कार्य की संरचना पर अत्यधिक निर्भर है।

मूल लेखक: Amal AKLI, Mike PAPADAKIS, Maxime CORDY, Yves Le TRAON

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amal AKLI, Mike PAPADAKIS, Maxime CORDY, Yves Le TRAON

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े शाब्दिक अर्थ निकालने वाले (literal-minded) सहायक को आपके लिए कंप्यूटर प्रोग्राम लिखने के लिए काम पर रख रहे हैं। आप उसे निर्देशों का एक सेट (एक "प्रॉम्ट") देते हैं। लंबे समय तक, विशेषज्ञों का मानना था कि आपके निर्देश जितने सटीक, विस्तृत और सख्त होंगे, आपका सहायक उतना ही बेहतर काम करेगा। यदि आपने कोई विवरण छोड़ दिया, तो सहायक भ्रमित हो जाएगा और विफल हो जाएगा।

यह शोध उस पुराने विश्वास को चुनौती देता है। शोधकर्ताओं ने पाया कि कभी-कभी, अपने सहायक को कम विवरण देना वास्तव में उन्हें बेहतर कोड लिखने में मदद करता है।

उन्होंने इसे कैसे खोजा, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. "परीक्षाओं" के दो प्रकार

शोधकर्ताओं ने इस विचार का परीक्षण AI मॉडल के दो अलग-अलग प्रकार के "परीक्षाओं" (बेंचमार्क) पर किया:

  • "फ्लैशकार्ड" परीक्षा (HumanEval): ये छोटे, एकल-वाक्य वाले फ्लैशकार्ड की तरह हैं। निर्देश बहुत संक्षिप्त होते हैं, जिनमें कोई अतिरिक्त संदर्भ नहीं होता। यह पूछने जैसा है, "इस सूची को सॉर्ट करने के लिए एक फंक्शन लिखें।"
  • "पाठ्यपुस्तक" परीक्षा (LiveCodeBench): ये पूरी पाठ्यपुस्तक के अध्यायों की तरह हैं। इनमें एक लंबी कहानी, नियमों की एक सूची, इनपुट और आउटपुट के उदाहरण और विशिष्ट बाधाएं (constraints) शामिल होती हैं। यह कहने जैसा है, "यहाँ नामों की सूची को सॉर्ट करने की एक कहानी है। यहाँ नियम हैं: नाम 10 अक्षरों से लंबे नहीं हो सकते, और यहाँ एक उदाहरण है कि इनपुट कैसा दिखता है..."

2. प्रयोग: निर्देशों को "तोड़ना"

शोधकर्ताओं ने इन निर्देशों को यह देखने के लिए जानबूझकर तीन तरीकों से "उत्परिवर्तित" (mutate) किया कि क्या होगा:

  • अस्पष्टता (LV): उन्होंने विशिष्ट शब्दों को अस्पष्ट शब्दों से बदल दिया (जैसे, "sort" को "arrange" में बदलना)।
  • अल्प-निर्धारण (US): उन्होंने एक विशिष्ट नियम या बाधा को हटा दिया (जैसे, संख्याओं के आकार के बारे में एक नियम हटाना)।
  • बिखरा हुआ स्वरूप (SF): उन्होंने टाइपो (लिखने की गलतियाँ) जोड़े या स्पेसिंग बदल दी।

3. आश्चर्यजनक परिणाम

परिणाम इस बात पर बहुत अलग थे कि AI कौन सी "परीक्षा" दे रहा है:

  • "फ्लैशकार्ड" परीक्षा पर: जब शोधकर्ताओं ने विवरण हटाए या शब्दों को अस्पष्ट बनाया, तो AI का प्रदर्शन क्रैश हो गया। ठीक वैसे ही जैसे एक छात्र घबरा जाता है जब शिक्षक एक छोटी क्विज़ से संकेत हटा देता है, AI भ्रमित हो गया और टूटा हुआ कोड लिखा।
  • "पाठ्यपुस्तक" परीक्षा पर: जब उन्होंने ऐसा ही किया, तो AI का प्रदर्शन वैसा ही रहा या, आश्चर्यजनक रूप से, बेहतर हो गया

"नेट ज़ीरो" का भ्रम:
शुरुआत में, शोधकर्ताओं को लगा कि "पाठ्यपुस्तक" परीक्षा वाला AI इन बदलावों की परवाह नहीं करता है। लेकिन जब उन्होंने बारीकी से देखा, तो उन्हें एक खींचतान (tug-of-war) मिली।

  • कुछ बदलावों ने AI को विफल कर दिया (गिरावट/degradation)।
  • लेकिन लगभग बराबर संख्या में बदलावों ने AI को वहां सफल बनाया जहां वह पहले विफल हुआ था (सुधार/improvement)।
  • इन दो शक्तियों ने एक-दूसरे को रद्द कर दिया, जिससे ऐसा लगा कि कुछ भी नहीं हुआ।

4. "कम" कभी-कभी "अधिक" क्यों होता है?

शोधकर्ताओं को एक दिलचस्प कारण मिला कि नियम हटाने से कोड ठीक क्यों हो जाता है। यह बुरी आदतों और "संकेतों" (cues) के बारे में है।

कल्पना कीजिए कि AI एक ऐसे छात्र की तरह है जिसने एक विशिष्ट पाठ्यपुस्तक से उत्तर रट लिए हैं।

  • जाल (The Trap): कभी-कभी, प्रॉम्ट में एक विशिष्ट शब्द या एक विशिष्ट संख्या एक "ट्रिगर" की तरह काम करती है। यह AI को एक रटे हुए समाधान की याद दिलाती है जो दिखने में तो सही लगता है लेकिन वास्तव में इस विशिष्ट समस्या के लिए गलत होता है।
    • पेपर से उदाहरण: एक समस्या में "Currency" (मुद्रा) का उल्लेख किया गया। इस शब्द ने AI को वित्तीय विनिमय दरों (financial exchange rates) के बारे में सोचने के लिए ट्रिगर किया, जिससे वह एक पीछे की ओर सोचने वाले एल्गोरिदम का उपयोग करने लगा।
  • समाधान (The Fix): जब शोधकर्ताओं ने "Currency" शब्द को हटाया और उसे एक अस्पष्ट शब्द जैसे "Resource" से बदल दिया, तो AI ने अपनी "वित्तीय स्मृति" (financial memory) को ट्रिगर करना बंद कर दिया। इसके बजाय, उसे समस्या की संरचना के बारे में शून्य से सोचने के लिए मजबूर किया गया। इससे एक सही समाधान की ओर ले गया।

दूसरे शब्दों में, प्रॉम्ट में अतिरिक्त विवरण कभी-कभी अनजाने में AI को गलत रास्ते पर ले जाने वाला "संकेत" दे देते हैं। उस संकेत को हटाने से AI को सही ढंग से काम करने के लिए मजबूर किया जाता है।

5. मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि मजबूती (robustness) इस बारे में नहीं है कि AI कितना बड़ा है (चाहे वह छोटा हो या विशाल मॉडल); यह इस बारे में है कि निर्देश कैसे बनाए गए हैं।

  • यदि आप AI को एक छोटा, एकल-वाक्य वाला प्रॉम्ट देते हैं, तो यह बहुत नाजुक होता है। यदि आप शब्दों के साथ छेड़छाड़ करते हैं, तो यह विफल हो जाता है।
  • यदि आप AI को एक समृद्ध, बहु-स्तरीय प्रॉम्ट (उदाहरणों, बाधाओं और प्रारूपों के साथ) देते हैं, तो यह बहुत अधिक मजबूत होता है। इसके पास निर्भर रहने के लिए "बैकअप सिग्नल" होते हैं यदि निर्देश का कोई हिस्सा भ्रमित करने वाला हो।
  • महत्वपूर्ण रूप से: कभी-कभी, बहुत विशिष्ट होना एक जाल हो सकता है। विशिष्ट शब्द या संख्याएं अनजाने में AI को एक रटे हुए लेकिन गलत शॉर्टकट का उपयोग करने के लिए "प्राइम" (तैयार) कर सकती हैं। उन विशिष्ट संकेतों को हटाना कभी-कभी AI को समस्या को सही ढंग से हल करने के लिए मजबूर कर सकता है।

संक्षेप में: यह न मानें कि एक आदर्श, विस्तृत प्रॉम्ट हमेशा सबसे अच्छा होता है। कभी-कभी, थोड़ा अस्पष्ट प्रॉम्ट AI को अपने आप सोचने के लिए मजबूर करता है, जिससे वह अपनी रटी हुई आदतों के जाल से बच जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →