← नवीनतम पेपर
💻 computer science

Behaviour Driven Development Scenario Generation with Large Language Models

यह शोध पत्र बीहेवियर-ड्रिवन डेवलपमेंट (BDD) परिदृश्यों को उत्पन्न करने के लिए 500 यूजर स्टोरीज के एक प्रोप्रायटरी डेटासेट पर GPT-4, Claude 3 और Gemini का मूल्यांकन करता है, जिसमें यह पाया गया कि जहाँ GPT-4 टेक्स्ट समानता में उत्कृष्ट है, वहीं मानव और LLM-आधारित विशेषज्ञों के अनुसार Claude 3 उच्चतम गुणवत्ता वाले परिणाम प्रदान करता है, जिसका इष्टतम प्रदर्शन मॉडल-विशिष्ट प्रॉम्प्टिंग रणनीतियों, उच्च-गुणवत्ता वाले इनपुट विवरणों और विशिष्ट जनरेशन मापदंडों पर निर्भर करता है।

मूल लेखक: Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei

प्रकाशित 2026-03-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट के मैनेजर हैं। आपके पास एक शानदार शेफ (सॉफ्टवेयर डेवलपर) है और वेटरों की एक टीम (टेस्टर्स) है। समस्या क्या है? ग्राहक (बिजनेस ओनर्स) आपको अस्पष्ट ऑर्डर देते रहते हैं जैसे, "मुझे एक ऐसा बर्गर चाहिए जिसका स्वाद गर्मियों जैसा हो।"

यदि आप बस शेफ को कह देंगे "एक समर बर्गर बनाओ," तो वे टमाटर के ऊपर एक सलाद रख सकते हैं। यदि आप वेटर को इसे बनाने का सटीक तरीका लिखने के लिए कहेंगे, तो वे इसे लिखने में घंटों बिता सकते हैं, या इससे भी बुरा, वे यह लिखना भूल सकते हैं कि बन (bun) को टोस्ट करना ज़रूरी है।

यही वास्तविक दुनिया में सॉफ्टवेयर टेस्टिंग (Software Testing) की समस्या है। अस्पष्ट विचारों को सटीक निर्देशों में बदलना कठिन है जिनका कंप्यूटर पालन कर सके।

यह पेपर इस बारे में है कि कैसे AI (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) को एक सुपर-स्मार्ट अनुवादक के रूप में उपयोग किया जा सकता है। शोधकर्ता यह देखना चाहते थे कि क्या AI एक अस्पष्ट ग्राहक अनुरोध को तुरंत एक आदर्श, चरण-दर-चरण रेसिपी (जिसे BDD सिनेरियो कहा जाता है) में बदल सकता है जिसे शेफ और वेटर बिना किसी भ्रम के फॉलो कर सकें।

यहाँ उनके रोमांच का विवरण सरल भाषा में दिया गया है:

1. सेटअप: एक "ट्रेनिंग जिम" बनाना

AI का परीक्षण करने से पहले, शोधकर्ताओं को इसे प्रशिक्षित करने के लिए एक जिम की आवश्यकता थी। वे केवल नकली उदाहरणों का उपयोग नहीं कर सकते थे; उन्हें असली उदाहरण चाहिए थे।

  • डेटासेट: उन्होंने IntelligenceBank नामक एक सॉफ्टवेयर कंपनी से 500 वास्तविक जीवन की कहानियाँ एकत्र कीं। ये ग्राहकों के वास्तविक अनुरोध थे, कंपनी द्वारा लिखे गए विस्तृत नोट्स थे, और अंत में वे "रेसिपी" (BDD सिनेरियो) थीं जो इंसानों ने लिखी थीं।
  • लक्ष्य: वे यह देखना चाहते थे कि क्या एक AI केवल "ग्राहक अनुरोध" (Customer Request) को देखकर एक ऐसी "रेसिपी" लिख सकता है जो उतनी ही अच्छी हो जितनी कि एक मानव विशेषज्ञ द्वारा लिखी गई थी।

2. प्रतियोगी: AI मॉडल्स

उन्होंने तीन प्रसिद्ध AI मॉडल्स को रिंग में उतारा:

  • GPT-4: एक ऑल-राउंडर, जो बहुत स्मार्ट होने और निर्देशों का पालन करने के लिए जाना जाता है।
  • Claude 3: एक विचारशील विचारक, जो बहुत सटीक होने और लंबी बातचीत करने में कुशल है।
  • Gemini: एक रचनात्मक मॉडल, जो एक साथ बहुत सारी जानकारी को संभालने के लिए जाना जाता है।

3. प्रयोग: उन्होंने खेल कैसे खेला?

शोधकर्ताओं ने केवल उनसे "करने" के लिए नहीं कहा। उन्होंने यह देखने के लिए अलग-अलग तरीकों से पूछने (प्रॉम्प्टिंग - Prompting) का प्रयास किया कि सबसे अच्छा क्या काम करता है।

  • "ज़ीरो-शॉट" (बस पूछें): उन्होंने AI को अनुरोध दिया और कहा, "एक रेसिपी लिखें।" कोई उदाहरण नहीं, कोई संकेत नहीं।
  • "फ्यू-शॉट" (मुझे दिखाएं): उन्होंने AI को अनुरोध के साथ-साथ कुछ अच्छे उदाहरण भी दिए ताकि वह शैली की नकल कर सके।
  • "चेन-ऑफ-थॉट" (पहले सोचें): उन्होंने AI को बताया, "पहले चरणों के बारे में सोचें, फिर रेसिपी लिखें।"

परिणाम? यह AI के व्यक्तित्व पर निर्भर करता था!

  • GPT-4 वह "प्रतिभाशाली व्यक्ति था जिसे मदद की ज़रूरत नहीं थी।" यह तब सबसे अच्छा काम करता था जब आप इसे सीधे पूछते थे (Zero-Shot)।
  • Claude 3 वह "छात्र था जिसे स्टडी गाइड की ज़रूरत थी।" यह तब सबसे अच्छा काम करता था जब आप इसे चरण-दर-चरण सोचने के लिए कहते थे (Chain-of-Thought)।
  • Gemini एक "विजुअल लर्नर" था। यह तब सबसे अच्छा काम करता था जब आप इसे पहले उदाहरण दिखाते थे (Few-Shot)।

4. गुप्त सामग्री: आप AI को क्या खिलाते हैं, यह सबसे अधिक मायने रखता है

यह सबसे बड़ा आश्चर्य था। शोधकर्ताओं ने AI को अलग-अलग प्रकार की जानकारी खिलाने का प्रयास किया:

  • परिदृश्य A: केवल छोटा "ग्राहक अनुरोध" (जैसे, "मुझे एक समर बर्गर चाहिए")।
  • परिदृश्य B: केवल "विस्तृत नोट्स" (जैसे, "टोस्टेड बन का उपयोग करें, ग्रिल्ड अनानास डालें, 20°C पर परोसें...")।
  • परिदृश्य C: दोनों एक साथ।

फैसला:

  • यदि आपने AI को केवल छोटा अनुरोध दिया, तो इसने बहुत खराब रेसिपी लिखीं। यह बहुत अस्पष्ट था।
  • यदि आपने AI को केवल विस्तृत नोट्स दिए, तो इसने बेहतरीन रेसिपी लिखीं।
  • निष्कर्ष: AI स्मार्ट है, लेकिन यह मन नहीं पढ़ सकता। इसे विस्तृत निर्देशों की आवश्यकता होती है। यदि इंसान अच्छे, विस्तृत नोट्स लिखते हैं, तो AI भारी काम कर सकता है। यदि इंसान नोट्स लिखने में आलसी हैं, तो AI विफल हो जाएगा।

5. जज: कौन सही है?

उन्हें कैसे पता चला कि AI की रेसिपी अच्छी थी?

  • कंप्यूटर जज: उन्होंने AI की रेसिपी की तुलना मानव की रेसिपी से करने के लिए गणित का उपयोग किया। क्या उन्होंने समान शब्दों का उपयोग किया? (टेक्स्ट सिमिलैरिटी)। क्या उनका अर्थ एक ही था? (सिमेंटिक सिमिलैरिटी)।
  • मानव जज: उन्होंने रेसिपी का स्वाद चखने के लिए 6 वास्तविक विशेषज्ञों को काम पर रखा।

ट्विस्ट:
"कंप्यूटर जज" (गणित) अक्सर गलत थे। उन्हें लगा कि जिस AI ने सबसे अधिक समान शब्दों का उपयोग किया, वह सबसे अच्छा था। लेकिन मानव जजों ने उस AI को पसंद किया जिसने सबसे अधिक तार्किक और उपयोगी रेसिपी लिखी, भले ही शब्द थोड़े अलग हों।

  • विजेता: Claude 3 को इंसानों द्वारा सबसे अधिक रेटिंग दी गई।
  • नया सितारा: उन्होंने पाया कि DeepSeek नामक एक विशिष्ट AI वास्तव में सबसे अच्छा "कंप्यूटर जज" था। यह गणित के फॉर्मूलों की तुलना में मानव विशेषज्ञों के साथ बहुत बेहतर तरीके से सहमत हुआ।

6. सेटिंग्स: नॉब्स घुमाना

AI मॉडल्स में "टेम्परेचर" (कितना रचनात्मक/रैंडम है) और "Top_p" (यह कितने विकल्पों पर विचार करता है) जैसे नॉब्स होते हैं।

  • निष्कर्ष: रेसिपी लिखने के लिए, रचनात्मकता दुश्मन है।
  • सबसे अच्छे परिणाम तब मिले जब उन्होंने "क्रिएटिविटी" के नॉब को पूरी तरह से कम कर दिया (Temperature = 0)। वे चाहते थे कि AI एक रोबोट की तरह व्यवहार करे, न कि एक कवि की तरह। वे हर बार एक ही सटीक रेसिपी चाहते थे, न कि कोई "सरप्राइज" रेसिपी।

मुख्य निष्कर्ष (इसका महत्व क्या है?)

यह पेपर हमें बताता है कि AI सॉफ्टवेयर टेस्ट लिखने में मदद करने के लिए तैयार है, लेकिन हमें इसका सही उपयोग करना होगा:

  1. अस्पष्ट विचारों से जादू की उम्मीद न करें: आपको अभी भी विस्तृत आवश्यकताएं लिखनी होंगी। यदि आप ऐसा करते हैं, तो AI आपके काम के घंटों को बचा सकता है।
  2. काम के लिए सही टूल चुनें: केवल "प्रसिद्ध" AI न चुनें। अलग-अलग तरीकों से पूछने (प्रॉम्प्ट्स) का प्रयास करें ताकि आप देख सकें कि कौन सा आपकी टीम की शैली में फिट बैठता है।
  3. इसे उबाऊ रखें: इस विशिष्ट कार्य के लिए, अपने "क्रिएटिव मोड" को बंद कर दें। आपको सटीकता चाहिए, कला नहीं।
  4. AI का उपयोग AI को चेक करने के लिए करें: हमने पाया कि एक विशिष्ट AI (DeepSeek) अन्य AI के काम को ग्रेड करने में बहुत अच्छा है, जो कंपनियों को मानव समीक्षकों पर बहुत सारा पैसा बचाने में मदद कर सकता है।

संक्षेप में: AI एक सुपर-फास्ट, सुपर-साक्षर 'सू-शेफ' (sous-chef) की तरह है। यदि आप इसे एक अस्पष्ट ऑर्डर देते हैं, तो यह अनुमान लगाएगा। लेकिन यदि आप इसे एक विस्तृत रेसिपी कार्ड देते हैं, तो यह आपके पलक झपकने से पहले चीज़ों को काट देगा, पकाएगा और प्लेट में सजा देगा, जिससे आप भोजन का आनंद लेने (या अगली सुविधा बनाने) के लिए स्वतंत्र रहेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →