Guidelines for Empirical Studies in Software Engineering involving Large Language Models
यह शोधपत्र एक अनुप्रयोग मैट्रिक्स, रिपोर्टिंग चेकलिस्ट और एक जीवित ऑनलाइन संसाधन द्वारा समर्थित, लार्ज लैंग्वेज मॉडल्स (Large Language Models) से जुड़े अनुभवजन्य सॉफ्टवेयर इंजीनियरिंग अध्ययनों की पुनरुत्पादकता और कठोरता को बढ़ाने के लिए सात अध्ययन प्रकारों और आठ अनिवार्य या अनुशंसित दिशानिर्देशों के एक सहयोगात्मक ढांचे को प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि सॉफ्टवेयर इंजीनियरिंग अनुसंधान की दुनिया एक विशाल, हलचल भरी रसोई है जहाँ शेफ (शोधकर्ता) नए व्यंजन (टूल्स और थ्योरी) बनाने की कोशिश कर रहे हैं ताकि रसोइये (सॉफ्टवेयर इंजीनियर्स) बेहतर भोजन (सॉफ्टवेयर) बना सकें।
लंबे समय तक, इन शेफों ने सख्त नियमों का पालन किया ताकि यह सुनिश्चित हो सके कि यदि कोई दूसरा व्यक्ति वही व्यंजन बनाने की कोशिश करता है, तो उसका स्वाद बिल्कुल वैसा ही हो। लेकिन हाल ही में, रसोई में एक नया, जादुई घटक आया है: लार्ज लैंग्वेज मॉडल्स (LLMs)। LLMs को एक बहुत ही स्मार्ट, लेकिन थोड़ा अनिश्चित (unpredictable) सहायक शेफ (sous-chef) के रूप में समझें।
यह नया सहायक शेफ अद्भुत है। यह सब्जियां काट सकता है (कोड), रेसिपी लिख सकता है (डॉक्यूमेंटेशन), और व्यंजनों का स्वाद भी ले सकता है (कोड रिव्यू) — और वह भी अविश्वसनीय गति से। हालाँकि, इसकी तीन अजीब खामियां हैं:
- यह थोड़ा मूडी है: यदि आप इसे एक ही व्यंजन दो बार बनाने के लिए कहते हैं, तो यह दूसरी बार में बिना किसी निर्देश के थोड़ा अधिक नमक डाल सकता है, भले ही आपने इसे बिल्कुल समान निर्देश दिए हों।
- यह अपना इतिहास भूल जाता है: हमें हमेशा यह नहीं पता होता कि इसने अतीत में किन सामग्रियों से सीखा है, और जिस "रेसिपी बुक" का यह उपयोग करता है, वह बिना हमारी जानकारी के लगातार बदलती रहती है।
- यह एक 'ब्लैक बॉक्स' है: कभी-कभी, हम यह नहीं देख पाते कि इसने अतिरिक्त नमक डालने का निर्णय कैसे लिया।
इन खामियों के कारण, यदि एक शोधकर्ता कहता है, "मैंने इस जादु적인 सहायक शेफ का उपयोग करके एक शानदार केक बनाया," तो अन्य शेफ उस केक को दोबारा नहीं बना पाते। उन्हें यह नहीं पता होता कि सहायक शेफ का कौन सा संस्करण उपयोग किया गया था, सटीक निर्देश क्या थे, या क्या कल भी केक का स्वाद वैसा ही रहेगा।
यह पेपर एक "नया किचन हैंडबुक" है जिसे 22 विशेषज्ञ शेफ की एक टीम ने लिखा है। उनका लक्ष्य सभी को यह सिखाना है कि इस जादुई सहायक शेफ का उपयोग कैसे किया जाए ताकि खाना बनाने का विज्ञान खराब न हो। उन्होंने रसोई को 7 अलग-अलग तरीकों में व्यवस्थित किया है जिनसे सहायक शेफ का उपयोग किया जाता है (जैसे "द टेस्टर," "द रेसिपी राइटर," या "द फेक कस्टमर") और पालन करने के लिए 8 स्वर्णिम नियम (Golden Rules) बनाए हैं।
यहाँ 8 नियम दिए गए हैं, जिन्हें सरल उपमाओं (analogies) के माध्यम से समझाया गया है:
1. 📢 "ईमानदार शेफ" का नियम (उपयोग घोषित करें)
नियम: आपको यह स्वीकार करना होगा कि आपने सहायक शेफ का उपयोग किया है।
उपमा: यदि आपने अपने सूप में कोई गुप्त मसाला डाला है, तो आपको खाद्य समीक्षकों को बताना होगा। केवल यह न कहें कि "मैंने यह सूप बनाया।" कहें, "मैंने प्याज काटने के लिए मैजिक सोस-शेफ v2.0 का उपयोग किया।" यदि आप इसे छिपाते हैं, तो लोग यह तय नहीं कर पाएंगे कि सूप वास्तव में अच्छा है या केवल किस्मत से बना है।
2. 📝 "सटीक रसीद" का नियम (वर्जन और सेटिंग्स रिपोर्ट करें)
नियम: मॉडल का सटीक नाम, उपयोग की तारीख और सेटिंग्स (जैसे "तापमान" या "रचनात्मकता का स्तर") लिखें।
उपमा: कल्पना कीजिए कि एक रेसिपी जिसमें केवल लिखा है "थोड़ा आटा डालें।" वह बेकार है! आपको कहना होगा "मंगलवार को मापा गया 2 कप किंग आर्थर आटा।" चूंकि जादुई सहायक शेफ अक्सर अपना मन बदल लेता है, इसलिए आपको सटीक क्षण और सेटिंग्स को रिकॉर्ड करना होगा ताकि कोई और बाद में आपके परिणाम की नकल कर सके।
3. 🏗️ "ब्लूप्रिंट" का नियम (आर्किटेक्चर रिपोर्ट करें)
नियम: केवल सहायक शेफ के बारे में बात न करें; उसके आसपास की पूरी रसोई की व्यवस्था को समझाएं।
उपमा: सहायक शेफ शून्य में काम नहीं करता। यह एक फ्रिज, एक टाइमर और निर्देशों की एक सूची से जुड़ा हुआ है। यदि आपने एक रोबोट शेफ बनाया है, तो आपको केवल यह नहीं कहना चाहिए कि "इसमें एक दिमाग है," बल्कि आपको रोबोट के ब्लूप्रिंट को भी दिखाना चाहिए। रोबोट ओवन से कैसे बात करता है? क्या होता है यदि इंटरनेट कट जाता है? पूरी मशीन को दिखाएं।
4. 🗣️ "स्क्रिप्ट" का नियम (प्रॉम्प्ट्स और लॉग्स रिपोर्ट करें)
नियम: आपने सहायक शेफ से जो सटीक प्रश्न पूछे और उसके जो उत्तर मिले, उन्हें साझा करें।
उपमा: यदि आप एक जिनी (genie) से पूछते हैं, "मेरी इच्छा है कि मुझे दस लाख डॉलर मिलें," और वह आपको मोनोपॉली के नकली पैसे दे देता है, तो समस्या यह हो सकती है कि आपने कैसे पूछा। आपको दिखाना होगा कि आपने जिनी को दिया गया सटीक स्क्रिप्ट क्या था। साथ ही, बातचीत की डायरी रखें। यदि जिनी अगले सप्ताह अपना मन बदल लेता है, तो आपको पता होना चाहिए कि उसने आज क्या कहा था।
5. 👨🍳 "मानवीय स्वाद-परीक्षण" का नियम (मानवीय सत्यापन)
नियम: रोबोट पर आँख मूंदकर भरोसा न करें; एक इंसान को भोजन चखने दें।
उपमा: सहायक शेफ सोच सकता है कि एक व्यंजन उत्तम है क्योंकि वह दिखने में सुंदर है, लेकिन एक इंसान कह सकता है, "इसका स्वाद कार्डबोर्ड जैसा है।" यह सुनिश्चित करने के लिए कि रोबोट केवल भ्रमित (hallucinating) नहीं हो रहा है, आपको रोबोट के काम की तुलना एक मानव विशेषज्ञ के काम से करनी होगी। यदि रोबोट कहता है "यह कोड सुरक्षित है," तो एक इंसान को इसकी दोबारा जांच करनी चाहिए।
6. 🆓 "ओपन सोर्स" का नियम (एक ओपन बेसलाइन का उपयोग करें)
नियम: यदि आप एक फैंसी, महंगी, बंद दरवाजों वाली सहायक शेफ (जैसे किसी गुप्त कंपनी का AI) का उपयोग करते हैं, तो एक मुफ्त, ओपन-सोर्स वाले का भी परीक्षण करें।
उपमा: यदि आप कहते हैं, "मेरा गुप्त सॉस सबसे अच्छा है!" लेकिन आप किसी को उसकी रेसिपी नहीं दिखाते, तो हम विश्वास नहीं करेंगे। हमें दिखाएं कि आपका गुप्त सॉस उस साधारण, घरेलू सॉस से बेहतर है जिसे हम सभी खुद बना सकते हैं। यह साबित करता है कि आपके परिणाम केवल पेवॉल (paywall) के पीछे छिपे किसी जादू के कारण नहीं हैं।
7. 📏 "निष्पक्ष रूलर" का नियम (अच्छे मेट्रिक्स का उपयोग करें)
नियम: सफलता को मापने के लिए सही उपकरणों का उपयोग करें, और समझाएं कि क्यों।
उपमा: आप सूप के "स्वाद" को स्केल (रूलर) से नहीं माप सकते। आपको स्वाद-परीक्षण स्कोर की आवश्यकता है। केवल यह न कहें कि "यह काम कर गया!" समझाएं कि आपने इसे कैसे मापा। क्या आपने कितने बग्स ठीक किए? क्या आपने उपयोगकर्ताओं से पूछा कि उन्हें यह कैसा लगा? और याद रखें, कभी-कभी स्वयं रूलर ही टूटा हुआ होता है (खराब बेंचमार्क), इसे भी स्वीकार करें।
8. 🚧 "ईमानदार गलतियों" का नियम (सीमाएं रिपोर्ट करें)
नियम: स्वीकार करें कि आपका प्रयोग कहाँ गलत हो सकता है।
उपमा: कोई भी शेफ पूर्ण नहीं होता। शायद आपकी रसोई बहुत गर्म थी, या शायद सामग्रियां पुरानी थीं। ईमानदार रहें: "रोबोट ने बहुत अच्छा काम किया, लेकिन केवल मंगलवार को," या "हमने केवल पिज्जा पर परीक्षण किया, सुशी पर नहीं।" अपनी कमियों को स्वीकार करके, आप दूसरों को उनसे बचने में मदद करते हैं।
बड़ी तस्वीर (The Big Picture)
यह पेपर अनिवार्य रूप से सॉफ्टवेयर अनुसंधान के भविष्य के लिए एक क्वालिटी कंट्रोल मैनुअल है। यह कहता है: "जादुई सहायक शेफ यहाँ रहने के लिए है, और यह शक्तिशाली है। लेकिन यदि हम यह नहीं लिखते कि हमने इसका उपयोग ठीक से कैसे किया, तो हमें कभी पता नहीं चलेगा कि परिणाम वास्तविक हैं या केवल एक इत्तेफाक।"
इन नियमों का पालन करके, शोधकर्ता यह सुनिश्चित कर सकते हैं कि उनकी खोजएँ ठोस, पुनरुत्पादक (reproducible) और वास्तव में दुनिया के लिए सहायक हैं, न कि केवल एक बार होने वाला जादू जो मॉडल अपडेट होने पर गायब हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।