Story Point Estimation Using Large Language Models
यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल बिना किसी प्रशिक्षण डेटा के या केवल कुछ उदाहरणों के साथ सॉफ्टवेयर स्टोरी पॉइंट्स की प्रभावी ढंग से भविष्यवाणी कर सकते हैं, जो पारंपरिक पर्यवेक्षित डीप लर्निंग मॉडलों से बेहतर प्रदर्शन करते हैं, और साथ ही यह भी पाता है कि तुलनात्मक निर्णय, हालांकि स्वाभाविक रूप से भविष्यवाणी करने में आसान नहीं होते हैं, अनुमान सटीकता को और बढ़ाने के लिए प्रभावी फ्यू-शॉट उदाहरणों के रूप में कार्य कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जहाज के कप्तान (एक सॉफ्टवेयर टीम) हैं जो एक यात्रा (एक स्प्रिंट) की तैयारी कर रहे हैं। प्रस्थान करने से पहले, आपको यह जानना होगा कि प्रत्येक कार्य में कितना ईंधन (प्रयास) लगेगा। सॉफ्टवेयर की दुनिया में, डेवलपर्स इसे "घंटों" में नहीं मापते क्योंकि यह बहुत कठोर होता है। इसके बजाय, वे स्टोरी पॉइंट्स (Story Points) का उपयोग करते हैं, जो एक धुंधला, सापेक्ष माप है कि "यह उस कार्य की तुलना में कितना कठिन महसूस होता है।"
आमतौर पर पूरी टीम एक घेरे में बैठती है, "प्लानिंग पोकर" नामक एक खेल खेलती है, और हर कार्य के लिए एक संख्या पर सहमत होने तक बहस करती है। यह मजेदार तो है, लेकिन इसमें बहुत समय लगता है और यह इस बात पर निर्भर करता है कि कमरे में कौन मौजूद है।
यह शोध पत्र एक बड़ा सवाल पूछता है: क्या एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल या LLM) हमारे लिए स्टोरी पॉइंट्स का अनुमान लगा सकता है, जिससे हमारा काफी समय बच सके?
यहाँ उन्होंने जो पाया है, उसकी कहानी है, जिसे कुछ रोजमर्रा के उपमाओं (analogies) के माध्यम से समझाया गया है।
1. "ज़ीरो-शॉट" टेस्ट: वह विशेषज्ञ जिसने आपसे कभी मुलाकात नहीं की
सवाल: क्या एक AI आपके विशिष्ट प्रोजेक्ट के इतिहास को देखे बिना ही आपके प्रोजेक्ट के प्रयास का अनुमान लगा सकता है?
उपमा: कल्पना कीजिए कि आपने एक विश्व प्रसिद्ध शेफ को काम पर रखा है जिसने आपके किचन में कभी खाना नहीं बनाया है। आप उन्हें "स्पाइसी टैकोस" की रेसिपी देते हैं और पूछते हैं, "इसे बनाना कितना कठिन है?"
- पुराना तरीका (मशीन लर्निंग): आपको शेफ को आपके टैकोस के 1,000 फोटो और आपने उन्हें बनाने में कितना समय लिया, यह दिखाना पड़ता, इससे पहले कि वे सही अनुमान लगा पाते।
- नया तरीका (LLM ज़ीरो-शॉट): आप बस शेफ से पूछते हैं। आश्चर्यजनक रूप से, AI शेफ ने बिना किसी ट्रेनिंग डेटा के, केवल विवरण पढ़कर कठिनाई का बेहतर अनुमान लगाया! यहाँ तक कि उसने उस शेफ से भी बेहतर प्रदर्शन किया जिसने आपके पिछले 80% व्यंजनों का अध्ययन किया था।
परिणाम: AI मॉडल (जैसे Kimi और DeepSeek) बिना किसी ट्रेनिंग डेटा के, केवल विवरण पढ़कर कठिनाई का अनुमान लगाने में आश्चर्यजनक रूप से सक्षम थे। वे कार्य के "वाइब" (vibe) को समझ गए।
2. "फ्यू-शॉट" टेस्ट: AI को एक चीट शीट देना
सवाल: क्या होगा यदि हम AI को आपके द्वारा पहले पूरे किए जा चुके कार्यों के पाँच उदाहरण दें, साथ ही उनके पॉइंट्स भी बता दें?
उपमा: आप शेफ को बताते हैं, "हे, याद है वह 'स्पाइसी टैको' हमने बनाया था? उसे 5 पॉइंट्स लगे थे। और वह 'जायंट बरिटो'? वह 8 पॉइंट्स का था। अब, इस नए 'एनचिलाडा' को देखो—कितने पॉइंट्स होंगे?"
परिणाम:
- जादू होता है: AI को केवल पाँच उदाहरण देने से वह बहुत स्मार्ट हो गया। इसने आपकी टीम के विशिष्ट "स्केल" को सीख लिया।
- रणनीति मायने रखती है: शोधकर्ताओं ने उन पाँच उदाहरणों को चुनने के दो तरीके आजमाए:
- "सबसे सामान्य" रणनीति: पाँच आसान कार्य चुनना क्योंकि आपकी टीम आमतौर औसतन आसान काम करती है। (बुरा विचार: AI कठिन कार्यों को लेकर भ्रमित हो जाता है)।
- "पूर्ण रेंज" रणनीति: एक आसान, एक मध्यम, एक कठिन, एक बहुत कठिन और एक अत्यंत कठिन कार्य चुनना। (अच्छा विचार: इसने AI को मापने के लिए एक पैमाना दे दिया)।
- विजेता: "पूर्ण रेंज" रणनीति सबसे अच्छी रही। यह AI को 1, 5 और 10 के निशान वाले पैमाने देने जैसा है, न कि केवल 1 के ढेर दिखाने जैसा।
3. "तुलना" टेस्ट: कौन सा अधिक कठिन है?
सवाल: इंसानों के लिए यह कहना आसान होता है कि "कार्य A, कार्य B से कठिन है" बजाय इसके कि वे कहें "कार्य A 5 पॉइंट्स का है।" क्या AI भी ऐसा कर सकता है?
उपमा: कल्पना कीजिए कि आप शेफ से पूछते हैं, "क्या टैको, बरिटो से कठिन है?" बनाम "टैको कितने पॉइंट्स का है?"
- मानवीय अंतर्ज्ञान: इंसान आमतौर पर कहते हैं, "तुलना करना आसान है! मुझे गिनती करने की जरूरत नहीं है, मैं बस जानता हूँ कि कौन सा बड़ा है।"
- AI की वास्तविकता: AI को तुलना करने में आसानी नहीं हुई। वास्तव में, वह सीधे नंबर बताने के बजाय "A, B से कठिन है" कहने में बदतर था।
- क्यों? AI के पास एक छिपा हुआ "नंबर ब्रेन" है। भले ही आप उससे तुलना करने के लिए कहें, वह गुप्त रूप से अपने दिमाग में एक संख्या की गणना करता है और फिर उसे "हाँ/नहीं" में बदल देता है। यह कैलकुलेटर से यह पूछने जैसा है कि कौन सी संख्या बड़ी है, बिना गणित किए—वह गणित तो वैसे भी कर ही रहा है!
4. "तुलना चीट शीट" टेस्ट
सवाल: यदि AI तुलना करने में बुरा है, तो क्या हम अभी भी उन तुलनाओं को एक "चीट शीट" के रूप में उपयोग कर सकते हैं ताकि उसे नंबरों का अनुमान लगाने में मदद मिल सके?
उपमा: आप शेफ को बताते हैं, "मुझे पता है कि आप तुलना करने में बुरे हैं, लेकिन यहाँ पाँच जोड़े (pairs) हैं जहाँ मैंने आपको बताया था कि कौन सा कठिन था। अब, इस नए व्यंजन के लिए पॉइंट्स का अनुमान लगाओ।"
परिणाम:
- आश्चर्य! भले ही AI तुलना करने में बहुत अच्छा नहीं था, लेकिन उन तुलनाओं को उदाहरण के रूप में उपयोग करने से उसे नंबरों का बेहतर अनुमान लगाने में मदद मिली।
- विशेष मामला: छोटे, हल्के AI मॉडल (जैसे Gemini) के लिए, तुलनाओं का उपयोग करना सीधे नंबर देने की तुलना में बेहतर काम कर गया। यह एक ट्रेनिंग व्हील की तरह था जिसने छोटी साइकिल को सीधा रखने में मदद की।
मुख्य निष्कर्ष (इसका महत्व क्या है?)
- AI मदद के लिए तैयार है: आपको अच्छे अनुमान के लिए वर्षों के डेटा की आवश्यकता नहीं है। एक स्मार्ट AI नए प्रोजेक्ट के विवरण को पढ़कर ही उसके प्रयास का अनुमान लगा सकता है।
- थोड़ी सी मदद बहुत काम आती है: यदि आपके पास केवल पाँच पिछले उदाहरण हैं, तो AI को आसान और कठिन कार्यों का मिश्रण दिखाएं। यह AI को आपकी टीम की विशिष्ट शैली के अनुसार ढाल देता है।
- AI अलग तरह से सोचता है: इंसान चीजों की तुलना करना पसंद करते हैं ("यह उससे कठिन है")। AI सीधे नंबर का अनुमान लगाना पसंद करता है। AI को इंसान बनने के लिए मजबूर न करें; उसे एक AI रहने दें।
- सभी AI एक जैसे नहीं होते: बड़े, शक्तिशाली AI मॉडल सीधे नंबर देखना पसंद करते हैं। छोटे, सस्ते AI मॉडल तुलनाओं को उदाहरण के रूप में दिखाने पर बेहतर सीख सकते हैं।
संक्षेप में: यह शोध पत्र दिखाता है कि हम सॉफ्टवेयर प्लानिंग को तेज करने के लिए AI का उपयोग कर सकते हैं। हमें इसे महीनों तक ट्रेन करने की आवश्यकता नहीं है; हमें बस इसे पाँच उदाहरणों की एक छोटी सी "चीट शीट" देनी है, और यह टीम के मीटिंग के घंटों को बचा सकता है!
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।