Agentic Coding Needs Proactivity, Not Just Autonomy
यह शोधपत्र तर्क देता है कि कोडिंग एजेंटों की अगली पीढ़ी को केवल स्वायत्तता से आगे बढ़कर वास्तविक सक्रियता (proactivity) की ओर विकसित होना चाहिए, जिसके लिए एक स्पष्ट वर्गीकरण (taxonomy) को परिभाषित करना, स्वीकृति मानदंड स्थापित करना और उनकी आवश्यकताओं का पूर्वानुमान लगाने तथा मिश्रित-पहल (mixed-initiative) अंतःक्रिया के माध्यम से सॉफ्टवेयर विकास में सुधार करने की क्षमता का मूल्यांकन करने के लिए 'इनसाइट डिसीजन क्वालिटी' (Insight Decision Quality) जैसे विशिष्ट मेट्रिक्स को पेश करना आवश्यक है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यधिक कुशल, सुपर-फास्ट सहायक है जो सॉफ्टवेयर लिखने में आपकी मदद करता है। अभी, इनमें से अधिकांश सहायक बहुत आज्ञाकारी पुस्तकालयाध्यक्ष (librarians) की तरह हैं। यदि आप डेस्क पर जाकर पूछते हैं, "क्या आप मुझे बिल्लियों के बारे में एक किताब ढूंढ कर दे सकते हैं?" तो वे तुरंत उसे ढूंढ लेते हैं। यदि आप कहते, "बिल्ली के बारे में एक कहानी लिखें," तो वे उसे लिख देते हैं। वे स्वायत्त (autonomous) हैं क्योंकि वे बिना आपके हाथ पकड़े काम कर सकते हैं, लेकिन वे प्रतिक्रियाशील (reactive) हैं क्योंकि वे केवल तभी चलते हैं जब आप उन्हें कुछ करने के लिए कहते हैं।
यह शोध पत्र तर्क देता है कि कोडिंग सहायकों की अगली पीढ़ी को केवल आज्ञाकारी पुस्तकालयाध्यक्षों से कहीं अधिक होने की आवश्यकता है। उन्हें सक्रिय भागीदार (proactive partners) होने की आवश्यकता है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र के मुख्य विचारों का विवरण दिया गया है:
1. "स्वायत्तता" (Autonomy) और "सक्रियता" (Proactivity) के बीच अंतर
- स्वायत्तता (आज्ञाकारी पुस्तकालयाध्यक्ष): सहायक आपके पूछने का इंतज़ार करता है, और फिर काम करता है। यह बहुत अच्छा है, लेकिन यह तब तक नहीं बोलता जब तक आप पहले नहीं बोलते।
- सक्रियता (अंतर्दृष्टि रखने वाला को-पायलट): सहायक आपके काम करते समय पूरी लाइब्रेरी (आपका कोड, आपका शेड्यूल, आपकी टीम की चैट) को देख रहा होता है। वह आपसे पूछने से पहले ही चीजों को भांप लेता है।
- उदाहरण: आप एक पेमेंट सिस्टम के लिए कोड लिख रहे हैं। सहायक देखता है कि एक समाचार अलर्ट आया है कि अगले सप्ताह भुगतान कंपनी अपने नियम बदल रही है।
- कठिन हिस्सा: एक सक्रिय एजेंट तुरंत चिल्लाकर, "हे, इसे देखो!" नहीं कहता। उसे यह तय करना होता है: क्या यह टोकने का सही समय है? क्या यह इतना महत्वपूर्ण है? क्या मुझे चुप रहना चाहिए और आपके वर्तमान विचार को पूरा होने का इंतज़ार करना चाहिए?
2. "स्मार्ट" सहायकों के तीन स्तर
लेखकों ने इन एजेंटों को समझाने के लिए एक "ट्रैफिक लाइट" प्रणाली बनाई है:
- स्तर 1: प्रतिक्रियाशील (लाल बत्ती)
- यह कैसे काम करता है: एजेंट तब तक स्थिर रहता है जब तक आप कोई बटन नहीं दबाते (प्रॉम्प्ट नहीं देते)।
- उपमा: एक कैलकुलेटर। जब तक आप उसमें नंबर टाइप नहीं करते, वह कुछ नहीं करता।
- स्तर 2: निर्धारित (पीली बत्ती)
- यह कैसे काम करता है: एजेंट विशिष्ट समय पर या किसी विशिष्ट घटना के होने पर जाग जाता है (जैसे कि एक निर्धारित मीटिंग या कोड अपडेट)। वह आपको रिपोर्ट भेज सकता है, लेकिन वह वास्तव में यह नहीं सोचता कि क्या आप व्यस्त हैं या क्या वह रिपोर्ट वास्तव में अभी उपयोगी है।
- उपमा: एक समाचार पत्र की डिलीवरी। वह हर दिन सुबह 7:00 बजे आता है, चाहे आप जाग रहे हों, सो रहे हों, या नहा रहे हों। उसे नहीं पता कि आपको इसकी ज़रूरत है या नहीं।
- स्तर 3: स्थिति-जागरूक (हरी बत्ती)
- यह कैसे काम करता है: एजेंट लगातार सब कुछ देखता है। वह गणना करता है: "यदि मैं इस डेवलपर को अभी टोकता हूँ, तो क्या वे चिढ़ जाएंगे? क्या यह जानकारी महत्वपूर्ण है? यदि मैं चुप रहता हूँ, तो क्या वे कुछ महत्वपूर्ण मिस कर देंगे?"
- उपमा: एक व्यक्तिगत सहायक जो जानता है कि आपको गहरे काम (deep work) के दौरान टोकना पसंद नहीं है। यदि आग लगती है, तो वे चिल्लाते हैं। यदि कोई पैकेज आता है, तो वे आपके कॉफी ब्रेक लेने तक इंतज़ार करते हैं। वे आपसे सीखते भी हैं: "ओह, आपने पिछली बार बजट के बारे में मेरे सुझाव को अनदेखा किया था? अब मैं आपको अगले महीने तक बजट के बारे में परेशान नहीं करूँगा।"
3. "अंतर्दृष्टि" (Insight) ही असली उत्पाद है
शोध पत्र कहता है कि हमें इन एजेंटों को इस आधार पर नहीं मापना चाहिए कि उन्होंने कितने कार्य पूरे किए। इसके बजाय, हमें उनकी "इनसाइट पॉलिसी" (Insight Policy) को मापना चाहिए।
एक इनसाइट (Insight) को एक परिकल्पना (hypothesis) के रूप में सोचें: "मुझे लगता है कि आपको अभी X के बारे में जानने की आवश्यकता है।"
एजेंट के पास प्रत्येक इनसाइट के लिए चार विकल्प होते हैं:
- सूचित करना (Notify): "हे, इसे देखो!" (उच्च तात्कालिकता)।
- प्रश्न करना (Question): "क्या आपका मतलब यह था?" (अनिश्चितता)।
- ड्राफ्ट बनाना (Draft): "मैंने आपके लिए एक फिक्स लिखा है, क्या आप देखना चाहेंगे?" (कम प्रयास, उच्च मूल्य)।
- शांत रहना (Stay Silent): "मैंने इसे देखा, लेकिन यह बोलने का सही समय नहीं है।"
शोध पत्र का बड़ा दावा: स्तर 3 के एजेंट के लिए सबसे महत्वपूर्ण कौशल यह जानना है कि कब चुप रहना है। यदि एक एजेंट बहुत अधिक बोलता है, तो वह एक बाधा बन जाता है। यदि वह चुप रहता है जब उसे बोलना चाहिए, तो वह बेकार है।
4. हम इसका परीक्षण कैसे करेंगे? (नया स्कोरकार्ड)
वर्तमान में, हम कोडिंग एजेंटों का परीक्षण उन्हें एक कार्य देकर और यह देखकर करते हैं कि क्या वे उसे पूरा करते हैं। लेखकों का कहना है कि सक्रिय एजेंटों के लिए यह गलत है। इसके बजाय, वे ग्रेडिंग के तीन नए तरीके प्रस्तावित करते हैं:
- IDQ (इनसाइट निर्णय गुणवत्ता - Insight Decision Quality): क्या एजेंट ने सही समय पर सही कार्रवाई चुनी?
- क्या उसने आपको तब टोका जब आप अपने काम में डूबे हुए थे? क्या उसने तब चुप रहकर मदद की जब आपको उसकी ज़रूरत थी?
- CGS (संदर्भ ग्राउंडिंग स्कोर - Context Grounding Score): क्या एजेंट के पास सही प्रमाण था?
- यदि उसने कहा "आपका कोड टूटा हुआ है," तो क्या उसने आपको विशिष्ट एरर लॉग दिखाया, या वह केवल अनुमान लगा रहा था?
- LL (लर्निंग लिफ्ट - Learning Lift): क्या एजेंट ने आपके फीडबैक के बाद खुद को बेहतर बनाया?
- यदि आपने उसे कहा, "मुझे इस बारे में परेशान करना बंद करो," तो क्या उसने वास्तव में बाद में परेशान करना बंद कर दिया?
5. वर्तमान वास्तविकता की जाँच
लेखकों ने आज उपलब्ध शीर्ष कोडिंग टूल्स (जैसे GitHub Copilot, Cursor, Claude Code, आदि) को देखा। उन्होंने पाया कि:
- अधिकांश स्तर 2 (निर्धारित) पर अटके हुए हैं। वे टाइमर या ट्रिगर्स पर चलते हैं।
- उनमें से किसी के पास भी वर्तमान में यह गणना करने का स्पष्ट तरीका नहीं है कि आपको टोकने की "लागत" (cost of interrupting) क्या है।
- उनमें से कोई भी स्पष्ट रूप से "चुप रहने" को एक स्मार्ट, सीखी गई पसंद के रूप में नहीं मानता है। वे ज्यादातर केवल आपके पूछने का इंतज़ार करते हैं।
सारांश
यह शोध पत्र एक आह्वान (call to action) है। यह कहता है: "केवल ऐसे एजेंट बनाना बंद करें जो काम कर सकें। ऐसे एजेंट बनाना शुरू करें जो जानते हों कि कब काम करना है, कब बोलना है, और कब चुप रहना है।"
वहाँ पहुँचने के लिए, हमें उन्हें "पूर्ण किए गए कार्यों" से मापना बंद करना होगा और "अच्छे निर्णय", "प्रमाण", और "फीडबैक से सीखने" के आधार पर मापना शुरू करना होगा। लक्ष्य एक ऐसा कोडिंग पार्टनर है जो एक रोबोट के बजाय एक विचारशील टीम के साथी जैसा महसूस हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।