← नवीनतम पेपर
💻 computer science

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

यह नियंत्रित पायलट अध्ययन यह प्रदर्शित करता है कि हालांकि स्पष्ट सॉफ़्टवेयर डेलीगेशन अनुबंध (delegation contracts) AI कोडिंग एजेंटों के आउटपुट की वस्तुनिष्ठ शुद्धता में सुधार नहीं करते हैं, वे साक्ष्य पर्याप्तता को बढ़ाकर और अस्पष्टता को कम करके उनके कार्य की समीक्षा योग्यता (reviewability) को महत्वपूर्ण रूप से बढ़ाते हैं, भले ही इसके लिए टोकन उपयोग और निष्पादन समय की लागत चुकानी पड़े।

मूल लेखक: Vincent Schmalbach

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vincent Schmalbach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मैनेजर हैं जिसने अपने घर में टपकते नल को ठीक करने के लिए एक बहुत ही बुद्धिमान, लेकिन कभी-कभी बहुत अधिक बातें करने वाले इंटर्न को काम पर रखा है।

अतीत में, आप शायद सिर्फ इतना कहते, "हे, उस लीकेज को ठीक कर दो।" इंटर्न काम पूरा करता, और वापस आता जिसमें एक रिंच (wrench) होता और फर्श सूखा होता। आप फर्श देखते, वह सूखा होता, और आप कहते, "बहुत बढ़िया!"

लेकिन क्या होगा अगर इंटर्न एक AI हो? और क्या होगा अगर, केवल लीक ठीक करने के बजाय, उसे आपके फर्नीचर को व्यवस्थित करने, दीवारों को फिर से पेंट करने, या यहाँ तक कि सिंक को भी स्थानांतरित करने की अनुमति दी जाए, बशर्ते वह आपको बताए कि उसने ऐसा किया है?

यह शोध पत्र एक सरल प्रश्न पूछता है: यदि आप इंटर्न को एक सख्त, लिखित "अनुबंध" (contract) देते हैं जो उसे ठीक-ठीक बताता है कि उसे क्या करने की अनुमति है और उसे वापस क्या सबूत लाना है, तो क्या इससे आपके लिए उसके काम की जाँच करना आसान हो जाता है?

लेखक, विन्सेंट श्मलबैक (Vincent Schmalbach) ने यह पता लगाने के लिए एक छोटा सा प्रयोग चलाया। यहाँ बताया गया है कि क्या हुआ, सरल शब्दों में।

सेटअप: "खिलौना" घर

शोधकर्ता ने एक बहुत छोटा, नकली सॉफ्टवेयर प्रोजेक्ट (एक छोटी वेबसाइट) बनाया जिसमें कुछ जानबूझकर छोड़े गए "बग्स" (लीक) थे। उन्होंने 10 अलग-अलग कार्य बनाए, जैसे "लॉगिन बटन को ठीक करें" या "निर्देशों को अपडेट करें।"

फिर उन्होंने इन कार्यों को दो अलग-अलग AI "इंटर्न" (एक बहुत स्मार्ट, एक तेज़ लेकिन थोड़ी कम स्मार्ट) को तीन अलग-अलग नियमों के तहत भेजा:

  1. कैजुअल रिक्वेस्ट (Casual Ask): बस एक सामान्य संदेश जिसमें कहा गया हो, "इस बग को ठीक करो।" (जैसे किसी दोस्त को "नल ठीक करने" के लिए कहना।)
  2. द कॉन्ट्रैक्ट (The Contract): एक औपचारिक दस्तावेज़ जिसमें लिखा हो, "आप केवल इन दो फाइलों को छू सकते हैं। आप डेटाबेस को नहीं छू सकते। जब आप काम पूरा कर लें, तो आपको प्रत्येक बदली गई फ़ाइल की सूची देनी होगी और उसका कारण बताना होगा।"
  3. कॉन्ट्रैक्ट + एविडेंस चेकलिस्ट (The Contract + Evidence Checklist): वही अनुबंध, लेकिन एक अनिवार्य चेकलिस्ट के साथ जिसे AI को भरना ही होगा, जिसमें "अभी भी क्या गलत हो सकता है" और एक "रिव्यूअर चेकलिस्ट" का अनुभाग शामिल है।

परिणाम: "सूखा फर्श" बनाम "रिपोर्ट"

अध्ययन ने दो चीजों को मापा: क्या काम वास्तव में हो गया? और क्या इसकी समीक्षा करना आसान था?

1. काम पहले से ही परफेक्ट था (The "Dry Floor")
आश्चर्यजनक रूप से, इससे कोई फर्क नहीं पड़ा कि इंटर्न ने किस नियम का पालन किया। चाहे उन्हें कैजुअल रिक्वेस्ट मिली हो या सख्त अनुबंध, प्रत्येक AI ने बग्स को पूरी तरह से ठीक कर दिया।

  • "लीक" ठीक हो गया था।
  • AI ने किसी और चीज़ को नहीं बिगाड़ा।
  • AI ने उन फाइलों को नहीं छुआ जिन्हें छूने की अनुमति नहीं थी।

क्यों? क्योंकि कार्य छोटे थे और AI उन्हें समझने के लिए पर्याप्त स्मार्ट था। "अनुबंध" ने AI को कोड ठीक करने में बेहतर नहीं बनाया। काम पहले से ही 100% सही था।

2. समीक्षा बहुत आसान हो गई (The "Report")
यही वह जगह थी जहाँ जादू हुआ। भले ही कोड दोनों मामलों में परफेक्ट था, लेकिन कॉन्ट्रैक्ट ने AI की रिपोर्ट को पढ़ने और उस पर भरोसा करने में बहुत आसान बना दिया।

  • बिना अनुबंध के: AI बग ठीक करता और कहता, "हो गया।" वह शायद ही कभी बताता कि उसने कौन सी फाइलें बदलीं या क्यों बदलीं। यह वैसा ही था जैसे इंटर्न नल ठीक करे लेकिन बिना किसी नोट के औजार इधर-उधर बिखेर दे।
  • अनुबंध के साथ: AI ने एक व्यवस्थित पैकेज प्रदान किया। उसने प्रत्येक बदली गई फ़ाइल को सूचीबद्ध किया, तर्क समझाया, उसके द्वारा चलाए गए परीक्षणों (tests) को सूचीबद्ध किया, और यहाँ तक कि यह भी स्वीकार किया, "यहाँ एक छोटा जोखिम है जो अभी भी मौजूद हो सकता है।"

उपमा (Analogy):
कल्पना कीजिए कि AI एक शेफ है।

  • बिना अनुबंध के: शेफ आपके लिए एक परफेक्ट स्टेक लाता है। आप इसे खाते हैं, और यह स्वादिष्ट है। लेकिन आपको पता नहीं कि उन्होंने ताजी सामग्री का उपयोग किया या नहीं या क्या उन्होंने हाथ धोए थे। आपको अनुमान लगाना पड़ता है।
  • अनुबंध के साथ: शेफ वही परफेक्ट स्टेक लाता है, लेकिन साथ में सामग्री की रसीद, रसोई की फोटो, और एक नोट भी लाता है, "मैंने इसे 4 मिनट तक पकाया है, लेकिन यदि आपको यह 'रेयर' पसंद है, तो आपको इसे थोड़ा और पकाना पड़ सकता है।"
  • परिणाम: स्टेक का स्वाद एक जैसा था, लेकिन दूसरा संस्करण बहुत अधिक भरोसेमंद और स्वीकृत करने में आसान था।

लागत: इसमें थोड़ा अधिक समय लगता है

एकमात्र कमी गति और "लागत" की थी।

  • AI ने रिपोर्ट लिखने के लिए लगभग 13% अधिक "दिमागी शक्ति" (टोकन) का उपयोग किया।
  • कार्य को पूरा करने में लगभग 38% अधिक समय लगा।

इसे विस्तृत ट्रैकिंग नंबर के साथ एक्सप्रेस शिपिंग के लिए भुगतान करने की तरह समझें। पैकेज उसी समय (या थोड़ा बाद में) पहुँचता है, लेकिन आपको पता होता है कि वह कहाँ है और उसके अंदर क्या है।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर यह निष्कर्ष निकालता है कि छोटे, स्पष्ट कार्यों के लिए, आपको काम पूरा करने के लिए अनुबंध की आवश्यकता नहीं है, लेकिन आपको एक अच्छी समीक्षा के लिए अनुबंध की आवश्यकता है।

  • सटीकता (Correctness): AI पहले से ही अपने आप छोटे बग्स को ठीक करने के लिए काफी अच्छा है।
  • समीक्षा योग्यता (Reviewability): AI खुद को समझाने में अच्छा नहीं है जब तक कि आप स्पष्ट रूप से ऐसा करने के लिए न कहें।

"अनुबंध" एक अनुवादक (translator) की तरह काम करता है। यह AI को स्मार्ट नहीं बनाता; यह बस AI को ऐसी भाषा में बोलने के लिए मजबूर करता है जिसे इंसान (या अन्य AI) आसानी से समझ और सत्यापित कर सकें।

"कमजोर" इंटर्न पर एक नोट

अध्ययन में पाया गया कि "कमजोर" AI (तेज, सस्ता वाला) को अनुबंध से सबसे अधिक लाभ हुआ। स्मार्ट AI स्वाभाविक रूप से अच्छी रिपोर्ट लिखता था, लेकिन कमजोर AI को रिपोर्ट लिखने के लिए अनुबंध द्वारा मजबूर होना पड़ा। यह सुझाव देता है कि यदि आप सस्ते AI टूल्स का उपयोग कर रहे हैं, तो विश्वसनीय परिणाम प्राप्त करने के लिए आपको सख्त अनुबंधों का उपयोग करना ही होगा।

सारांश

  • क्या अनुबंध ने कोड को बेहतर बनाया? नहीं। कोड पहले से ही परफेक्ट था।
  • क्या अनुबंध ने रिपोर्ट को बेहतर बनाया? हाँ, बहुत बड़ा अंतर था।
  • क्या इसमें अतिरिक्त लागत आई? हाँ, थोड़ा समय और पैसा।
  • फैसला: यदि आप AI के काम पर भरोसा करना चाहते हैं, तो केवल सुधार के लिए न पूछें। उस अनुबंध के लिए पूछें जो AI को अपना होमवर्क दिखाने के लिए मजबूर करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →