Structural Quality Gaps in Practitioner AI Governance Prompts: An Empirical Study Using a Five-Principle Evaluation Framework
यह शोध पत्र कंप्यूटेबिलिटी थ्योरी (computability theory), प्रूफ़ थ्योरी (proof theory) और बेयसियन एपिस्टेमोलॉजी (Bayesian epistemology) पर आधारित एक पांच-सिद्धांत मूल्यांकन ढांचे को प्रस्तुत करता है, जो AI गवर्नेंस प्रॉम्प्ट्स की संरचनात्मक पूर्णता का आकलन करता है, और 34 GitHub फाइलों के एक अनुभवजन्य अध्ययन के माध्यम से यह प्रकट करता है कि 37% में डेटा वर्गीकरण और मूल्यांकन रूब्रिक्स जैसे महत्वपूर्ण तत्वों का अभाव है, जिससे AI-सहायता प्राप्त विकास में स्वचालित स्टैटिक एनालिसिस टूल्स की आवश्यकता पर बल मिलता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: "निर्देश पुस्तिका" की समस्या
कल्पना कीजिए कि आपने अपने लिए एक घर बनाने के लिए एक बेहद बुद्धिमान, सुपर-फास्ट, लेकिन थोड़े अव्यवस्थित इंटर्न को काम पर रखा है। आप उन्हें एक स्टिकी नोट देते हैं जिस पर लिखा है: "एक घर बनाओ।"
वह इंटर्न निश्चित रूप से कुछ न कुछ बनाएगा। वह एक शानदार हवेली, कार्डबोर्ड का डिब्बा, या कुर्सियों का एक टॉवर बना सकता है। क्योंकि वह इंटर्न एक AI है, वह आपकी इच्छा का अनुमान लगाने की पूरी कोशिश करेगा। लेकिन स्पष्ट निर्देशों के बिना, वह केवल अनुमान ही लगा रहा है।
यह शोध पत्र तर्क देता है कि AI गवर्नेंस प्रॉम्प्ट्स (वे निर्देश जो हम AI एजेंटों को देते हैं) वर्तमान में उस स्टिकी नोट की तरह हैं। वे बहुत अस्पष्ट हैं, महत्वपूर्ण विवरणों की कमी है, और अक्सर उन लोगों द्वारा लिखे जाते हैं जिन्हें अच्छी विशिष्टताएं (specifications) लिखना नहीं आता।
लेखक, क्रिस्टो ज़िएट्समैन और उनकी टीम ने इन प्रॉम्प्ट्स को कानूनी अनुबंधों (legal contracts) या ब्लूप्रिंट्स की तरह मानने का निर्णय लिया। उन्होंने यह देखने के लिए एक "चेकलिस्ट" बनाई कि क्या निर्देश वास्तव में भरोसेमंद होने के लिए पर्याप्त अच्छे हैं।
"पांच-बिंदु स्वास्थ्य जांच" (Five-Point Health Check)
शोधकर्ताओं ने पांच नियमों (सिद्धांतों) पर आधारित एक ढांचा तैयार किया जिसका पालन एक अच्छे निर्देश सेट को करना चाहिए। इन्हें एक स्वस्थ AI निर्देश पुस्तिका के पाँच महत्वपूर्ण संकेतों (Five Vital Signs) के रूप में समझें:
"फिनिश लाइन" (सफलता की परिभाषा):
- प्रश्न: क्या AI जानता है कि "काम पूरा होना" कैसा दिखता है?
- उपमा: यदि आप एक शेफ को "खाना पकाओ" कहते हैं, तो वह टोस्ट जला सकता है। यदि आप कहते हैं, "एक मीडियम-रेयर स्टेक पकाएं, साथ में शतावरी (asparagus) परोसें, शाम 6 बजे तक तैयार हो," तो उसे पता होता है कि कब रुकना है।
- कमी: अधिकांश AI प्रॉम्प्ट्स फिनिश लाइन को परिभाषित नहीं करते हैं।
"स्कोरकार्ड" (मूल्यांकन रूब्रिक):
- प्रश्न: क्या AI आपको दिखाने से पहले अपने काम का ग्रेड खुद दे सकता है?
- उपमा: एक छात्र जो अपने उत्तरों की जांच किए बिना टेस्ट जमा कर देता है बनाम एक छात्र जो रूब्रिक का उपयोग करके जांचता है, "क्या मैंने सभी भागों का उत्तर दिया? क्या मेरी स्पेलिंग सही है?"
- कमी: AI को शायद ही कभी विशिष्ट नियमों के विरुद्ध अपने काम की जांच करने के लिए कहा जाता है।
"बाड़" (दायरा/सीमा):
- प्रश्न: क्या हमें पता है कि AI को क्या करने की अनुमति नहीं है?
- उपमा: एक कुत्ता जो जानता है कि वह आंगन में खेल सकता है लेकिन उसे घास पर नहीं जाना चाहिए। बाड़ के बिना, कुत्ता सड़क पर जा सकता है।
- कमी: अधिकांश प्रॉम्प्ट बताते हैं कि क्या करना है, लेकिन शायद ही कभी बताते हैं कि क्या बचना है।
"आईडी कार्ड" (डेटा वर्गीकरण):
- प्रश्न: क्या AI जानता है कि विभिन्न प्रकार की जानकारी को कैसे संभालना है?
- उपमा: एक सुरक्षा गार्ड जो एक वीआईपी (VIP) के साथ एक पर्यटक की तरह अलग व्यवहार करता है। यदि AI को कोई गुप्त पासवर्ड दिखता है, तो उसे एक सार्वजनिक ब्लॉग पोस्ट की तुलना में अलग तरह से व्यवहार करना चाहिए।
- कमी: यह सबसे कमजोर कड़ी थी। अधिकांश प्रॉम्प्ट सभी डेटा के साथ एक जैसा व्यवहार करते हैं, जो खतरनाक है।
"सुरक्षा गार्ड" (क्वालिटी गेट):
- प्रश्न: क्या काम जारी करने से पहले कोई अंतिम चेकपॉइंट है?
- उपमा: एक क्लब में आईडी चेक करने वाला बाउंसर। AI को बस एक उत्तर नहीं उगल देना चाहिए; इसके पास एक चरण होना चाहिए जहां वह साबित करे कि उत्तर सुरक्षित और सही है।
- कमी: यह अक्सर पूरी तरह से गायब होता है।
उन्होंने क्या पाया: "37% विफलता दर"
शोधकर्ताओं ने GitHub (कोड की एक विशाल लाइब्रेरी) पर जाकर 34 वास्तविक दुनिया के निर्देश फाइलों (जिन्हें AGENTS.md कहा जाता है) को देखा, जिनका उपयोग कंपनियां और डेवलपर्स वास्तव में कर रहे थे। उन्होंने इन फाइलों को अपनी "पांच-बिंदु स्वास्थ्य जांच" से गुजारा।
परिणाम डरावने थे:
- 37% फाइलें विफल रहीं। वे इतनी अधूरी थीं कि वे विश्वसनीय रूप से एक AI को नियंत्रित नहीं कर सकती थीं।
- "मिसिंग लिंक": सबसे आम चीजें जो गायब थीं वे थीं आईडी कार्ड (डेटा वर्गीकरण) और स्कोरकार्ड (मूल्यांकन रूब्रिक)।
- "घोस्ट" (भूतिया) फाइलें: कुछ फाइलों में निर्देश भी नहीं थे! वे केवल एक नोट थे जो कह रहे थे, "निर्देशों के लिए दूसरी फाइल देखें।" लेकिन कभी-कभी, वह दूसरी फाइल मौजूद नहीं थी, या खराब थी। यह एक ऐसे दरवाजे की ओर इशारा करने वाले साइन की तरह है जो ईंट की दीवार की ओर ले जाता है।
"परफेक्ट" फाइल:
दिलचस्प बात यह है कि एकमात्र फाइल जिसे लगभग पूर्ण स्कोर मिला, वह स्वयं इस पेपर के लेखक द्वारा लिखी गई थी। यह साबित करता है कि परफेक्ट निर्देश लिखना संभव है, लेकिन अभी तक कोई और ऐसा नहीं कर रहा है।
यह क्यों मायने रखता है?
यह शोध पत्र तर्क देता है कि हम AI के "वाइल्ड वेस्ट" (अराजक दौर) के चरण में हैं।
- समस्या: हम ऐसे AI एजेंट तैनात कर रहे हैं जो अनिवार्य रूप से "अंधे" हैं क्योंकि उनके निर्देश अस्पष्ट हैं। इससे AI गलतियां करता है, डेटा लीक करता है, या वे काम करता है जो कंपनी नहीं चाहती थी।
- लागत: पेपर में उल्लेख किया गया है कि इन खराब निर्देशों के कारण 2027 तक 40% AI प्रोजेक्ट विफल हो सकते हैं। यह इसलिए नहीं है कि AI "मूर्ख" है; बल्कि इसलिए है क्योंकि निर्देश खराब हैं।
- समाधान: हमें "स्टिकी नोट्स" लिखना बंद करना होगा और "ब्लूप्रिंट्स" लिखना शुरू करना होगा।
सभी के लिए सीख
आपको कंप्यूटर वैज्ञानिक होने की आवश्यकता नहीं है। यदि आप किसी को (या किसी भी चीज़ को, जिसमें AI भी शामिल है) निर्देश दे रहे हैं, तो खुद से ये पांच सवाल पूछें:
- क्या मैंने बताया कि वे कब समाप्त हुए?
- क्या मैंने उन्हें अपने काम की जांच करने का तरीका दिया?
- क्या मैंने उन्हें बताया कि उन्हें क्या करने की अनुमति नहीं है?
- क्या मैंने उन्हें संवेदनशील बनाम सार्वजनिक जानकारी को कैसे संभालना है, यह बताया?
- क्या परिणाम दिखाने से पहले एक अंतिम जांच है?
यदि आप पाँचों में से सभी का उत्तर "हाँ" में नहीं दे सकते, तो आपके निर्देश संरचनात्मक रूप से टूटे हुए हैं, और आपको टूटे हुए परिणाम मिलने की संभावना है।
संक्षेप में: यह पेपर एक चेतावनी है। हम शक्तिशाली AI इंजन बना रहे हैं, लेकिन हम उन्हें धुंधले, अधूरे मानचित्रों के साथ चला रहे हैं। अब बेहतर मानचित्र बनाने का समय आ गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।