Evaluating Large Language Models for Detecting Architectural Decision Violations
यह अध्ययन ओपन-सोर्स सॉफ़्टवेयर में आर्किटेक्चरल निर्णय उल्लंघन का पता लगाने के लिए एक मल्टी-मॉडल लार्ज लैंग्वेज मॉडल पाइपलाइन के उपयोग की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ LLMs कोड-संबंधित उल्लंघनों की पहचान करने में अत्यधिक सटीक हैं, वहीं वे अभी भी उन निहित या परिनियोजन-उन्मुख निर्णयों के लिए संघर्ष करते हैं जिनमें मानवीय विशेषज्ञता की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल लेगो (LEGO) शहर बना रहे हैं। यह सुनिश्चित करने के लिए कि शहर एक अराजक गड़बड़ी में न बदल जाए, आप एक "नियम पुस्तिका" (ये आर्किटेक्चरल डिसीजन रिकॉर्ड्स या ADRs हैं) लिखते हैं। नियम कुछ ऐसे हो सकते हैं, "सभी गगनचुंबी इमारतें नीली होनी चाहिए" या "कोई भी घर ट्रेन की पटरियों के पास नहीं बनाया जा सकता।"
जैसे-जैसे शहर बढ़ता है, लोग बहुत तेज़ी से चीज़ें बनाना शुरू कर देते हैं। अंततः, कोई लाल गगनचुंबी इमारत बना देता है या पटरियों के ठीक बगल में एक घर बना देता है। सॉफ़्टवेयर में, इसे "आर्किटेक्चरल ड्रिफ्ट" (architectural drift) कहा जाता है—यह तब होता है जब कोड मूल योजना का पालन करना बंद कर देता है, जिससे पूरा सिस्टम अव्यवस्थित और टूटने के प्रति संवेदनशील हो जाता है।
समस्या: "मैनुअल इंस्पेक्टर" का सिरदर्द
सामान्य रूप से, इन गलतियों को पकड़ने के लिए, आपको एक मानव "मास्टर आर्किटेक्ट" की आवश्यकता होगी जो पूरे शहर में घूमे, लेगो की हर एक ईंट को देखे, और उसकी तुलना नियम पुस्तिका से करे। यह थका देने वाला, धीमा है, और इंसान थक जाते हैं और चीज़ें मिस कर देते हैं।
प्रयोग: "रोबोट इंस्पेक्टर" को काम पर रखना
शोधकर्ताओं इस शोध पत्र में देखना चाहते थे कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे AI के पीछे के "दिमाग" हैं—स्वचालित निरीक्षकों के रूप में कार्य कर सकते हैं।
उन्होंने केवल एक रोबोट को काम पर नहीं रखा; उन्होंने एक "रोबोट जूरी" स्थापित की।
- लीड इंस्पेक्टर (LRM): एक AI ने नियमों और कोड को देखा और कहा, "मुझे लगता है कि यह एक उल्लंघन है!"
- जूरी (वैलिडेटर्स): तीन अन्य AI ने लीड इंस्पेक्टर के काम को देखा यह देखने के लिए कि क्या वे सहमत हैं।
- मानव जज: अंत में, वास्तविक मानव विशेषज्ञों ने रोबोट के काम की जांच की कि वास्तव में कौन सही था।
परिणाम: रोबोट कितने स्मार्ट हैं?
1. वे "विजुअल" नियमों में माहिर हैं (उच्च स्कोर)
यदि नियम सरल और कोड में स्पष्ट रूप से दिखाई देता है—जैसे "सभी फंक्शन्स को इस विशिष्ट नामकरण शैली का उपयोग करना चाहिए"—तो रोबोट अविश्वसनीय थे। वे 90% से अधिक बार सही थे। यह एक रोबोट द्वारा एक नीली लेगो ईंट को देखने और तुरंत पुष्टि करने जैसा है कि वह "नीले नियम" से मेल खाती है।
2. वे "वाइब" और "छिपे हुए" नियमों के साथ संघर्ष करते हैं (कम स्कोर)
रोबोट तब अटक गए जब नियम ईंटों के बारे में नहीं थे, बल्कि इस बारे में थे कि शहर कैसे कार्य करता है।
- "अदृश्य" नियम: यदि कोई नियम इस बारे में है कि शहर का बिजली ग्रिड कैसे काम करता है (इंफ्रास्ट्रक्चर) या विभिन्न मोहल्ले एक-दूसरे से कैसे बात करते हैं (सिस्टम इंटरेक्शन), तो रोबोट भ्रमित हो गए। वे बिजली को "देख" नहीं सकते थे; वे केवल ईंटों को देख सकते थे।
- "जानकारी की कमी" की समस्या: कभी-कभी रोबोट यह नहीं बता पाते थे कि नियम टूटा है या उनके पास निर्णय लेने के लिए पर्याप्त जानकारी नहीं है। यह एक रोबोट द्वारा एक घर को देखने और कहने जैसा है, "मुझे नहीं पता कि यह घर यहाँ होने के लिए अनुमत है या नहीं क्योंकि मैं ट्रेन की पटरियों का नक्शा नहीं देख पा रहा हूँ।"
फैसला: एक सहायक, न कि एक विकल्प
यह शोध पत्र निष्कर्ष निकालता है कि AI एक अत्यधिक कुशल जूनियर इंस्पेक्टर की तरह है।
- वे क्या कर सकते हैं: वे सेकंडों में कोड की हजारों लाइनों को स्कैन कर सकते हैं और स्पष्ट गलतियों को चिह्नित कर सकते हैं, जिससे मानव आर्किटेक्ट का भारी मात्रा में उबाऊ काम बच जाता है।
- वे क्या नहीं कर सकते: उनमें "बड़ी तस्वीर" (big picture) की समझ की कमी है। वे नियम के पीछे के इरादे या उन जटिल, अदृश्य कनेक्शनों को नहीं समझते जो एक सिस्टम को चलाए रखते हैं।
निष्कर्ष: अपने मानव आर्किटेक्ट्स को नौकरी से न निकालें! इसके बजाय, उन्हें ये "रोबोट इंस्पेक्टर" दें ताकि वे उबाऊ काम संभाल सकें, जिससे मानव वास्तविक बुद्धिमत्ता वाले जटिल, उच्च-स्तरीय चिंतन पर ध्यान केंद्रित कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।