← नवीनतम पेपर
🤖 AI

Evaluating Large Language Models for Detecting Architectural Decision Violations

यह अध्ययन ओपन-सोर्स सॉफ़्टवेयर में आर्किटेक्चरल निर्णय उल्लंघन का पता लगाने के लिए एक मल्टी-मॉडल लार्ज लैंग्वेज मॉडल पाइपलाइन के उपयोग की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ LLMs कोड-संबंधित उल्लंघनों की पहचान करने में अत्यधिक सटीक हैं, वहीं वे अभी भी उन निहित या परिनियोजन-उन्मुख निर्णयों के लिए संघर्ष करते हैं जिनमें मानवीय विशेषज्ञता की आवश्यकता होती है।

मूल लेखक: Ruoyu Su, Alexander Bakhtin, Noman Ahmad, Matteo Esposito, Valentina Lenarduzzi, Davide Taibi

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ruoyu Su, Alexander Bakhtin, Noman Ahmad, Matteo Esposito, Valentina Lenarduzzi, Davide Taibi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल लेगो (LEGO) शहर बना रहे हैं। यह सुनिश्चित करने के लिए कि शहर एक अराजक गड़बड़ी में न बदल जाए, आप एक "नियम पुस्तिका" (ये आर्किटेक्चरल डिसीजन रिकॉर्ड्स या ADRs हैं) लिखते हैं। नियम कुछ ऐसे हो सकते हैं, "सभी गगनचुंबी इमारतें नीली होनी चाहिए" या "कोई भी घर ट्रेन की पटरियों के पास नहीं बनाया जा सकता।"

जैसे-जैसे शहर बढ़ता है, लोग बहुत तेज़ी से चीज़ें बनाना शुरू कर देते हैं। अंततः, कोई लाल गगनचुंबी इमारत बना देता है या पटरियों के ठीक बगल में एक घर बना देता है। सॉफ़्टवेयर में, इसे "आर्किटेक्चरल ड्रिफ्ट" (architectural drift) कहा जाता है—यह तब होता है जब कोड मूल योजना का पालन करना बंद कर देता है, जिससे पूरा सिस्टम अव्यवस्थित और टूटने के प्रति संवेदनशील हो जाता है।

समस्या: "मैनुअल इंस्पेक्टर" का सिरदर्द

सामान्य रूप से, इन गलतियों को पकड़ने के लिए, आपको एक मानव "मास्टर आर्किटेक्ट" की आवश्यकता होगी जो पूरे शहर में घूमे, लेगो की हर एक ईंट को देखे, और उसकी तुलना नियम पुस्तिका से करे। यह थका देने वाला, धीमा है, और इंसान थक जाते हैं और चीज़ें मिस कर देते हैं।

प्रयोग: "रोबोट इंस्पेक्टर" को काम पर रखना

शोधकर्ताओं इस शोध पत्र में देखना चाहते थे कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे AI के पीछे के "दिमाग" हैं—स्वचालित निरीक्षकों के रूप में कार्य कर सकते हैं।

उन्होंने केवल एक रोबोट को काम पर नहीं रखा; उन्होंने एक "रोबोट जूरी" स्थापित की।

  1. लीड इंस्पेक्टर (LRM): एक AI ने नियमों और कोड को देखा और कहा, "मुझे लगता है कि यह एक उल्लंघन है!"
  2. जूरी (वैलिडेटर्स): तीन अन्य AI ने लीड इंस्पेक्टर के काम को देखा यह देखने के लिए कि क्या वे सहमत हैं।
  3. मानव जज: अंत में, वास्तविक मानव विशेषज्ञों ने रोबोट के काम की जांच की कि वास्तव में कौन सही था।

परिणाम: रोबोट कितने स्मार्ट हैं?

1. वे "विजुअल" नियमों में माहिर हैं (उच्च स्कोर)
यदि नियम सरल और कोड में स्पष्ट रूप से दिखाई देता है—जैसे "सभी फंक्शन्स को इस विशिष्ट नामकरण शैली का उपयोग करना चाहिए"—तो रोबोट अविश्वसनीय थे। वे 90% से अधिक बार सही थे। यह एक रोबोट द्वारा एक नीली लेगो ईंट को देखने और तुरंत पुष्टि करने जैसा है कि वह "नीले नियम" से मेल खाती है।

2. वे "वाइब" और "छिपे हुए" नियमों के साथ संघर्ष करते हैं (कम स्कोर)
रोबोट तब अटक गए जब नियम ईंटों के बारे में नहीं थे, बल्कि इस बारे में थे कि शहर कैसे कार्य करता है।

  • "अदृश्य" नियम: यदि कोई नियम इस बारे में है कि शहर का बिजली ग्रिड कैसे काम करता है (इंफ्रास्ट्रक्चर) या विभिन्न मोहल्ले एक-दूसरे से कैसे बात करते हैं (सिस्टम इंटरेक्शन), तो रोबोट भ्रमित हो गए। वे बिजली को "देख" नहीं सकते थे; वे केवल ईंटों को देख सकते थे।
  • "जानकारी की कमी" की समस्या: कभी-कभी रोबोट यह नहीं बता पाते थे कि नियम टूटा है या उनके पास निर्णय लेने के लिए पर्याप्त जानकारी नहीं है। यह एक रोबोट द्वारा एक घर को देखने और कहने जैसा है, "मुझे नहीं पता कि यह घर यहाँ होने के लिए अनुमत है या नहीं क्योंकि मैं ट्रेन की पटरियों का नक्शा नहीं देख पा रहा हूँ।"

फैसला: एक सहायक, न कि एक विकल्प

यह शोध पत्र निष्कर्ष निकालता है कि AI एक अत्यधिक कुशल जूनियर इंस्पेक्टर की तरह है।

  • वे क्या कर सकते हैं: वे सेकंडों में कोड की हजारों लाइनों को स्कैन कर सकते हैं और स्पष्ट गलतियों को चिह्नित कर सकते हैं, जिससे मानव आर्किटेक्ट का भारी मात्रा में उबाऊ काम बच जाता है।
  • वे क्या नहीं कर सकते: उनमें "बड़ी तस्वीर" (big picture) की समझ की कमी है। वे नियम के पीछे के इरादे या उन जटिल, अदृश्य कनेक्शनों को नहीं समझते जो एक सिस्टम को चलाए रखते हैं।

निष्कर्ष: अपने मानव आर्किटेक्ट्स को नौकरी से न निकालें! इसके बजाय, उन्हें ये "रोबोट इंस्पेक्टर" दें ताकि वे उबाऊ काम संभाल सकें, जिससे मानव वास्तविक बुद्धिमत्ता वाले जटिल, उच्च-स्तरीय चिंतन पर ध्यान केंद्रित कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →