← नवीनतम पेपर
🤖 AI

A Methodology for Investigating AI Patterns Prevalence in Software Repositories

यह शोध पत्र एक ऐसी कार्यप्रणाली का प्रस्ताव और सत्यापन करता है जो 14 AI पैटर्न वर्गों की पहचान करने के लिए साहित्य खनन (literature mining) को सक्रिय शिक्षण (active learning) के साथ जोड़ती है ताकि वास्तविक दुनिया के GitHub रिपॉजिटरी में उनकी व्यापकता और सटीकता को अनुभवजन्य रूप से मापा जा सके, जो इस बात की समझ में मौजूद वर्तमान अंतराल को संबोधित करता है कि वास्तव में व्यवहार में AI पैटर्न का उपयोग कैसे किया जाता है।

मूल लेखक: Srinath Perera, Hasinthaka Piyumal, Frank Leymann, Rania Khalaf

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Srinath Perera, Hasinthaka Piyumal, Frank Leymann, Rania Khalaf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शहर नियोजक (city planner) हैं जो यह समझने की कोशिश कर रहे हैं कि वास्तव में लोग आधुनिक शहरों में घर कैसे बनाते हैं। आपके पास "आदर्श घर डिजाइनों" (साहित्य के विशेषज्ञों द्वारा प्रस्तावित AI पैटर्न) की एक मोटी किताब है, लेकिन आपको बिल्कुल भी अंदाजा नहीं है कि क्या वास्तव में लोग इन डिजाइनों का उपयोग कर रहे हैं, या वे बस अपनी मर्जी से अजीब संरचनाएं बना रहे हैं।

यह शोध पत्र उस टीम के बारे में है जिन्होंने यह तय किया कि वे वास्तव में 100 वास्तविक घर वाले मोहल्लों (GitHub कोड रिपॉजिटरी) का दौरा करेंगे और यह पता लगाएंगे कि कौन से "आदर्श डिजाइन" वास्तव में उपयोग किए जा रहे हैं।

इसे सरल भाषा में यहाँ समझाया गया है:

1. समस्या: बहुत सारे विचार, लेकिन पर्याप्त प्रमाण नहीं

विशेषज्ञों ने सैकड़ों "AI पैटर्न" (स्मार्ट सॉफ्टवेयर बनाने की रेसिपी) लिखे हैं। लेकिन कोई नहीं जानता था कि क्या ये रेसिपी वास्तव में असली रसोई में बनाई जा रही हैं। शोधकर्ता "सिद्धांत" से "वास्तविकता" की ओर जाना चाहते थे।

2. पहला कदम: रेसिपी बुक को साफ करना

सबसे पहले, उन्होंने किताबों, ब्लॉगों और दस्तावेज़ीकरण से 769 अलग-अलग "रेसिपी" एकत्र कीं। वह काम करने के लिए बहुत अव्यवस्थित थी।

  • उपमा (Analogy): कल्पना कीजिए कि आपके पास "सैंडविच बनाने" के 769 अलग-अलग नाम हैं। कुछ कहते हैं "क्लब", अन्य कहते हैं "BLT", अन्य कहते हैं "गेहूं पर हैम और चीज़"।
  • समाधान: उन्होंने समान रेसिपी को एक साथ समूहबद्ध करने के लिए एक स्मार्ट कंप्यूटर (एक LLM) का उपयोग किया। फिर मनुष्यों ने उन समूहों को देखा और उन्हें 14 स्पष्ट श्रेणियों (जैसे "RAG," "Agent Architecture," "Preprocessing," आदि) में व्यवस्थित किया। इसने 14 मुख्य व्यंजनों का एक साफ, व्यवस्थित मेनू तैयार कर दिया।

3. दूसरा कदम: "मोहल्ले" खोजना (कोड समुदाय)

वे केवल कोड की एक एकल पंक्ति को नहीं देख सकते थे; यह एक घर को केवल एक ईंट देखकर आंकने जैसा है। उन्हें कोड के ऐसे "समुदायों" को खोजने की आवश्यकता थी जो एक साथ काम करते हैं।

  • उपमा: घर के व्यक्तिगत ईंटों को देखने के बजाय, उन्होंने घर के "कमरों" को देखा। उन्होंने कोड के समूहों को खोजने के लिए एक विशेष मानचित्र (कॉल ग्राफ) का उपयोग किया, जो आपस में मजबूती से जुड़े होते हैं, जैसे एक रसोई जहाँ चूल्हा, फ्रिज और सिंक सभी एक-दूसरे से जुड़े होते हैं।
  • चयन: उन्होंने GitHub से 100 वास्तविक दुनिया के AI प्रोजेक्ट्स (मोहल्ले) चुने जो लोकप्रिय थे लेकिन बहुत बड़े, बुनियादी फ्रेमवर्क (जैसे TensorFlow) नहीं थे। वे यह देखना चाहते थे कि सामान्य डेवलपर्स क्या बना रहे हैं, न कि केवल वे विशाल उपकरण जिन पर बाकी सब निर्माण करते हैं।

4. तीसरा कदम: "अनुमान और जांच" का खेल (Active Learning)

यही सबसे चतुर हिस्सा है। उनके पास अपने कंप्यूटर मॉडल को प्रशिक्षित करने के लिए उत्तर कुंजी (लेबल वाला डेटा) वाला कोई शिक्षक नहीं था।

  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है लेकिन उसे उत्तर नहीं पता।
    1. छात्र अपने स्वयं के उत्पन्न किए गए कुछ उदाहरणों के आधार पर कुछ अनुमान लगाता है।
    2. कंप्यूटर 100 मोहल्लों को देखता है और कहता है, "मैं इस पर 50/50 हूँ, लेकिन मैं उसके बारे में निश्चित हूँ।"
    3. शोधकर्ता (मानव शिक्षक) केवल उन चीजों को देखते हैं जिनके बारे में कंप्यूटर अनिश्चित है। वे उन्हें लेबल करते हैं, और फिर कंप्यूटर उनसे सीखता है।
    4. वे इस चक्र को दोहराते हैं। कंप्यूटर हर दौर के साथ स्मार्ट होता जाता है, और केवल तभी मदद मांगता है जब वह वास्तव में भ्रमित होता है। इससे उन्हें हजारों फाइलों को मैन्युअल रूप से पढ़ने और लेबल करने से मुक्ति मिली।

5. चौथा कदम: परिणामों की गिनती (एक सुरक्षा जाल के साथ)

एक बार जब कंप्यूटर प्रशिक्षित हो गया, तो उसने प्रत्येक पैटर्न के कितनी बार दिखाई देने की गिनती करने के लिए 100 मोहल्लों को स्कैन किया।

  • ट्विस्ट: कंप्यूटर परफेक्ट नहीं है। यह गलतियाँ करता है। इसलिए, शोधकर्ताओं ने केवल एक संख्या (जैसे, "RAG 20% समय उपयोग किया जाता है") नहीं दी।
  • सुरक्षा जाल: उन्होंने एक सांख्यिकीय ट्रिक (जैसे 20,000 बार सिमुलेशन चलाना) का उपयोग किया यह कहने के लिए कि, "हम 95% सुनिश्चित हैं कि वास्तविक संख्या X और Y के बीच है।" यह एक "कॉन्फिडेंस इंटरवल" देता है, जो उनकी त्रुटि की सीमा को स्वीकार करता है।

उन्होंने क्या पाया?

  • स्कोर: उनके कंप्यूटर ने यह पहचानने में लगभग 56% सटीकता प्राप्त की कि कौन सा पैटर्न उपयोग किया जा रहा था। यह कम लग सकता है, लेकिन याद रखें कि चुनने के लिए 8 अलग-अलग श्रेणियां थीं। रैंडम अनुमान लगाने पर केवल 11% मिलता। इसलिए, वे संयोग से 5 गुना बेहतर थे।
  • विजेता: उन्होंने पाया कि "Forecasting with Classical Models" और "Multimodal Prompting" जैसे पैटर्न बहुत आम थे।
  • हारने वाले: कुछ पैटर्न, जैसे "Using Tools with LLMs," को पहचानना कठिन था क्योंकि वे कोड में मजबूत "फिंगरप्रिंट" नहीं छोड़ते थे, इसलिए कंप्यूटर अक्सर उन्हें "कुछ खास नहीं" (None श्रेणी) के साथ भ्रमित कर देता था।
  • "None" की समस्या: बहुत सारा कोड "None" के रूप में लेबल किया गया। ऐसा इसलिए हुआ क्योंकि कुछ पैटर्न सूक्ष्म थे, या कोड पहचानने के लिए बहुत अव्यवस्थित था।

मुख्य निष्कर्ष

इस शोध पत्र ने केवल यह नहीं कहा कि "AI पैटर्न मौजूद हैं।" इसने यह साबित करने के लिए एक मजबूत पद्धति बनाई कि वास्तविक दुनिया में उनका कितनी बार उपयोग किया जाता है, भले ही हमारे पास शुरुआत में कोई आदर्श डेटासेट न हो।

उन्होंने दिखाया कि:

  1. आप विचारों की एक अव्यवस्थित सूची को एक साफ वर्गीकरण (taxonomy) में व्यवस्थित कर सकते हैं।
  2. आप कंप्यूटर को केवल तब मनुष्यों से मदद मांगकर इन पैटर्न को खोजने के लिए सिखा सकते हैं जब कंप्यूटर भ्रमित हो (Active Learning)।
  3. आप यह अनुमान लगा सकते हैं कि ये पैटर्न कितने सामान्य हैं, जबकि ईमानदारी से अपनी "त्रुटि सीमाओं" को भी स्वीकार कर सकते हैं।

यह अंततः एक शहर के वास्तुकला का एक विश्वसनीय जनगणना होने जैसा है, जिसमें एक नोट शामिल है कि, "हम घरों के बारे में काफी आश्वस्त हैं, लेकिन छोटे शेड शायद थोड़े धुंधले हो सकते हैं।" यह डेवलपर्स और शोधकर्ताओं को यह समझने के लिए एक डेटा-आधारित आधार प्रदान करता है कि आज वास्तव में AI कैसे बनाया जा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →