← नवीनतम पेपर
🤖 machine learning

Probabilistic indirect models for undrained shear strength: addressing significant data missing and variability with advanced imputation and machine learning techniques

यह अध्ययन लापता डेटा को संभालने के लिए मल्टीपल इम्प्यूटेशन तकनीकों को एक मल्टी-हेड अटेंशन-एन्हांस्ड न्यूरल नेटवर्क के साथ एकीकृत करके, अनड्रेनड शियर स्ट्रेंथ (undrained shear strength) की भविष्यवाणी करने के लिए एक सुदृढ़ संभाव्य अप्रत्यक्ष मॉडल प्रस्तावित करता है, जो पारंपरिक तरीकों की तुलना में बेहतर सटीकता और अनिश्चितता परिमाणीकरण प्रदर्शित करता है।

मूल लेखक: Haibin Xiong, Shaoheng Dai, Peng Lan, Xuzhen He, Chenxi Tong, Sheng Zhang, Daichao Sheng

प्रकाशित 2026-08-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haibin Xiong, Shaoheng Dai, Peng Lan, Xuzhen He, Chenxi Tong, Sheng Zhang, Daichao Sheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे जमीन के टुकड़े पर गगनचुंबी इमारत बनाने की कोशिश कर रहे हैं जिसे आपने पहले कभी नहीं देखा है। आप सिर्फ अंदाज़ा नहीं लगा सकते; आपको यह जानना होगा कि मिट्टी कितनी मजबूत है, अन्यथा पूरी इमारत धंस सकती है या फिसल सकती है। यह भू-तकनीकी इंजीनियरों (geotechnical engineers) का काम है, जो मिट्टी की "अनड्रेंड शियर स्ट्रेंथ" (undrained shear strength) का अध्ययन करते हैं—मूल रूप से, यह कि मिट्टी पानी के अंदर फंसने पर कितना बल झेल सकती है। यह कुछ ऐसा है जैसे यह पता लगाने की कोशिश करना कि एक गीला स्पंज पिचकने से पहले कितना वजन सह सकता है। समस्या यह है कि यह जानकारी प्राप्त करना बहुत अव्यवस्थित है। कभी-कभी आप मिट्टी का सीधे परीक्षण नहीं कर सकते क्योंकि वह बहुत गहरी होती है या बहुत महंगी होती है, इसलिए इंजीनियरों को अन्य संकेतों के आधार पर अनुमान लगाना पड़ता है, जैसे कि मिट्टी का चिपचिपापन या एक शंकु (cone) उसे कैसे भेदता है। लेकिन ये अनुमान अक्सर छिद्रों से भरे होते हैं, शाब्दिक और लाक्षणिक रूप से। डेटा गायब है, नंबर एक स्थान से दूसरे स्थान तक बहुत अधिक भिन्न होते हैं, और अनुमान लगाने के पुराने तरीके अक्सर सुरक्षित होने के लिए बहुत अनिश्चित होते हैं।

यह शोध पत्र एक टीम के जासूसों की तरह है जो गायब मिट्टी के डेटा के मामले को सुलझाने की कोशिश कर रहे हैं। उन्होंने मिट्टी के लिए एक विशाल, वैश्विक "लापता व्यक्तियों" फ़ाइल नामक CLAY/10/7490 डेटाबेस को पकड़ा। इस फ़ाइल में 30 विभिन्न देशों की जानकारी है, लेकिन यह एक आपदा है: केवल लगभग 34% जानकारी वास्तव में मौजूद है। बाकी खाली है, जैसे एक पहेली जिसके अधिकांश टुकड़े निकाल दिए गए हों। शोधकर्ता यह देखना चाहते थे कि क्या वे उन खाली स्थानों को भरने के लिए उन्नत कंप्यूटर युक्तियों का उपयोग कर सकते हैं और फिर उन भरे हुए पहेलियों का उपयोग मिट्टी की ताकत को पहले से कहीं अधिक सटीक रूप से भविष्यवाणी करने के लिए कर सकते हैं। उन्होंने खाली टुकड़ों का अनुमान लगाने के तीन अलग-अलग तरीकों का परीक्षण किया और दो नए प्रकार के "सुपर-फोरकास्टर्स" बनाए ताकि यह देखा जा सके कि कौन सा संयोजन सबसे अच्छा काम करता है।

महान लापता टुकड़ों की खोज

टीम ने अपने विशाल डेटाबेस से शुरुआत की, जिसमें मिट्टी के बारे में 7,490 पंक्तियों का डेटा था। लेकिन पेच यह है कि अधिकांश पंक्तियाँ अधूरी थीं। कुछ कॉलम, जैसे कि "एटरबर्ग लिमिट्स" (जो मिट्टी के चिपचिपेपन और प्लास्टिक गुण को मापते हैं), लगभग 40% समय गायब थे। लेकिन "CPTU" मापों वाले कॉलम (जो जमीन में शंकु धकेलने से आते हैं) 90% से अधिक समय गायब थे! यह एक अपराध को सुलझाने की कोशिश करने जैसा था जहाँ गवाह ने जो देखा था उसका 90% हिस्सा भूल गया हो।

सबसे पहले, उन्होंने मल्टीवेरिएट नॉर्मल (MN) मॉडल नामक एक सरल, पुराने तरीके को आजमाया। इसे एक ऐसे शिक्षक के रूप में सोचें जो जानता है कि जो छात्र गणित में अच्छे हैं वे आमतौर पर विज्ञान में भी अच्छे होते हैं। यदि किसी छात्र का विज्ञान का ग्रेड गायब है, तो शिक्षक उनके गणित के ग्रेड के आधार पर अनुमान लगाता है। शोधकर्ताओं ने इस तर्क का उपयोग मिट्टी के गायब डेटा को भरने के लिए किया। उन्होंने पाया कि जबकि इस पद्धति ने डेटा के सामान्य "आकार" को सही रखा, इसने अपने आप में अंतिम भविष्यवाणियों को बहुत बेहतर नहीं बनाया। यह उस पहेली को भरने जैसा था जिसमें टुकड़े सही दिखते तो थे लेकिन चित्र में पूरी तरह फिट नहीं बैठते थे।

इसके बाद, उन्होंने दो अधिक परिष्कृत तरीकों का प्रयास किया: MICE और Miss Forest (MF)

  • MICE उन जासूसों के एक समूह की तरह है जो गायब जानकारी का अनुमान लगाने के लिए बारी-बारी से काम करते हैं। एक जासूस सुरागों के आधार पर एक मान का अनुमान लगाता है, फिर दूसरा जासूस अपने स्वयं के अनुमान के लिए उस अनुमान का उपयोग करता है, और वे तब तक आगे बढ़ते रहते हैं जब तक कि वे सभी सहमत नहीं हो जाते।
  • Miss Forest सुपर-स्मार्ट AI जासूसों की एक टीम की तरह है जो गायब हिस्सों का पता लगाने के लिए निर्णय वृक्षों (decision trees) के एक "वन" का उपयोग करते हैं। वे उन जटिल पैटर्न को देखते हैं जिन्हें सरल गणित मिस कर सकता है।

जब उन्होंने इन विधियों की तुलना की, तो उन्होंने पाया कि MICE वास्तविक दुनिया की मिट्टी जैसा दिखने वाले डेटा को बनाए रखने में सबसे अच्छा था। इसने अजीब आउटलेर्स या नकली पैटर्न नहीं बनाए और मूल सांख्यिकीय वितरण के प्रति सबसे वफादार था। Miss Forest ठीक था, लेकिन यह कभी-कभी अपने अनुमानों के साथ थोड़ा अधिक रचनात्मक हो जाता था। सरल MN विधि वास्तविक प्रकृति को संरक्षित करने में सबसे कम सटीक थी, जो अक्सर मूल अव्यवस्थित वास्तविकता की तुलना में "अत्यधिक केंद्रित" परिणाम उत्पन्न करती थी।

सुपर-फोरकास्टर्स

एक बार जब उनके पास "भरे हुए" डेटाबेस आ गए, तो शोधकर्ताओं ने पुराने तरीकों से बेहतर मिट्टी की ताकत का अनुमान लगाने के लिए दो नए प्रकार के भविष्यवाणी मॉडल बनाए।

  1. PXGB (प्रोबेबिलिस्टिक एक्सट्रीम ग्रेडिएंट बूस्टिंग): कल्पना कीजिए कि 100 विशेषज्ञों की एक टीम उत्तर पर वोट करती है। यदि एक विशेषज्ञ गलत है, तो अन्य उन्हें सुधारते हैं। यह मॉडल अव्यवस्थित डेटा को संभालने में बहुत अच्छा है, लेकिन यह अभी भी केवल एक मानक "मतदान" मशीन है।
  2. MHA-PNN (मल्टी-हेड अटेंशन प्रोबेबिलिस्टिक न्यूरल नेटवर्क): यह मुख्य आकर्षण है। इस मॉडल को एक ऐसे जासूस के रूप में सोचें जिसके पास एक सुपरपावर है: अटेंशन (ध्यान)। जैसे आप शोर को अनदेखा करते हुए भीड़ भरे कमरे में एक विशिष्ट विवरण पर ध्यान केंद्रित कर सकते हैं, इस मॉडल के पास "हेड्स" (शीर्ष) हैं जो मिट्टी के डेटा में सबसे महत्वपूर्ण सुरागों पर ध्यान केंद्रित कर सकते हैं और बेकार के हिस्सों को अनदेखा कर सकते हैं। यह केवल डेटा को देखता नहीं है; यह विभिन्न सुरागों के बीच के संबंधों को समझता है।

बड़ा खुलासा

परिणाम स्पष्ट थे। जब शोधकर्ताओं ने इन मॉडलों का परीक्षण किया, तो MHA-PNN मॉडल ने प्रतियोगिता को पछाड़ दिया, लेकिन गायब डेटा को भरने का तरीका एक विशिष्ट तरीके से मायने रखता था।

  • सटीकता: MHA-PNN मॉडल ने PXGB मॉडल की तुलना में लगभग 72% कम गलतियाँ कीं जब सबसे अच्छे भरे हुए डेटा का उपयोग किया गया।
  • विश्वास (Confidence): इसने केवल संख्या का अनुमान नहीं लगाया; इसने संभावित मूल्यों की एक सीमा (अनिश्चितता) भी दी। MHA-PNN मॉडल के अनुमान बहुत अधिक सटीक और विश्वसनीय थे। इसका "कॉन्फिडेंस इंटरवल" (संभावित उत्तरों की सीमा) PXGB मॉडल की तुलना में लगभग 96% संकीर्ण था, जिसका अर्थ है कि यह बिना गलत हुए अपने उत्तर के बारे में बहुत अधिक आश्वस्त था।
  • "गायब" की समस्या: उन्होंने कुछ महत्वपूर्ण भी खोजा: यदि आपके पास केवल कुछ ही सुराग (चार से कम डेटा के टुकड़े) हैं, तो सबसे अच्छा मॉडल भी संघर्ष करता है। यह केवल एक दृश्य के साथ फिल्म के कथानक का अनुमान लगाने जैसा है। लेकिन एक बार जब उनके पास पर्याप्त सुराग थे, तो MHA-PNN मॉडल चमक उठा।

यहाँ एक मोड़ है: जबकि MICE डेटा के सांख्यिकीय आकार को संरक्षित करने में स्पष्ट विजेता था (भरे हुए पहेली को वास्तविक चीज़ जैसा दिखाने में), यह अंतिम भविष्यवाणी के लिए आदर्श साथी नहीं था। आश्चर्यजनक रूप से, MHA-PNN मॉडल ने अपने सर्वोत्तम प्रदर्शन के लिए MN इमप्यूटेशन विधि के साथ मिलकर काम किया। शोधकर्ताओं ने पाया कि MN ने इस विशिष्ट उन्नत मॉडल के लिए सबसे अच्छा ट्रेड-ऑफ (संतुलन) प्रदान किया। भले ही MN ने MICE की तरह डेटा वितरण को पूरी तरह से संरक्षित नहीं किया, लेकिन इसने MHA-PNN को अपनी भविष्यवाणियां बनाने के लिए सबसे सटीक आधार प्रदान किया। इसलिए, "सर्वश्रेष्ठ" संयोजन किसी एक अकेले इम्प्यूटर या एक अकेले मॉडल को चुनने के बारे में नहीं था, बल्कि उस विशिष्ट जोड़ी को खोजने के बारे में था जहाँ उन्नत "सुपर-अटेंशन" मॉडल अपना सर्वश्रेष्ठ काम कर सके।

यह क्यों मायने रखता है

यह अध्ययन बताता है कि हम मिट्टी की ताकत की भविष्यवाणी करने के लिए बहुत सुरक्षित और अधिक विश्वसनीय मॉडल बना सकते हैं, भले ही हमारा डेटा अधूरा और अव्यवस्थित हो। इन उन्नत "अटेंशन" तकनीकों का उपयोग करके और सही डेटा-फिलिंग पार्टनर को खोजकर, इंजीनियर बिना हर इंच मिट्टी का परीक्षण किए नींव, सुरंगों और ढलानों के निर्माण के लिए बेहतर निर्णय ले सकते हैं। हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह वास्तविक दुनिया के परीक्षण को बदलने वाला कोई जादू का डंडा नहीं है। यह एक अच्छी पहली धारणा प्राप्त करने के लिए एक शक्तिशाली उपकरण है, विशेष रूप से जब डेटा कम हो, लेकिन सबसे महत्वपूर्ण परियोजनाओं के लिए, आपको अभी भी खुद जमीन की जांच करनी होगी।

संक्षेप में, यह शोध पत्र दिखाता है कि कंप्यूटर को सही सुरागों पर ध्यान देने के लिए सिखाकर और खाली स्थानों को बुद्धिमानी से भरकर—भले ही भरने का तरीका सांख्यिकीय रूप से पूर्ण न हो—हम एक अव्यवस्थित, अधूरे पहेली को हमारे पैरों के नीचे की जमीन की एक स्पष्ट तस्वीर में बदल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →