← नवीनतम पेपर
🤖 AI

Detection and Measurement of Hailstones with Multimodal Large Language Models

यह अध्ययन प्रदर्शित करता है कि पूर्व-प्रशिक्षित मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स, विशेष रूप से जब उन्हें संदर्भ वस्तुओं (रेफरेंस ऑब्जेक्ट्स) का लाभ उठाने वाली दो-चरणीय प्रॉम्प्टिंग रणनीतियों के साथ उन्नत किया जाता है, तो वे क्राउडसोर्स्ड सोशल मीडिया छवियों से ओलों के व्यास का पता लगाने और मापने में प्रभावी रूप से सक्षम हैं, जिसमें औसत त्रुटि 1.12 सेमी है, जो तीव्र मौसम के त्वरित आकलन के लिए पारंपरिक ओला सेंसरों के लिए एक आशाजनक पूरक प्रदान करता है।

मूल लेखक: Moritz Alker, David C. Schedl, Andreas Stöckl

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moritz Alker, David C. Schedl, Andreas Stöckl

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मौसम विज्ञानी हैं जो यह पता लगाने की कोशिश कर रहे हैं कि ओले (hailstone) का आकार कितना बड़ा है। पुराने दिनों में, आपको तूफान के गुजरने का इंतज़ार करना पड़ता था, फिर लोगों की एक टीम को स्केल और "हेल पैड्स" (विशेष मैट) लेकर बाहर भेजना पड़ता था ताकि वे बर्फ को पकड़ सकें। यह समुद्र में एक जगह पर एक अकेला स्केल खड़ा करके सुनामी के आकार को मापने की कोशिश करने जैसा है—आप ज़्यादातर हलचल को मिस कर देते हैं, और आपको केवल वही पता चलता है जो ठीक उसी जगह हुआ जहाँ आप खड़े थे।

यह नया शोध पत्र इस बारे में है कि एक स्मार्ट और तेज़ तरीका क्या है: आर्टिफिशियल इंटेलिजेंस (AI) से लोगों द्वारा सोशल मीडिया पर पोस्ट की गई तस्वीरों को देखकर ओलों के आकार का अनुमान लगाने के लिए कहना।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल भागों में विभाजित किया गया है:

1. समस्या: "ब्लाइंड स्पॉट" (अंधा कोना)

ओलावृष्टि महंगी और खतरनाक होती है। यह कारों को तोड़ देती है और फसलों को नष्ट कर देती है। लेकिन हमारे वर्तमान मौसम सेंसर बहुत कम हैं; वे एक विशाल, अंधेरे शहर में बिखरी हुई कुछ छितरी हुई स्ट्रीटलाइटों की तरह हैं। वे ओलों को बहुत अधिक मिस कर देते हैं। इस बीच, लाखों लोग तबाही की तस्वीरें खींचकर इंस्टाग्राम, X (ट्विटर) और फेसबुक पर पोस्ट कर रहे हैं। ये तस्वीरें डेटा का एक खजाना हैं, लेकिन वे अव्यवस्थित हैं। एक फोटो में एक विशाल ओला हाथ के पास दिखाया जा सकता है; दूसरी फोटो में बिना किसी संदर्भ (reference) के दूर से गिरते छोटे ओले दिखाए जा सकते हैं।

2. समाधान: "सुपर-इंटेलिजेंट डिटेक्टिव"

शोधकर्ताओं ने शून्य से एक नया रोबोट नहीं बनाया। इसके बजाय, उन्होंने मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) का उपयोग किया। इन मॉडल्स को ऐसे सुपर-स्मार्ट जासूसों के रूप में सोचें जिन्होंने पूरा इंटरनेट पढ़ लिया है और अरबों तस्वीरें देख ली हैं। वे एक तस्वीर को "देख" सकते हैं और साथ ही एक सवाल को "पढ़" भी सकते हैं।

टीम ने ऑस्ट्रिया से ओलों की 474 तस्वीरें एकत्र कीं (जो 2022 और 2024 के बीच ली गई थीं)। वे जानते थे कि इन तस्वीरों में ओलों का वास्तविक आकार क्या था (जिसे "ग्राउंड ट्रुथ" कहा जाता है) क्योंकि वे आधिकारिक तूफान डेटाबेस से आए थे। वे देखना चाहते थे कि क्या AI केवल तस्वीरों को देखकर आकार का अनुमान लगा सकता है।

3. तरकीब: "दो-चरणीय नृत्य" (Two-Step Dance)

उन्होंने AI का परीक्षण प्रश्न पूछने के दो अलग-अलग तरीकों के साथ किया:

  • "डायरेक्ट शॉट" (रणनीति 1): उन्होंने बस पूछा, "यह ओला कितना बड़ा है?"
    • परिणाम: AI अक्सर भ्रमित हो गया या गलत अनुमान लगाने लगा, खासकर यदि फोटो दूर से ली गई थी। यह बिना किसी तुलनात्मक वस्तु के किसी कार के आकार का अनुमान लगाने के लिए किसी से पूछने जैसा था।
  • "दो-चरणीय नृत्य" (रणनीति 2): यह विजेता रहा।
    • चरण 1: AI पहले एक संदर्भ वस्तु (reference object) की तलाश करता है। वह पूछता है, "क्या इस तस्वीर में कोई हाथ, सिक्का, स्केल या सिगरेट है?"
    • चरण 2: एक बार जब उसे संदर्भ मिल जाता है (जैसे, "अहा! यह एक मानव हाथ है!"), तो वह उस हाथ के बगल में ओले के आकार की गणना करने के लिए अपने ज्ञान का उपयोग करता है (जैसे, "एक हाथ आमतौर पर X इंच चौड़ा होता है")।
    • परिणाम: यह फोटो के सामने स्केल पकड़कर दिखाने जैसा था। सटीकता में काफी उछाल आया।

4. परिणाम: "काफी अच्छा, लेकिन पूर्ण नहीं"

सबसे अच्छे AI मॉडल (GPT-4o) ने औसतन लगभग 1.12 सेंटीमीटर के भीतर सही आकार बताया।

  • अच्छी खबर: यदि ओला 5 सेमी का है, तो AI ने 4.5 या 5.5 सेमी का अनुमान लगाया। यह किसान को यह बताने के लिए पर्याप्त है कि, "हे, यह एक खतरनाक तूफान है!"
  • बुरी खबर: AI की एक आदत थी कि वह थोड़ा शर्मीला (shy) था। वह आकार को कम आंकने की प्रवृत्ति रखता था (अनुमान लगाना कि ओला वास्तव में जितना था उससे छोटा था)। यह एक घबराए हुए गवाह जैसा है जो कहता है, "मुझे लगता है कि कार छोटी थी," जबकि वह वास्तव में बहुत बड़ी थी।
  • हाथ का कारक: वे तस्वीरें जिनमें मानव हाथ थे, AI के लिए सबसे आसान थीं। त्रुटि घटकर केवल 0.75 सेमी रह गई। AI जानता है कि हाथ कैसा दिखता है, इसलिए यह एक आदर्श स्केल है। बिना संदर्भ वस्तुओं वाली तस्वीरें बहुत कठिन थीं।

5. यह क्यों मायने रखता है

कल्पना कीजिए कि भविष्य में, एक तूफान के दौरान, एक स्वचालित प्रणाली तुरंत सोशल मीडिया को स्कैन करती है, ओलों की तस्वीरें ढूंढती है, और मौसम सेवा को बताती है: "इस पड़ोस के लोग गोल्फ की गेंद के आकार के ओलों के साथ तस्वीरें पोस्ट कर रहे हैं!"

यह रियल-टाइम में होता है, उन क्षेत्रों को कवर करता है जहाँ आधिकारिक सेंसर मौजूद नहीं हैं। यह "भीड़" को एक विशाल, वितरित सेंसर नेटवर्क में बदल देता है।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र साबित करता है कि हमें अब ओलों को मापने के लिए विशेष, महंगे कैमरे बनाने की आवश्यकता नहीं है। हम बस उन्हीं AI टूल्स का उपयोग कर सकते हैं जो हमारे पास पहले से मौजूद हैं, और उन तस्वीरों का उपयोग कर सकते हैं जो लोग पहले से ही ले रहे हैं।

  • उपमा (Analogy): यह महसूस करने जैसा है कि आपको कमरे को मापने के लिए पेशेवर सर्वेक्षक की आवश्यकता नहीं है; आपको बस कमरे की एक फोटो चाहिए जिसमें एक व्यक्ति खड़ा हो, और गणित करने के लिए एक स्मार्ट कंप्यूटर चाहिए।
  • चुनौती: हमें अभी भी वह सिस्टम बनाना होगा जो वास्तविक समय में सोशल मीडिया पर इन तस्वीरों को स्वचालित रूप से खोज सके। एक बार जब यह हो जाएगा, तो हमारे पास पहले से कहीं अधिक तेज़ी से और अधिक सटीकता से गंभीर मौसम को ट्रैक करने के लिए एक सुपर-पावरफुल टूल होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →