← नवीनतम पेपर
🤖 AI

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

यह शोध पत्र SafeSceneReason को प्रस्तुत करता है, जो एक मल्टीमॉडल बेंचमार्क और प्रशिक्षण कॉर्पस है जो औद्योगिक सुरक्षा दृश्यों को दुर्घटना जांच ज्ञान के साथ जोड़ता है ताकि खतरे के आकलन और दुर्घटना रोकथाम के लिए साक्ष्य-आधारित तर्क (evidence-grounded reasoning) में विजन-लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन और उन्हें उन्नत किया जा सके।

मूल लेखक: Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त निर्माण स्थल (construction site) पर सुरक्षा निरीक्षक बनने के लिए प्रशिक्षित कर रहे हैं। आपको लग सकता है कि सबसे कठिन काम केवल रोबोट को चीजों को "देखना" सिखाना है: जैसे किसी कर्मचारी को पहचानना, हेलमेट को पहचानना, या सीढ़ी को नोटिस करना। लेकिन औद्योगिक सुरक्षा की वास्तविक दुनिया में, केवल "देखना" पर्याप्त नहीं है। यह एक ऐसे कैमरे की तरह है जो कार दुर्घटना की एक आदर्श फोटो तो ले सकता है, लेकिन यह नहीं बता सकता कि दुर्घटना क्यों हुई या इसे दोबारा होने से कैसे रोका जाए। वास्तव में मददगार होने के लिए, एक रोबोट को पूरी कहानी समझने की आवश्यकता है: कैसे एक कर्मचारी, एक मशीन और एक सुरक्षा नियम मिलकर एक जोखिम पैदा करते हैं। यह "मल्टीमॉडल रीजनिंग" (multimodal reasoning) की चुनौती है, जहाँ एक कंप्यूटर यह प्रयास करता है कि वह जो देखता है (छवियां) उसे अपने ज्ञान (नियमों और पिछली कहानियों) के साथ जोड़कर समझदारी भरे, जीवन बचाने वाले निर्णय ले सके। यदि एक रोबोट ऐसा नहीं कर सकता, तो वह एक छिपे हुए खतरे को मिस कर सकता है, जैसे कि एक कर्मचारी जो फोर्कलिफ्ट के पीछे खड़ा है और जो पीछे की ओर मुड़ने वाला है, भले ही उस कर्मचारी ने सभी सही सुरक्षा उपकरण पहने हों।

यही वह समस्या है जिसे SafeSceneReason के पीछे के शोधकर्ता हल कर रहे हैं। उन्होंने महसूस किया कि हालांकि हमारे पास रोबोट को व्यक्तिगत सुरक्षा उल्लंघन पहचानने में मदद करने के लिए पर्याप्त उपकरण हैं, लेकिन हमारे पास उन्हें एक अव्यवस्थित कार्यस्थल के दृश्य और दुर्घटना रिपोर्टों में पाए जाने वाले गहरे ज्ञान के बीच संबंध जोड़ने का अभ्यास कराने के लिए पर्याप्त सामग्री नहीं है। इसलिए, उन्होंने AI के लिए एक विशाल नया "प्रशिक्षण जिम" बनाया, जिसे SafeSceneReason कहा जाता है। इसे एक दो-भाग वाले वीडियो गेम की तरह समझें जिसे रोबोट को बेहतर सुरक्षा जासूस बनाने के लिए डिज़ाइन किया गया है।

उनके गेम का पहला भाग "सीन-सेंट्रिक" (Scene-Centric) स्तर है। यहाँ, AI हजारों वास्तविक कार्यस्थलों की तस्वीरों को देखता है। केवल यह अनुमान लगाने के बजाय कि चित्र में क्या है, शोधकर्ताओं ने इन छवियों को एक डिजिटल "सुरक्षा मानचित्र" (सीन ग्राफ) में बदल दिया जहाँ प्रत्येक कर्मचारी, उपकरण और खतरा एक पहेली के जुड़े हुए टुकड़ों की तरह है। AI को इस मानचित्र पर एक मानसिक प्रोग्राम चलाना होता है ताकि वह ऐसे प्रश्नों का उत्तर दे सके जैसे, "क्या यह कर्मचारी हेलमेट पहने हुए है?" या "क्या यह मशीन किनारे के बहुत करीब है?" क्योंकि उत्तर एक सख्त कंप्यूटर प्रोग्राम द्वारा उत्पन्न किए जाते हैं, AI केवल कल्पना (hallucinate) नहीं कर सकता; उसे अपनी तर्क प्रक्रिया को चरण-दर-चरण सिद्ध करना होगा। इस प्रशिक्षण सेट में 110,000 से अधिक सत्यापित प्रश्न-उत्तर जोड़े शामिल हैं, जो कर्मचारियों की गिनती करने से लेकर यह पता लगाने तक सब कुछ कवर करते हैं कि क्या कोई सुरक्षा नियम तोड़ा जा रहा है।

दूसरा भाग, "रिपोर्ट-सेंट्रिक" (Report-Centric) स्तर है, जो एक जासूसी कहानी की तरह है। शोधकर्ताओं ने सरकारी एजेंसियों से 80,000 से अधिक वास्तविक दुर्घटना जांच रिपोर्टों को लिया और उनमें से फोटो, आरेख और पाठ विवरण निकाले। फिर उन्होंने एक नए प्रकार की पहेली बनाई जहाँ AI को छवियों की एक श्रृंखला देखनी होती है और रिपोर्ट पढ़नी होती है ताकि यह पता लगाया जा सके कि दुर्घटना क्यों हुई। उदाहरण के लिए, वे एक टूटे हुए पहिये की चार तस्वीरें दिखा सकते हैं और पूछ सकते हैं, "यह लॉक रिंग क्यों निकल गया और ऑपरेटर को चोट क्यों लगी?" AI को उत्तर खोजने के लिए सभी छवियों और पाठ से साक्ष्य जुटाने होंगे। इस डेटासेट में 13,114 सावधानीपूर्वक तैयार किए गए प्रश्न हैं जो AI को कई चरणों में सोचने, यानी दृश्य सुरागों को ऐतिहासिक तथ्यों से जोड़ने के लिए मजबूर करते हैं।

जब शोधकर्ताओं ने अपने नए बेंचमार्क का परीक्षण आज के कुछ सबसे स्मार्ट AI मॉडलों पर किया, तो परिणाम एक चेतावनी की तरह थे। उन्होंने पाया कि भले ही सबसे शक्तिशाली "सामान्य" AI मॉडल, जो बिल्लियों, कारों और परिदृश्यों को पहचानने में माहिर हैं, औद्योगिक सुरक्षा के बारे में तर्क करने के लिए पूछे जाने पर अक्सर लड़खड़ा जाते हैं। जबकि कुछ मॉडल आसान प्रश्नों (जैसे हेलमेट गायब होने को पहचानना) का लगभग 89% सही उत्तर दे सकते थे, वे कठिन कार्यों के लिए संघर्ष करते थे जिनमें साक्ष्यों की तुलना करने या कारण-और-प्रभाव (cause-and-effect) की कड़ियों को समझने की आवश्यकता होती है। उदाहरण के लिए, कुछ जटिल तर्क वाले प्रश्नों पर, मॉडलों की सटीकता गिरकर 25% तक पहुँच गई।

अध्ययन ने यह भी दिखाया कि आप केवल मॉडल की सामान्य बुद्धिमत्ता पर भरोसा नहीं कर सकते; आपको इसे विशेष रूप से सुरक्षा के बारे में सोचना सिखाना होगा। जब उन्होंने एक ओपन-सोर्स मॉडल को लिया और उसे अपने नए "सुरक्षा तर्क" वाले प्रश्नों का उपयोग करके अतिरिक्त प्रशिक्षण दिया, तो इसके प्रदर्शन में नाटकीय उछाल आया, जिससे इसने महंगे, शीर्ष-स्तरीय वाणिज्यिक मॉडलों के अंतर को पाट दिया। हालाँकि, इस प्रशिक्षण के बावजूद, AI को अभी भी सबसे कठिन हिस्सों में परेशानी हुई, जैसे कि यह भविष्यवाणी करना कि स्थिति कैसे दुर्घटना में बदल सकती है या खतरे को ठीक करने का सबसे अच्छा तरीका तय करना।

संक्षेप में, यह शोध पत्र सिद्ध करता है कि "देखने" में अच्छा होना स्वचालित रूप से एक AI को "सुरक्षा" में अच्छा नहीं बनाता है। जिस तरह एक इंसान को अपने सामने के दृश्य और पिछली गलतियों के सबक, दोनों से सीखने की आवश्यकता होती है, उसी तरह इन रोबोट्स को भी एक विशेष प्रकार के प्रशिक्षण की आवश्यकता होती है जो वे देखते हैं और वे जो जानते हैं, उनके बीच के संबंधों को जोड़ता है। SafeSceneReason वह प्रशिक्षण मैदान प्रदान करता है, जो हमें दिखाता है कि हालांकि हम प्रगति कर रहे हैं, लेकिन हमें रोबोटों पर अपने कार्यस्थलों को सुरक्षित रखने के लिए अकेले भरोसा करने से पहले अभी भी एक लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →