← नवीनतम पेपर
💬 NLP

HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

यह शोधपत्र HomeSafeBench प्रस्तुत करता है, जो एगोसेंट्रिक दृश्यों के माध्यम से मुक्त-अन्वेषण गृह सुरक्षा निरीक्षण करने वाले एम्बॉडीड एजेंटों के लिए पहला बेंचमार्क है, और CueBack का प्रस्ताव करता है, जो एक डेटा-निर्माण पद्धति है जो एआई और मानव निरीक्षकों के बीच के अंतर को पाटने के लिए खतरा पहचान की टेम्पोरल संरचना का लाभ उठाकर विजन-लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करती है।

मूल लेखक: Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

प्रकाशित 2026-08-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो अपनी आँखों से दुनिया को देख सकता है और जो देखता है उसके बारे में आपसे बात कर सकता है। यह एम्बॉडीड एआई (Embodied AI) की दुनिया है, जहाँ कंप्यूटर सिर्फ एक स्क्रीन तक सीमित नहीं हैं; वे "देहधारी" (bodied) एजेंट हैं जो 3D दुनिया में घूम सकते हैं, चीजों को देख सकते हैं और निर्णय ले सकते हैं। इन्हें एक डिजिटल खोजकर्ता की तरह समझें जिसके पास एक बैकपैक है, जो पहेलियों को सुलझाने या खोई हुई चीजों को खोजने के लिए तैयार है। लेकिन इसमें एक पेच है: ये रोबट केवल वही देखते हैं जो सीधे उनके "चेहरे" (जिसे एगोसेंट्रिक व्यू कहा जाता है) के सामने होता है। वे सोफे के पीछे या कालीन के नीचे तब तक नहीं देख सकते जब तक वे वहां चलकर न जाएं और देखें। यह उन्हें निर्देश मानने में तो माहिर बनाता है, लेकिन सक्रिय जासूस बनने में बहुत खराब।

अब, कल्पना कीजिए कि आप इस रोबोट को अपने घर का सुरक्षा निरीक्षक (safety inspector) बनाना चाहते हैं। इसका काम आपके घर में घूमना, खतरनाक चीजों जैसे काउंटर पर छोड़े गए चाकू या ऐसे कालीन को पहचानना जिससे कोई फिसल सकता है, और किसी के चोटिल होने से पहले आपको इनके बारे में बताना है। यह एक बहुत बड़ी बात है क्योंकि अधिकांश घरेलू दुर्घटनाएं इसलिए होती हैं क्योंकि हम स्पष्ट खतरों को देखना भूल जाते हैं। बड़ा सवाल यह है कि क्या ये एआई खोजकर्ता वास्तव में यह काम कर सकते हैं, या वे जोखिमों के मामले में बहुत अनाड़ी और अंधे हैं?


शोध पत्र: होमसेफबेंच (HomeSafeBench) और "क्यूबैक" (CueBack) ट्रिक

इस शोध पत्र के पीछे के शोधकर्ताओं ने, होमसेफबेंच (HomeSafeBench), ठीक इसी को परखने के लिए एक विशाल, डिजिटल बाधा दौड़ (obstacle course) बनाने का फैसला किया। उन्होंने एक बेंचमार्क (एक मानक परीक्षण) बनाया जहाँ एक एआई एजेंट को एक पूरी तरह से इंटरैक्टिव 3D घर में स्वतंत्र रूप से घूमना, इधर-उधर देखना और कमरों में जाना होता है, ठीक वैसे ही जैसे एक इंसान करता है। लक्ष्य क्या था? पांच विशिष्ट प्रकार के खतरों को खोजना: आग के खतरे (जैसे चूल्हे के पास कागज), बिजली के झटके (जैसे सिंक में टोस्टर), गिरने वाली वस्तुएं (जैसे ऊंचे शेल्फ पर भारी बॉक्स), फिसलने/ठोकर लगने के खतरे (जैसे फर्श पर केले का छिलका), और बच्चों की सुरक्षा के जोखिम (जैसे बच्चे की पहुंच के भीतर तेज चाकू)।

उन्होंने 1,000 अलग-अलग परिदृश्य बनाए, जिनमें से प्रत्येक में एक से पांच छिपे हुए खतरे थे, और दुनिया के सबसे अच्छे एआई मॉडल से उन्हें खोजने के लिए कहा। परिणाम एक वास्तविकता का अहसास कराने वाले थे। सबसे अच्छा मॉडल भी काफी संघर्ष कर रहा था। सबसे अच्छे मॉडल ने केवल लगभग 34.7% खतरे खोज पाए (जिसे F1 स्कोर द्वारा मापा गया), जबकि एक मानव निरीक्षक 98.0% खतरों को ढूंढ लेता।

अजीब बात यह है कि एआई चीजें केवल "रैंडमली" मिस नहीं कर रहा था। वह जरूरत से ज्यादा सतर्क (overly cautious) हो रहा था। इसकी "प्रिसिजन" (precision) उच्च थी (जब इसने कुछ खतरनाक बताया, तो वह आमतौर पर सही था) लेकिन इसकी "रिकॉल" (recall) बहुत खराब थी (यह बाकी सब कुछ मिस कर गया)। यह एक ऐसे सुरक्षा गार्ड की तरह था जो केवल तभी चिल्लाता है जब इमारत में सचमुच आग लग जाती है, लेकिन मेज पर जलती हुई मोमबत्ती को अनदेखा कर देता है। एआई केवल सबसे स्पष्ट और शोर वाले खतरों को ही पकड़ पा रहा था और शांत, चालाकी भरे खतरों को अनदेखा कर रहा था, खासकर वे चीजें जो गिर सकती थीं या बच्चे को चोट पहुँचा सकती थीं।

समाधान: "क्यूबैक" (CueBack)

शोधकर्ताओं ने महसूस किया कि इन रोबोटों को सिम्युलेटर में बार-बार घुमाकर प्रशिक्षित करना बहुत धीमा और महंगा है। इसके बजाय, उन्होंने क्यूबैक (CueBack) नामक एक चतुर, कम लागत वाला तरीका निकाला।

इसे ऐसे समझें: कल्पना कीजिए कि आप एक वीडियो देख रहे हैं जिसमें एक जासूस अपराध को सुलझा रहा है। वीडियो में, जासूस एक कमरे में जाता है, एक कीचड़ भरा पदचिह्न (सुराग या clue) देखता है, और फिर खिड़की के पास जाता है ताकि पुष्टि कर सके कि संदिग्ध वहीं था (पुष्टि या confirmation)। यदि आप जासूस को केवल अंतिम उत्तर दिखा देते ("संदेश खिड़की पर था!"), तो वे पहले सुराग कैसे ढूंढना सीख पाते, यह वे नहीं जान पाते।

क्यूबैक विधि एक "परफेक्ट" रास्ते को देखती है जहाँ एक इंसान (या एक बहुत स्मार्ट शिक्षक) पहले से जानता है कि खतरा कहाँ है। फिर यह वीडियो को उस पहले क्षण तक रिवाइंड करती है जब खतरा दूर से ही दिखाई देने लगा था। यह एआई को बताती है: "हे, इससे पहले कि तुम निश्चित रूप से जानते, तुम बस खोजबीन कर रहे थे। लेकिन ठीक यहाँ, तुमने एक संकेत देखा। इस बिंदु के बाद से, तुम्हें पुष्टि करने के लिए करीब से देखना चाहिए।"

एआई को "पुष्टि" (confirmation) से पहले "सुरागों" (clues) को पहचानने के लिए सिखाकर, उन्होंने बिना महंगे सिमुलेशन चलाए डेटा का एक नया सेट तैयार किया। उन्होंने एक छोटे, ओपन-सोर्स एआई मॉडल (Qwen3-VL-4B) को लिया और इस नई विधि का उपयोग करके उसे प्रशिक्षित किया।

परिणाम

परिणाम आश्चर्यजनक रूप से अच्छे थे। इस "क्यूबैक" प्रशिक्षण के बाद, छोटे एआई मॉडल का प्रदर्शन 18.7% से बढ़कर 45.3% हो गया। यह एक बड़ी बात है क्योंकि इसका मतलब है कि यह छोटा, मुफ्त मॉडल वास्तव में सबसे महंगे, बंद-स्रोत (closed-source) वाणिज्यिक मॉडलों (जो केवल 34.7% तक पहुँच पाए) की तुलना में घर के खतरों को खोजने में बेहतर हो गया।

अध्ययन यह सुझाव देता है कि मुख्य समस्या यह नहीं थी कि एआई चल या देख नहीं सकता था; बल्कि यह था कि उसे सूक्ष्म जोखिमों को कैसे देखना है, यह नहीं पता था। उन्हें शुरुआती संकेतों को पहचानने और फिर उसकी जांच करने के लिए सिखाकर, शोधकर्ताओं ने दिखाया कि एक अच्छा होम सेफ्टी इंस्पेक्टर बनाने के लिए आपको सुपर-कंप्यूटर की आवश्यकता नहीं है; आपको बस उसे ध्यान देने का सही तरीका सिखाने की आवश्यकता है। टीम ने अपना परीक्षण, प्रशिक्षण डेटा और कोड जारी कर दिया है ताकि भविष्य में कोई भी बेहतर सुरक्षा रोबोट बना सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →