← नवीनतम पेपर
💻 computer science

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

यह शोध पत्र KnowHal को प्रस्तुत करता है, जो एक नवीन युग्मित-प्रश्न (paired-question) डिज़ाइन के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में एंटिटी, एट्रीब्यूट, रिलेशन और नॉलेज हॉलुसिनेशन के मूल्यांकन को एकीकृत करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि ज्ञान-संबंधी त्रुटियाँ और गलत-आधार (false-premise) की स्वीकृति वर्तमान मॉडलों के लिए महत्वपूर्ण चुनौतियाँ बनी हुई हैं।

मूल लेखक: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

प्रकाशित 2026-08-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को दुनिया को समझना सिखा रहे हैं। यह रोबोट, जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल (या संक्षेप में MLLM) कहा जाता है, एक शानदार छात्र की तरह है जो एक ही समय में एक तस्वीर देख सकता है और एक किताब पढ़ सकता है। यह जो देखता है उसका वर्णन करने में अद्भुत है, जैसे यह कहना, "वह लकड़ी की मेज पर एक लाल सेब है।" लेकिन कभी-कभी, यह रोबोट कुछ ज्यादा ही रचनात्मक हो जाता है। यह एक बिल्ली की तस्वीर देखकर आत्मविश्वास से कह सकता है, "यह बिल्ली अंतरिक्ष यान उड़ा रही है," भले ही बिल्लियाँ उड़ नहीं सकतीं और फोटो में कोई अंतरिक्ष यान नहीं है। इसे "हलुसिनेशन" (hallucination) या भ्रम कहा जाता है। यह ऐसा है जैसे रोबोट काम करने के बजाय दिवास्वप्न (daydreaming) देख रहा हो।

यह क्यों मायने रखता है? क्योंकि हम इन रोबोटों पर महत्वपूर्ण कामों के लिए भरोसा करना चाहते हैं, जैसे डॉक्टरों को बीमारियों का निदान करने में मदद करना या बिना ड्राइवर वाली कारों को रास्ता दिखाना। यदि कोई रोबोट अपनी ओर से चीजें बनाना शुरू कर देता है, तो परिणाम खतरनाक हो सकते हैं। वैज्ञानिक इन दिवास्वप्नों को पकड़ने के लिए परीक्षण बनाने की कोशिश कर रहे हैं। इनमें से अधिकांश परीक्षण यह देखते हैं कि क्या रोबोट तस्वीर में सरल चीजों की सही पहचान कर सकता है, जैसे "क्या वहां एक कुत्ता है?" या "क्या कुत्ता भूरा है?" लेकिन एक पेचीदा हिस्सा है: कभी-कभी रोबोट दुनिया के तथ्यों को जानता है (जैसे "कुत्तों की पूंछ होती है") लेकिन वह भ्रमित हो जाता है जब तस्वीर मेल नहीं खाती, या वह ऐसी चीजें गढ़ देता है जो तस्वीर में बिल्कुल नहीं हैं। अब तक, हमारे पास एक एकल, निष्पक्ष परीक्षण नहीं था जो एक साथ यह जांच सके कि रोबोट क्या देखता है और वह दुनिया के बारे में क्या जानता है।

यहाँ आता है KnowHal, एक नया और चतुर परीक्षण जिसे इन दिवास्वप्नों को एक बिल्कुल नए तरीके से पकड़ने के लिए डिज़ाइन किया गया है। Think of KnowHal को "अंतर पहचानो" (spot the difference) खेल की तरह समझें, लेकिन रोबोट के दिमाग के लिए। शोधकर्ताओं ने 1,800 चित्र-और-प्रश्न जोड़ों का एक विशाल संग्रह बनाया, जिसमें खेल से लेकर संगीत तक जीवन के 10 अलग-अलग क्षेत्र शामिल हैं। प्रत्येक तस्वीर के लिए, उन्होंने दो प्रकार के प्रश्न बनाए: "पॉजिटिव" (सकारात्मक) प्रश्न जो वास्तव में फोटो में मौजूद चीजों या वस्तु के बारे में वास्तविक तथ्यों के बारे में पूछते हैं, और "नेगेटिव" (नकारात्मक) प्रश्न जो चालाकी भरे जाल होते हैं। ये जाल बहुत विश्वसनीय लगते हैं लेकिन वास्तव में झूठ होते हैं। उदाहरण के लिए, यदि एक तस्वीर में एक असली कुत्ता दिखाया गया है, तो एक पॉजिटिव प्रश्न पूछता है, "कुत्ते का रंग क्या है?" एक नेगेटिव जाल हो सकता है, "कुत्ते की अदृश्य नीली टोपी का रंग क्या है?"

शोधकर्ताओं ने इस नए खेल पर 14 अलग-अलग रोबोट दिमागों का परीक्षण किया। उन्होंने कुछ आश्चर्यजनक बातें पाईं। पहला, रोबोट "पॉजिटिव" प्रश्नों के उत्तर देने में आम तौर पर ठीक थे, लेकिन जब उनके सामने "नेगेटिव" जाल आए तो वे बुरी तरह लड़खड़ा गए। यह एक ऐसे छात्र की तरह है जो अपने गणित के तथ्यों को पूरी तरह से जानता है लेकिन एक ऐसे प्रश्न से धोखा खा जाता है जो पूछता है, "यदि 2 प्लस 2 बराबर 5 है, तो 2 प्लस 2 क्या है?" रोबोट अक्सर झूठ को सुधारने के बजाय "5" कह देते थे। यह दर्शाता है कि सबसे स्मार्ट रोबोट भी यह बताने में बहुत अच्छे नहीं हैं कि, "रुको, यह सच नहीं है," जब उन्हें गुमराह किया जा रहा हो।

सबसे बड़ा आश्चर्य यह था कि लगभग हर रोबोट के लिए सबसे कठिन हिस्सा "नॉलेज" (ज्ञान) आयाम था। यह वह जगह है जहाँ रोबोट को उन तथ्यों का उपयोग करना होता है जो उसने किताबों या इंटरनेट से सीखे हैं, न कि केवल वह जो वह तस्वीर में देख रहा है। यहाँ तक कि सबसे अच्छे रोबोट भी साधारण विजुअल (दृश्य) प्रश्नों के गलत होने की तुलना में इसे अधिक बार गलत करते थे। यह सुझाव देता है कि जबकि ये रोबोट देखने में बेहतर हो रहे हैं, वे अभी भी यह अलग करने के लिए संघर्ष कर रहे हैं कि वे क्या देखते हैं और वे क्या सोचते हैं कि वे जानते हैं

अध्ययन ने यह भी देखा कि रोबोट के दिमाग के आकार का उसके प्रदर्शन पर क्या प्रभाव पड़ता है। उन्होंने पाया कि बड़े दिमाग आमतौर पर बेहतर प्रदर्शन करते हैं, लेकिन सबसे बड़े दिमाग भी ट्रिकी "नॉलेज" प्रश्नों और "नेगेटिव" जालों के साथ संघर्ष करते रहे। यह बताता है कि केवल रोबोट को बड़ा बनाना कोई जादुई समाधान नहीं है; हमें उन्हें अधिक सावधान और संशयवादी बनना सिखाने की आवश्यकता है।

संक्षेप में, यह पेपर KnowHal को पेश करता है, जो एक नया बेंचमार्क है जो सच्चाई और कल्पना के बीच अंतर करने के लिए वास्तविक प्रश्नों को चालाकी भरे, झूठे प्रश्नों के साथ जोड़ता है। परिणाम बताते हैं कि हालांकि हमारे एआई (AI) दोस्त स्मार्ट हो रहे हैं, फिर भी वे झूठ पकड़ने या यह स्वीकार करने में कि वे उत्तर नहीं जानते, पूरी तरह से भरोसेमंद होने से बहुत दूर हैं। लेखकों का मानना है कि यह नया परीक्षण भविष्य के रोबोटों को अधिक विश्वसनीय बनने और कहानियाँ बनाने से बचने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →