NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning
यह शोधपत्र NoRA को प्रस्तुत करता है, जो एक विज़ुअल फर्स्ट-पर्सन बेंचमार्क है जिसमें 1,420 एनोटेटेड वीडियो क्लिप्स शामिल हैं जो स्पष्ट तथ्य-कारण-क्रिया (fact-reason-action) सपोर्ट ग्राफों के माध्यम से तर्कसंगत क्रियाओं को उत्पन्न करने और उन्हें न्यायसंगत ठहराने की मल्टीमॉडल प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल अक्सर संभावित व्यक्तिगत क्रियाओं की पहचान करने के बावजूद, पूर्ण एक्शन स्पेस का निर्माण करने और क्रियाओं को दृश्य साक्ष्यों के साथ सही ढंग से जोड़ने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र NORA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning का सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी समस्या: जानना बनाम करना
कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त पार्क में चलना सिखा रहे हैं।
- पुराना तरीका: आप रोबोट को तीन विकल्पों की एक सूची दिखाते हैं: "A) बाईं ओर चलें," "B) दाईं ओर चलें," या "C) बैठ जाएँ।" रोबोट "B" चुनता है। आप जाँचते हैं कि क्या "B" "सही" उत्तर है।
- शोध पत्र की आलोचना: यह एक बहुविकल्पीय परीक्षा (multiple-choice test) की तरह है। असल ज़िंदगी में, कोई आपको तीन विकल्पों का मेनू नहीं देता। आपको स्थिति को देखना होता है, यह समझना होता है कि क्या हो रहा है, अपने संभावित कदमों की अपनी सूची बनानी होती है, और फिर सबसे अच्छा विकल्प चुनना होता है।
लेखकों का तर्क है कि वर्तमान AI मॉडल एक मेनू से सही उत्तर चुनने में अच्छे हैं (जैसे कि एक छात्र परीक्षा में अनुमान लगा रहा हो), लेकिन वे उस मेनू को खुद बनाने और यह समझाने में कि उन्होंने एक विशिष्ट व्यंजन क्यों चुना में खराब हैं।
समाधान: NORA (एक "रीज़निंग जिम")
लेखकों ने एक नया परीक्षण बनाया जिसे NORA (Normative Reasoning in Action) कहा जाता है। AI से यह पूछने के बजाय कि "मुझे क्या करना चाहिए?" और यह जाँचने के बजाय कि क्या उत्तर पहले से लिखे गए 'की' (key) से मेल खाता है, NORA AI को तीन चीजें एक साथ करने के लिए कहता है:
- दृश्य को देखें: प्रथम-व्यक्ति परिप्रेक्ष्य (जैसे किसी के सिर पर लगे GoPro) से एक वीडियो क्लिप देखें।
- एक मेनू बनाएँ: आगे करने योग्य तर्कसंगत चीज़ों की एक सूची तैयार करें।
- चुनाव का औचित्य सिद्ध करें: सूची में प्रत्येक क्रिया के लिए, समझाएँ कि वीडियो में जो वास्तव में दिख रहा है, उसके आधार पर वह क्यों समझदारी भरा है।
उपमा: NORA को एक बहुविकल्पीय प्रश्नोत्तरी के रूप में नहीं, बल्कि एक कुकिंग कॉम्पिटिशन (खाना पकाने की प्रतियोगिता) के रूप में सोचें।
- पुराने टेस्ट: जज आपको तीन सामग्रियाँ देता है और पूछता है, "इनमें से कौन सी सबसे अच्छी है?"
- NORA: जज आपको एक बिखरा हुआ काउंटर और एक भूखा मेहमान दिखाता है। आपको ये करना होगा:
- काउंटर पर मौजूद सामग्रियों की पहचान करें (तथ्य/Facts)।
- उन विभिन्न व्यंजनों की सूची बनाएँ जिन्हें आप बना सकते हैं (संभावित क्रियाएं/Candidate Actions)।
- समझाएँ कि "पास्ता" एक अच्छा विकल्प क्यों है क्योंकि "मेहमान भूखा है" और "हमारे पास टमाटर हैं" (कारण/Reasons)।
- महत्वपूर्ण: यदि आप कहते हैं "मैं स्टेक बनाऊँगा," लेकिन काउंटर पर मांस मौजूद नहीं है, तो आप फेल हो जाते हैं, भले ही "स्टेक" एक स्वादिष्ट विचार हो।
वे सफलता को कैसे मापते हैं: "सपोर्ट ग्राफ" (Support Graph)
शोध पत्र में AI को ग्रेड देने का एक विशिष्ट तरीका पेश किया गया है जिसे Grounded Reasonableness Score कहा जाता है। वे केवल अंतिम उत्तर नहीं देखते; वे "सपोर्ट ग्राफ" को देखते हैं।
एक पेड़ की कल्पना करें:
- जड़ें (तथ्य/Roots): वास्तव में क्या दिखाई दे रहा है? (जैसे, "एक बच्चा दौड़ रहा है," "ज़मीन गीली है")।
- तना (कारण/Trunk): यह क्यों मायने रखता है? (जैसे, "बच्चा फिसल सकता है," "गीली घास पर दौड़ना खतरनाक है")।
- फल (क्रियाएं/Fruit): हमें क्या करना चाहिए? (जैसे, "बच्चे को रोकें," "सूखी घास की ओर बढ़ें")।
स्कोर:
- एक्शन एलाइनमेंट (Action Alignment): क्या AI ने फलों की एक अच्छी सूची बनाई?
- फैक्टुअल ग्राउंडिंग (Factual Grounding): क्या जड़ें असली हैं? (क्या AI ने एक ऐसे बच्चे की कल्पना कर ली जो वहाँ है ही नहीं?)
- सपोर्ट बाइंडिंग (Support Binding): क्या फल सही जड़ों से जुड़े हैं? (क्या AI ने "बच्चे को रोकने" के लिए "गीली घास" का कारण दिया, या उस "कुत्ते" का जो वहाँ है ही नहीं?)
उन्होंने क्या पाया: "तर्कसंगत लेकिन गलत" का जाल
शोधकर्ताओं ने 12 अलग-अलग AI मॉडल्स (GPT-5 जैसे बड़े नामों सहित) का इस नए जिम का उपयोग करके परीक्षण किया। यहाँ उनकी खोजें दी गई हैं:
- वे कमरे का वर्णन करने में अच्छे हैं: अधिकांश AI दृश्य तथ्यों (जैसे, "वहाँ एक लॉन मूवर है") को सही ढंग से पहचानने में सक्षम हैं।
- वे फल चुनने में ठीक-ठाक हैं: वे अक्सर एक तर्कसंगत क्रिया (जैसे, "घास काटना जारी रखें") चुन लेते हैं।
- वे "मेनू" और "क्यों" के मामले में विफल रहते हैं:
- मेनू गायब होना: वे विकल्पों की एक पूर्ण सूची बनाने में संघर्ष करते हैं। वे अक्सर उन वैकल्पिक कार्यों को छोड़ देते जिन्हें एक इंसान विचार में लेगा।
- ढीले संबंध: वे अक्सर एक अच्छा कार्य चुनते हैं लेकिन उसे गलत कारण से जोड़ देते हैं। उदाहरण के लिए, वे कह सकते हैं "घास काटना जारी रखें" क्योंकि "दिन अच्छा है," जबकि वास्तविक कारण (जो वीडियो में दिख रहा है) यह है कि "घास लंबी है और काटने की ज़रूरत है।"
रूपक: कल्पना कीजिए कि एक छात्र हाथ उठाकर कहता है, "उत्तर 42 है!"
- पुराना टेस्ट: यदि 42 सही उत्तर है, तो उसे 'A' ग्रेड मिलता है।
- NORA टेस्ट: शिक्षक पूछता है, "अपना काम दिखाओ (Show your work)।" छात्र कहता है, "क्योंकि 6 गुणा 7 42 होता है।"
- यदि समस्या वास्तव में "1764 का वर्गमूल क्या है?" थी, तो छात्र उत्तर के लिए 'A' तो पा लेगा लेकिन वह टेस्ट में फेल हो जाएगा क्योंकि उसने उस विशिष्ट समस्या के लिए सही तर्क नहीं दिखाया।
- NORA ने पाया कि वर्तमान AI "42!" चिल्लाने में तो माहिर हैं, लेकिन यह दिखाने में बहुत खराब हैं कि इस विशिष्ट वीडियो के लिए 42 ही सही कदम क्यों है।
तीन "प्रॉम्प्ट" शैलियाँ
AI कैसे सोचता है, इसका परीक्षण करने के लिए, शोधकर्ताओं ने एक ही सवाल को तीन अलग-अलग तरीकों से पूछा (जैसे कुकिंग कॉम्पिटिशन के नियम बदलना):
- डायरेक्ट (Direct): "बस मुझे बताओ कि क्या करना है।" (कोई स्पष्टीकरण नहीं)।
- डेलिब्रेट (Deliberate): "ज़ोर से सोचो। कुछ विकल्प सूचीबद्ध करो और उन्हें समझाओ, फिर एक चुनो।"
- स्ट्रक्चर्ड (Structured): "इस विशिष्ट फॉर्म को भरें: तथ्य सूचीबद्ध करें, कारण सूचीबद्ध करें, क्रियाएं सूचीबद्ध करें, फिर एक चुनें।"
परिणाम: "स्ट्रक्चर्ड" दृष्टिकोण (फॉर्म भरना) ने सबसे अच्छे AI मॉडल्स को बेहतर प्रदर्शन करने में मदद की। इसने उन्हें धीमा होने और अपने तथ्यों को अपनी क्रियाओं से जोड़ने के लिए मजबूर किया। हालाँकि, कुछ अन्य मॉडल्स के लिए, फॉर्म भरने के लिए मजबूर करना वास्तव में उन्हें बदतर बना देता है, जैसे कि कठोर नियमों ने उन्हें भ्रमित कर दिया हो।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI "देखने" और "चुनने" में बेहतर हो रहा है, लेकिन यह अभी भी न्यायोचित तर्क (justified reasoning) के लिए संघर्ष कर रहा है। यह अक्सर सही कदम का अनुमान लगा सकता है, लेकिन यह विश्वसनीय रूप से यह नहीं समझा सकता कि वह कदम केवल वीडियो में जो दिख रहा है उसके आधार पर क्यों सही है।
NORA इस अंतर को मापने का एक उपकरण है। यह सवाल को "क्या AI सही उत्तर चुन सकता है?" से बदलकर "क्या AI अपनी क्रिया के लिए एक तार्किक, दृश्य और बचाव योग्य तर्क बना सकता है?" पर ले जाता है। वर्तमान में, उत्तर है: "वे वहां पहुँच रहे हैं, लेकिन वे अभी भी पूरी तस्वीर देखने में चूक रहे हैं।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।