← नवीनतम पेपर
💬 NLP

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

यह शोध पत्र StreamGaze प्रस्तुत करता है, जो कि पहला बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) स्ट्रीमिंग वीडियो में टेम्पोरल रीजनिंग और प्रोएक्टिव इंटेंशन प्रेडिक्शन के लिए मानव दृष्टि संकेतों (human gaze signals) का उपयोग कैसे करते हैं, जो वर्तमान मॉडलों और मानवीय क्षमताओं के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

मूल लेखक: Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने स्मार्ट AR चश्मा (smart AR glasses) पहना हुआ है जो रात का खाना बनाने में आपकी मदद करने की कोशिश कर रहा है। आप चाहते हैं कि ये चश्मे आपके लिए एक बेहतरीन 'सू-शेफ' (sous-chef) बनें: उन्हें पता होना चाहिए कि आप क्या देख रहे हैं, उन्हें याद होना चाहिए कि आपने पहले क्या देखा था, और वे यह भी अनुमान लगा पाने चाहिए कि आप आगे क्या करने वाले हैं।

"STREAMGAZE" नामक शोध पत्र एक नया तरीका पेश करता है जिससे यह परीक्षण किया जा सके कि क्या AI कंप्यूटर इतने स्मार्ट हैं कि वे आपके ऐसे 'सू-शेफ' बन सकें। इसका विवरण सरल शब्दों में यहाँ दिया गया है:

1. समस्या: AI आपकी आँखों के प्रति "अंधा" है

वर्तमान AI वीडियो मॉडल एक सुरक्षा कैमरे (security camera) की तरह हैं जो सब कुछ रिकॉर्ड तो करते हैं लेकिन यह नहीं जानते कि आपकी दिलचस्पी किसमें है

  • परिदृश्य: आप खाना बना रहे हैं। आप एक बर्तन को देखते हैं, फिर एक चाकू को, और फिर एक टमाटर को।
  • AI की गलती: "आई-ट्रैकिंग" (eye-tracking) के बिना, AI बस रसोई के सामानों का एक धुंधला सा दृश्य देखता है। उसे यह नहीं पता चलता कि आपका ध्यान बर्तन पर है और आप रेफ्रिजरेटर को अनदेखा कर रहे हैं।
  • अंतराल (Gap): पिछले परीक्षणों ने यह जांचा कि क्या AI वीडियो को समझ सकता है, लेकिन उन्होंने यह नहीं जांचा कि क्या AI आपके ध्यान (attention) को समझ सकता है।

2. समाधान: STREAMGAZE (AI के लिए "आई-टेस्ट")

शोधकर्ताओं ने STREAMGAZE नामक एक विशाल नया परीक्षण बनाया है। इसे एक AI के लिए ड्राइवर के लाइसेंस की परीक्षा की तरह समझें, लेकिन कार चलाने की जाँच करने के बजाय, वे यह जाँचते हैं कि क्या वह आपकी आँखों का पीछा करके "ड्राइव" कर सकता है।

उन्होंने वास्तविक वीडियो के आधार पर 8,500 से अधिक प्रश्न तैयार किए हैं जिनमें लोग खाना बना रहे हैं, लैब में काम कर रहे हैं, या चीजें असेंबल कर रहे हैं। इस परीक्षण में वीडियो गेम की तरह कठिनाई के तीन स्तर हैं:

  • स्तर 1: मेमोरी गेम (बीते हुए कार्य)

    • प्रश्न: "आपने 10 सेकंड पहले चाकू को देखा था। उसके बगल में काउंटर पर क्या रखा था जिसे आपने नहीं देखा था?"
    • चुनौती: AI को उन पृष्ठभूमि विवरणों (background details) को याद रखना होगा जिन्हें आपने देखा था, भले ही आप सीधे उन्हें नहीं देख रहे थे।
  • स्तर 2: "अभी क्या हो रहा है?" गेम (वर्तमान कार्य)

    • प्रश्न: "उपयोगकर्ता इस समय क्या देख रहा है? क्या वह लाल मिर्च देख रहा है या हरी वाली?"
    • चुनौती: AI को एक चलते हुए, हिलते हुए वीडियो में बिल्कुल सटीक रूप से पहचानना होगा कि आपकी आँखें कहाँ केंद्रित हैं।
  • स्तर 3: क्रिस्टल बॉल (पूर्वानुमानित कार्य)

    • प्रश्न: "उपयोगकर्ता ने अभी पानी की बोतल और चूल्हा देखा है। क्या मुझे उन्हें सचेत करना चाहिए कि पानी उबल रहा है?" या "वे आगे क्या करेंगे?"
    • चुनौती: AI को आपके कुछ भी करने से पहले ही आपके इरादे (intent) का अनुमान लगाना होता है। यह एक GPS की तरह है जो कहता है, "आप बाहर निकलने की ओर देख रहे हैं, इसलिए शायद आप जाना चाहते हैं," इससे पहले कि आप कुछ कहें।

3. उन्होंने इसे कैसे बनाया: "गेज़-मैपर" (Gaze-Mapper)

इस परीक्षण को बनाने के लिए, शोधकर्ताओं को कंप्यूटर को "आँखों की गतिविधियों" को "वीडियो समझ" में अनुवाद करना सिखाना था।

  • प्रक्रिया: उन्होंने आई-ट्रैकर्स पहने हुए लोगों के वीडियो लिए। उन्होंने उन क्षणों को खोजा जहाँ व्यक्ति की आँखें हिलना बंद कर देती हैं (जिसे fixations कहा जाता है)—जैसे जब आप टमाटर को काटने के लिए उस पर टकटकी लगाते हैं।
  • मैप: उन्होंने उस स्थान के चारों ओर एक घेरा बनाया जहाँ आँखें देख रही थीं (FOV या Field of View)।
  • अनुवाद: उन्होंने उस घेरे के अंदर की हर चीज़ (टमाटर) और घेरे के बाहर की हर चीज़ (पृष्ठभूमि में फ्रिज) को लेबल करने के लिए एक बहुत ही स्मार्ट AI का उपयोग किया।
  • परिणाम: एक "स्कैनपाथ" (Scanpath)—यानी आपकी आँखों के जाने का एक क्रम, चरण-दर-चरण, जैसे ध्यान का एक खजाना मानचित्र (treasure map)।

4. चौंकाने वाले परिणाम: AI अभी भी एक नौसिखिया है

जब उन्होंने दुनिया के सबसे बेहतरीन AI मॉडलों (जैसे GPT-4o और अन्य) का STREAMGAZ पर परीक्षण किया, तो परिणाम विनम्र करने वाले थे।

  • मानव स्कोर: मनुष्य लगभग 83% सही थे। हम स्वाभाविक रूप से यह जानने में अच्छे होते हैं कि हम क्या देख रहे हैं और हम आगे क्या कर सकते हैं।
  • AI स्कोर: सर्वश्रेष्ठ AI मॉडल केवल लगभग 45-50% सही थे।
  • फैसला: AI "माहौल को पढ़ने" में बहुत बुरा है। यह समय के प्रवाह (flow of time) से भ्रमित हो जाता है। यह अक्सर भूल जाता है कि उसने 5 सेकंड पहले क्या देखा था या यह अनुमान लगाने में विफल रहता है कि यदि आप चाकू को देखते हैं, तो आप शायद कुछ काटने वाले हैं।

5. यह क्यों महत्वपूर्ण है

यह केवल खाना बनाने के वीडियो के बारे में नहीं है। यह ऑगमेंटेड रियलिटी (AR) चश्मे और रोबोट के भविष्य के बारे में है।

  • यदि आप AR चश्मा पहनते हैं, तो आप चाहते हैं कि वे उस टूल को हाइलाइट करें जिसे आप देख रहे हैं और उस कचरे/भीड़ को छिपा दें जिसे आप नहीं देख रहे हैं।
  • यदि आपके पास एक रोबोट सहायक है, तो आप चाहते हैं कि वह आपको नमक देने से पहले ही दे दे, क्योंकि उसने आपको सूप की ओर देखते हुए देखा था।

STREAMGAZE यह साबित करता है कि हालांकि AI वीडियो को "देखने" में बेहतर हो रहा है, लेकिन यह मानव ध्यान को "समझने" में अभी भी बहुत खराब है। यह एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह है जो लाइब्रेरी की हर किताब पढ़ सकता है लेकिन यह नहीं जानता कि आप कौन सी किताब ढूँढने की कोशिश कर रहे हैं।

संक्षेप में: यह शोध पत्र कहता है, "हमने एक नया, कठिन परीक्षण बनाया है जिसमें आई-ट्रैकिंग शामिल है। AI इस परीक्षण में विफल रहा, जिससे हमें पता चला कि वास्तव में मानवीय जैसे सहायक बनाने के लिए हमें कहाँ सुधार करने की आवश्यकता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →