← नवीनतम पेपर
💻 computer science

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

यह शोधपत्र GuideMe प्रस्तुत करता है, जो स्ट्रीमिंग वीडियो के लिए पहला मल्टी-डोमेन बेंचमार्क है जिसे क्लोज्ड-लूप इंटरैक्टिव टास्क गाइडेंस पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन और प्रशिक्षण देने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल निर्देश प्रदान करने में तो उत्कृष्ट हैं, लेकिन वास्तविक समय में त्रुटि का पता लगाने और सुधारात्मक फीडबैक देने में काफी संघर्ष करते हैं।

मूल लेखक: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

प्रकाशित 2026-07-07
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फर्नीचर का एक जटिल टुकड़ा जोड़ने या कोई जटिल भोजन पकाने का तरीका सीख रहे हैं। आपका एक बहुत ही बुद्धिमान, जानकार मित्र (एक AI) है जिसने हर मैनुअल पढ़ा है और हर कुकिंग शो देखा है।

समस्या:
अभी, यदि आप इस मित्र से मदद मांगते हैं, तो वे आपको पूरा काम खत्म करने के बाद निर्देशों की एक सूची देने में बहुत अच्छे हैं। वे आपको बता सकते हैं, "खैर, आपने चरण 1 किया, फिर चरण 2 किया, और फिर आपने एक गलती की।" लेकिन वे एक रियल-टाइम कोच होने में बहुत खराब हैं। वे आपको काम करते समय नहीं देख सकते, यह नहीं पहचान सकते कि आप गलत पेचकस इस्तेमाल करने वाले हैं, और तुरंत कह सकते हैं, "रुको! रुक जाओ! वह गलत औज़ार है!"

वर्तमान में अधिकांश AI मॉडल एक फिल्म समीक्षक की तरह हैं जो फिल्म खत्म होने के बाद समीक्षा लिखता है। वे एक निर्देशक होने में अच्छे नहीं हैं जो दृश्य फिल्माते समय "कट!" चिल्ला सके।

समाधान: "GuideMe"
इस शोध पत्र के लेखकों ने एक नया परीक्षण मैदान बनाया है जिसे GuideMe कहा जाता है। इसे AI कोचों के लिए एक विशाल जिम की तरह समझें।

  • वर्कआउट: उन्होंने 2,400 से अधिक वीडियो (जैसे खाना बनाना, चीजें ठीक करना, दैनिक कार्य और फिटनेस) की एक विशाल लाइब्रेरी बनाई, जो कुल 223 घंटे से अधिक की है।
  • ड्रिल: उन्होंने केवल वीडियो को लेबल नहीं किया; उन्होंने उन्हें संवादात्मक बातचीत में बदल दिया। इस जिम में, AI को यह करना होगा:
    1. अगला निर्देश देना।
    2. उपयोगकर्ता को उसे करते हुए देखना।
    3. महत्वपूर्ण रूप से: यदि उपयोगकर्ता कोई गलती करता है, तो AI को उसे तुरंत पहचानना चाहिए और कहना चाहिए, "नहीं, यह गलत है, इसके बजाय इसे आजमाएं।"
    4. यदि उपयोगकर्ता ठीक कर रहा है, तो AI को यह जानना चाहिए कि चुप रहना है और हस्तक्षेप नहीं करना है।

बड़ी खोज
शोधकर्ताओं ने कई अलग-अलग AI मॉडल (दोनों प्रसिद्ध व्यावसायिक और ओपन-सोर्स) को इस जिम में डाला ताकि उनके प्रदर्शन को देखा जा सके। परिणाम आश्चर्यजनक और थोड़े निराशाजनक थे:

  • "बातूनी" (The Talkers): कुछ AI बहुत उत्सुक थे। वे निर्देश देते रहे यहाँ तक कि जब उपयोगकर्ता ठीक कर रहा था, या उन्होंने गलत समय पर सलाह दी। यह एक ऐसे कोच की तरह था जो तब भी बोलना बंद नहीं करता जब आप सिर्फ स्ट्रेचिंग कर रहे हों।
  • "मौन रहने वाले" (The Silencers): अन्य AI बहुत शर्मीले थे। उन्होंने उपयोगकर्ता को बड़ी गलतियाँ करते हुए देखा लेकिन कुछ नहीं कहा, और मदद के लिए उपयोगकर्ता के पूछने का इंतज़ार करते रहे। वे एक ऐसे कोच की तरह थे जो बस बेंच पर बैठते हैं और आपको असफल होते देखते रहते हैं।
  • अंतराल (The Gap): AI यह कहने में काफी अच्छे थे कि, "यहाँ आपको क्या करना चाहिए।" लेकिन वे कठिन हिस्से में बहुत खराब थे: यह देखना कि आप क्या कर रहे हैं, यह समझना कि यह गलत है, और चलते-चलते इसे ठीक करना।

उन्होंने सफलता को कैसे मापा
AI को ग्रेड देने के लिए, उन्होंने तीन-भागों वाले स्कोरकार्ड का उपयोग किया:

  1. समय (Timing): क्या AI ने बिल्कुल सही क्षण पर बात की, या वह बहुत जल्दी/देर से बोला?
  2. व्यवहार (Behavior): क्या AI जानता था कि कब चुप रहना है और कब बोलना है? (यह सबसे कठिन हिस्सा था)।
  3. गुणवत्ता (Quality): जब AI ने वास्तव में बात की, तो क्या सलाह वास्तव में मददगार और सही थी?

मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि जबकि AI वीडियो का वर्णन करने और चरण-दर-चरण सूचियाँ देने में बहुत अच्छा हो रहा है, फिर भी यह एक विश्वसनीय, रियल-टाइम कोच बनने से बहुत दूर है। यह आपको रेसिपी बता सकता है, लेकिन यह अभी तक आपको खाना पकाते हुए नहीं देख सकता और टोस्ट जलने से नहीं रोक सकता। लेखक आशा करते हैं कि यह नया "जिम" (GuideMe) भविष्य के AI डेवलपर्स को उनके मॉडल को सच्चे इंटरैक्टिव कोच बनाने के बजाय केवल निष्क्रिय कथावाचक बनने से रोकने के लिए प्रशिक्षित करने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →