← नवीनतम पेपर
💻 computer science

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

यह शोध पत्र मैनुअल टू एक्शन डेटासेट (M2AD) को प्रस्तुत करता है, जो फर्नीचर असेंबली वीडियो को निर्देश पुस्तिकाओं (इंस्ट्रक्शन मैनुअल्स) के साथ संरेखित करता है, ताकि प्रक्रियात्मक कार्यों के लिए वास्तविक समय में, मल्टीमॉडल सहायता प्रदान करने में वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमताओं और सीमाओं का मूल्यांकन किया जा सके।

मूल लेखक: Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप IKEA का एक जटिल फर्नीचर बनाने की कोशिश कर रहे हैं। आपके पास निर्देश पुस्तिका (कागज के रेखाचित्रों का एक समूह) है और आपके हाथों में पुर्जे हैं। अब, कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोटिक सहायक है जो आपको देख रहा है।

बड़ा सवाल: क्या यह रोबोट आपके हाथों को देख सकता है, आपकी कागजी निर्देश पुस्तिका को देख सकता है, और वास्तव में यह समझ सकता है कि आप क्या कर रहे हैं? क्या वह आपको बता सकता है, "हे, आपने अभी स्टेप 3 पूरा किया है, इसलिए अब आपको स्टेप 4 से पेंच (screw) उठाना चाहिए"?

यह पेपर एक टेस्ट ट्रैक बनाने के बारे में है ताकि यह देखा जा सके कि वर्तमान AI रोबोट एक सहायक होने में कितने अच्छे हैं।

1. समस्या: पुराने टेस्ट बनाम वास्तविक जीवन

पहले, शोधकर्ता AI को सरल कार्यों के साथ परखते थे, जैसे "क्या इस तस्वीर में बिल्ली है?" या "व्यक्ति अभी क्या कर रहा है?" (जैसे प्याज काटना)।

लेकिन फर्नीचर बनाना केवल एक क्रिया नहीं है; यह एक कहानी है। यह घटनाओं का एक क्रम है। आपको यह जानने के लिए कि आगे क्या करना है, यह याद रखना होगा कि आपने पाँच मिनट पहले क्या किया था। पुराने टेस्ट यह नहीं देखते थे कि क्या AI पूरी कहानी का पालन कर सकता है। वे एक ड्राइवर का परीक्षण करने जैसे थे, जिसमें उसे रेड लाइट पर रुकने के लिए तो पूछा गया, लेकिन यह नहीं देखा गया कि क्या वह वास्तव में न्यूयॉर्क से लंदन तक गाड़ी चला सकता है।

2. समाधान: "M2AD" डेटासेट

शोधकर्ताओं ने M2AD (मैनुअल-टू-एक्शन डेटासेट) नामक एक नया प्रशिक्षण मैदान बनाया।

  • सामग्री: उन्होंने YouTube से 53 अलग-अलग IKEA फर्नीचर के वीडियो लिए (असली लोग असली चीजें बना रहे हैं) और उन्हें आधिकारिक PDF निर्देश पुस्तिकाओं के साथ पूरी तरह से मिला दिया।
  • लेबलिंग: उन्होंने केवल "स्टेप 1" लेबल नहीं किया। उन्होंने ठीक से चिह्नित किया कि वीडियो में स्टेप 1 कब शुरू हुआ और कब समाप्त हुआ, और वह मैनुअल के किस पेज पर था।
  • ट्विस्ट: उन्होंने इसे "वास्तविक" बनाया। असली लोग गलतियाँ करते हैं। वे स्टेप्स छोड़ देते हैं, चीजों को ठीक करने के लिए पीछे जाते हैं, या कॉफी ब्रेक लेते हैं। यह डेटासेट उस सारी मानवीय अव्यवस्था को कैप्चर करता है, न कि केवल एक आदर्श, रोबोटिक संस्करण को।

M2AD को एक AI के लिए जिम के रूप में सोचें। एक अकेला वजन उठाने के बजाय, AI को एक नक्शा पढ़ते हुए मैराथन दौड़नी पड़ती है।

3. परीक्षण: AI को काम पर लगाना

शोधकर्ताओं ने कई "ओपन-सोर्स" AI मॉडल (वे मॉडल जिन्हें आप एक शक्तिशाली होम कंप्यूटर पर चला सकते हैं, न कि केवल एक विशाल सुपरकंप्यूटर पर) को लिया और उन्हें तीन विशिष्ट चुनौतियों के माध्यम से गुजारा:

  • चुनौती A: "क्या मैंने पूरा किया?" की जांच।

    • परिदृश्य: AI एक वीडियो क्लिप देखता है जिसमें आप मेज की टांग पर पेंच लगा रहे हैं और मैनुअल पेज की एक तस्वीर देखता है।
    • कार्य: क्या AI कह सकता है, "हाँ, आप इस स्टेप के लिए तैयार हैं"?
    • परिणाम: कुछ AI ठीक थे (लगभग 56% सटीक), लेकिन कई केवल अनुमान लगाने से थोड़े ही बेहतर थे।
  • चुनौती B: "मैं कहाँ हूँ?" की जांच।

    • परिदृश्य: AI आपको काम करते हुए देखता है और उसे मैनुअल के दो पेज दिखाए जाते हैं (एक सही पेज है, एक चकमा देने वाला पेज है)।
    • कार्य: क्या AI सही पेज चुन सकता है जो आपके काम से मेल खाता हो?
    • परिणाम: फिर से, केवल सबसे स्मार्ट मॉडल ही इसे विश्वसनीय रूप से कर सके। अधिकांश भ्रमित हो गए।
  • चुनौती C: "कौन सा स्टेप नंबर?" की जांच।

    • परिदृश्य: AI आपको काम करते हुए देखता है और उसे दो पेज दिखाए जाते हैं।
    • कार्य: क्या AI कह सकता है, "आप वर्तमान में स्टेप 12 पर हैं"?
    • परिणाम: यह सबसे कठिन था। अधिकांश AI बुरी तरह विफल रहे। एक मॉडल, MolMo, ने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, लेकिन उसने थोड़ा 'चीटिंग' किया क्योंकि उसने केवल इमेज के लेआउट को देखा (जैसे कि यह कहना कि "बाईं ओर का टेक्स्ट 12 कहता है") बजाय इसके कि वह वास्तव में तर्क को समझे।

4. निष्कर्ष: आशाजनक, लेकिन अभी पूरी तरह तैयार नहीं

पेपर निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी इसे लंबी, जटिल कहानियों के साथ संघर्ष करना पड़ता है।

  • अच्छी खबर: AI यह समझने में बेहतर हो रहा है कि एक वीडियो और एक मैनुअल आपस में जुड़े हुए हैं। हमें AI को हर एक छोटी बारीकी सिखाने की ज़रूरत नहीं है; वह कुछ चीजें खुद सीख सकता है।
  • बुरी खबर: वर्तमान AI मॉडल की "ध्यान अवधि छोटी" और "आंखें कमजोर" होती हैं। वे एक पूरे वीडियो सीक्वेंस और एक पूरे मैनुअल को एक साथ देखे बिना अभिभूत हुए बिना नहीं देख सकते। वे अक्सर कहानी के बीच में खो जाते हैं।
  • हार्डवेयर की बाधा: इसे वास्तविक कारखाने या घर में काम करने के लिए, AI को एक सामान्य कंप्यूटर पर चलना चाहिए, न कि एक विशाल सर्वर फार्म पर। वर्तमान मॉडल बहुत भारी और धीमे हैं।

निचोड़ (The Bottom Line)

यह पेपर अगली पीढ़ी के रोबोटिक सहायकों के लिए एक रिपोर्ट कार्ड की तरह है। यह कहता है: "आप नक्शा पढ़ने और सड़क देखने में बेहतर हो रहे हैं, लेकिन यदि यात्रा बहुत लंबी हो जाए तो आप अभी भी रास्ता भटक जाते हैं।"

लेखक उम्मीद करते हैं कि इस नए डेटासेट (M2AD) का उपयोग करके, डेवलपर्स बेहतर, अधिक धैर्यवान और अधिक चौकस AI सहायक बनाएंगे जो अंततः हमें बिना परेशान हुए फर्नीचर बनाने में मदद कर सकें!

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →