← नवीनतम पेपर
🤖 AI

TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning

यह शोध पत्र TwiFF को पेश करता है, जो गतिशील दृश्य तर्क (dynamic visual reasoning) के लिए एक नवीन ढांचा है जिसमें एक बड़े पैमाने का डेटासेट (TwiFF-2.7M), एक विशिष्ट मूल्यांकन बेंचमार्क (TwiFF-Bench), और एक एकीकृत मॉडल शामिल है जो भविष्य के एक्शन फ्रेम और पाठ्य तर्क चरणों को पुनरावृत्ति से उत्पन्न करके मल्टीमॉडल तर्क को बढ़ाता है।

मूल लेखक: Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, Kun Kuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं, लेकिन अचानक कोई एक बहुत ही रोमांचक दृश्य के बीच में ही पॉज (pause) बटन दबा देता है।

यदि आप केवल उस एक स्थिर फ्रेम को देखते हैं, तो आपको एक व्यक्ति दिखाई दे सकता है जो कील के ऊपर हथौड़ा पकड़े हुए है। आप अनुमान लगा सकते हैं कि वे कील पर प्रहार करने वाले हैं, लेकिन आप वास्तव में यह नहीं जानते कि आगे क्या होगा। आप एक "स्थिर" दुनिया में फंस गए हैं।

TwiFF (Think With Future Frames) के पीछे के शोधकर्ताओं ने अनिवार्य रूप से AI को एक "मानसिक प्रोजेक्टर" (mental projector) दे दिया है। केवल स्थिर फ्रेम को देखने के बजाय, AI अब यह समझने के लिए कि वहां क्या हो रहा है, अगले कुछ सेकंड की फिल्म को अपने मन में "हैलुसिनेट" (hallucinate) या कल्पना कर सकता है।

यहाँ बताया गया है कि यह कुछ रोजमर्रा के उदाहरणों का उपयोग करके कैसे काम करता है:

1. समस्या: "स्नैपशॉट" की सीमा

अधिकांश वर्तमान AI मॉडल एक फोटो एल्बम देखने वाले लोगों की तरह हैं। यदि आप उन्हें मेज के किनारे की ओर झुकते हुए एक गिलास की फोटो दिखाते हैं, तो वे बता सकते हैं, "मेज पर एक गिलास है।" वे यहाँ तक भी अनुमान लगा सकते हैं, "ऐसा लगता है कि यह गिर सकता है।" लेकिन वे जीवन के प्रवाह—गति, निर्देशों या कैमरा एंगल के "क्यों" और "कैसे" को समझने में संघर्ष करते हैं। वे यह बताने में बहुत अच्छे हैं कि क्या है, लेकिन यह बताने में बहुत खराब हैं कि क्या होगा

2. समाधान: "मानसिक प्रोजेक्टर" (Dynamic VCoT)

TwiFF एक ऐसी चीज़ पेश करता है जिसे डायनेमिक विजुअल चेन-ऑफ-थॉट (Dynamic Visual Chain-of-Thought) कहा जाता है।

इसे एक जासूस द्वारा अपराध सुलझाने की तरह समझें। एक बुरा जासूस सिर्फ टूटी हुई खिड़की की फोटो देखता है और कहता है, "खिड़की टूटी हुई है।" एक महान जासूस टूटे हुए कांच, फर्श पर पत्थर की स्थिति और कीचड़ भरे पैरों के निशान को देखता है, और फिर अपने दिमाग में घटनाओं के क्रम की कल्पना करता है: "पहले, व्यक्ति ने पत्थर उठाया, फिर उन्होंने उसे फेंका, और फिर कांच टूट गया।"

TwiFF बिल्कुल यही करता है। जब यह एक वीडियो देखता है, तो यह केवल पिक्सेल को प्रोसेस नहीं करता; यह अपने मन में "भविष्य के फ्रेम" (future frames) बनाता है। यह कहता है:

  • "फ्रेम 1 में, मैं सलाद की सामग्री पकड़े हुए एक व्यक्ति को देखता हूँ..."
  • (मानसिक प्रक्षेपण: यह अगली गतिविधि की कल्पना करता है)
  • "फ्रेम 2 में, मैं उन्हें इसे कटोरे में डालते हुए देखता हूँ..."
  • "इसलिए, अगला तार्किक कदम इसे चलाना (stir) है।"

3. प्रशिक्षण: "अल्टीमेट वीडियो लाइब्रेरी"

AI को यह करने के लिए सिखाने हेतु, शोधकर्ताओं ने TwiFF-2.7M नामक एक विशाल प्रशिक्षण कार्यक्रम बनाया है।

कल्पना कीजिए कि एक छात्र को 2.7 मिलियन अलग-अलग छोटी क्लिप्स दी जा रही हैं—कुकिंग ट्यूटोरियल और स्पोर्ट्स हाइलाइट्स से लेकर सिनेमाई कैमरा मूवमेंट्स तक सब कुछ। प्रत्येक क्लिप के लिए, उन्होंने केवल एक कैप्शन नहीं दिया; उन्होंने एक स्टोरीबोर्ड प्रदान किया। उन्होंने AI को शब्दों और "कल्पित" चित्रों दोनों का उपयोग करके "एक्शन A" और "परिणाम B" के बीच के संबंध को जोड़ने के लिए प्रशिक्षित किया।

4. यह क्यों मायने रखता है? ("वास्तविक दुनिया" का परीक्षण)

क्योंकि AI "फ्यूचर फ्रेम्स के साथ सोच" सकता है, इसलिए यह तीन बड़े तरीकों से बहुत अधिक उपयोगी हो जाता है:

  • इंस्ट्रक्टर (शिक्षक): यह एक DIY वीडियो देख सकता है और वास्तव में चरणों को समझ सकता है, जिससे यह आपकी मदद कर सकता है यदि आप पूछते हैं, "लकड़ी को सैंड (sand) करने के बाद मुझे क्या करना चाहिए?"
  • प्रेडिक्टर (पूर्वानुमान लगाने वाला): यह एक मोड़ की ओर जाती कार को देख सकता है और भविष्यवाणी कर सकता है, "ड्राइवर को संतुलित रहने के लिए मोड़ की ओर झुकने की आवश्यकता होगी।"
  • डायरेक्टर (निर्देशक): यह समझता है कि कैमरे कैसे चलते हैं, यह पहचानता है कि तनाव पैदा करने के लिए शॉट ज़ूम इन कर रहा है या परिदृश्य दिखाने के लिए पैन कर रहा है।

सारांश

संक्षेप में, जहाँ पुराने AI मॉडल फोटोग्राफर (एक क्षण को कैद करने वाले) की तरह हैं, वहीं TwiFF एक फिल्म निर्माता की तरह है। यह समझता है कि जीवन स्थिर छवियों की एक श्रृंखला नहीं है, बल्कि एक निरंतर, बहती हुई कहानी है जहाँ हर क्रिया अगले चरण के लिए मंच तैयार करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →