← नवीनतम पेपर
💻 computer science

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

यह शोध पत्र प्रकट करता है कि वीडियो डिफ्यूजन मॉडल जनरेशन प्रक्रिया के शुरुआती चरणों में ही उच्च-स्तरीय मोशन प्लान (गति योजनाओं) के प्रति प्रतिबद्ध हो जाते हैं और ChEaP को पेश करता है, जो लंबी अवधि के कार्यों (long-horizon tasks) पर भूलभुलैया सुलझाने की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए इन शुरुआती योजनाओं को एक श्रृंखला में जोड़ता है।

मूल लेखक: Kaleb Newman, Tyler Zhu, Olga Russakovsky

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaleb Newman, Tyler Zhu, Olga Russakovsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े जल्दबाज़ कलाकार से कागज के एक टुकड़े पर एक जटिल भूलभुलैया (maze) का समाधान बनाने के लिए कहते हैं। आप उससे कहते हैं, "एक छोटे एल्फ (elf) को शुरुआत से लेकर उपहार तक चलते हुए बनाओ, और बर्फीली झीलों से बचते हुए दिखाओ।"

यह कागज इस बारे में है कि वीडियो बनाने वाले AI मॉडल (जैसे कि वे जो डीपफेक या एनिमेटेड कहानियाँ बनाते हैं) वास्तव में इन पहेलियों को सुलझाते समय कैसे "सोचते" हैं। शोधकर्ताओं ने दो आश्चर्यजनक चीजें पाईं जो इस तरह से हमारे AI टूल्स के उपयोग करने के तरीके को बदल देती हैं।

यहाँ सरल शब्दों में विवरण दिया गया है:

1. "पहली छाप" का नियम (Early Plan Commitment)

उपमा (Analogy): कल्पना कीजिए कि कलाकार स्केच बनाना शुरू करता है। शुरुआती कुछ सेकंड में ही, वह ठीक से तय कर लेता है कि एल्फ द्वारा लिया जाने वाला रास्ता कौन सा होगा। शायद वह शुरुआत से अंत तक एक कच्ची रेखा खींच देता है। उसके बाद, अगले 40 मिनट तक, वह केवल एल्फ को और प्यारा बनाने, बर्फ को अधिक चमकदार बनाने और रंगों को अधिक उज्ज्वल बनाने में समय बिताता है। वह रास्ते को कभी नहीं बदलता। यदि रास्ता गलत था, तो अंतिम ड्राइंग एक सुंदर, हाई-डेफिनिशन तस्वीर होगी जिसमें एल्फ एक खाई में गिर रहा है।

खोज: शोधकर्ताओं ने पाया कि वीडियो AI मॉडल बिल्कुल इसी तरह काम करते हैं। वीडियो जेनरेट करने के पहले कुछ "चरणों" के भीतर (जो मिलीसेकंड में होता है), मॉडल एक उच्च-स्तरीय योजना लॉक कर देता है। बाकी का समय केवल विवरणों को निखारने का होता है।

  • यह क्यों मायने रखता है: वर्तमान में अधिकांश लोग AI को कहते हैं, "10 अलग-अलग रास्ते आज़माओ, लेकिन विजेता चुनने से पहले उन सभी 10 को पूरी तरह से समाप्त करो।" यह बेकार है! यह 10 कलाकारों को प्रत्येक ड्राइंग पर 40 मिनट बिताने के लिए काम पर रखने जैसा है, केवल यह महसूस करने के बाद कि उनमें से 9 ने पहले 5 सेकंड में ही गलत रास्ता बना लिया था।
  • समाधान: लेखकों ने ChEaP (Chaining with Early Planning) नामक एक विधि बनाई। सभी 10 ड्राइंग्स को पूरा करने के बजाय, AI 100 अलग-अलग रास्तों के पहले 5 सेकंड को जल्दी से स्केच करता है। यह तुरंत जांच लेता है कि कौन से 2 रास्ते आशाजनक दिख रहे हैं, और केवल तभी वह उन दो को पूरा करने में समय बिताता है। यह कंप्यूटिंग पावर की भारी बचत करता है और बेहतर परिणाम देता है।

2. "ध्यान अवधि" की समस्या (The Horizon Limit)

उपमा: कल्पना कीजिए कि कलाकार का ध्यान बहुत कम समय के लिए रहता है। वह एक छोटा रास्ता (जैसे 10 कदम) पूरी तरह से बना सकता है। लेकिन यदि आप उसे 20 कदमों वाला रास्ता बनाने के लिए कहते हैं, तो वह भ्रमित हो जाता है। वह "चीटिंग" करने की कोशिश कर सकता है, जैसे उपहार को एल्फ के करीब टेलीपोर्ट करना, या वह बस बीच में ही ड्राइंग बंद कर सकता है क्योंकि कागज खत्म हो गया।

खोज: AI बाधाओं (झीलों) से बचने में बुरा नहीं है; यह लंबे अनुक्रमों (long sequences) की योजना बनाने में बुरा है।

  • यदि भूलभुलभुलैया में छोटा रास्ता चाहिए, तो AI बहुत अच्छा है।
  • यदि भूलभुलभैया में लंबा रास्ता चाहिए (12 कदमों से अधिक), तो AI अक्सर विफल हो जाता है, इसलिए नहीं कि वह झीलों को नहीं देख सकता, बल्कि इसलिए क्योंकि वह "मूवी" जो वह जेनरेट कर रहा है, पूरी यात्रा दिखाने के लिए पर्याप्त लंबी नहीं है।
  • "चीटिंग" व्यवहार: जब रास्ता बहुत लंबा होता है, तो AI हताश हो जाता है। लंबा रास्ता चलने के बजाय, वह जादू से उपहार को एल्फ के पैरों के पास ला सकता है या लक्ष्य के पास दूसरा एल्फ पैदा कर सकता है। वह नियमों का पालन करने के बजाय प्रॉम्प्ट को हल करने को प्राथमिकता देता है।

3. समाधान: "चेनिंग" (Chaining)

उपमा: यदि आपको एक लंबी कहानी सुनानी है लेकिन कहानीकार एक बार में केवल 10 वाक्य ही याद रख सकता है, तो आप उससे पूरी कहानी एक साथ नहीं पूछते। इसके बजाय, आप कहते हैं, "मुझे पहले 10 वाक्य सुनाओ।" फिर, आप उसके द्वारा कहे गए अंतिम वाक्य को लेते हैं और कहते हैं, "ठीक है, अब वहां से कहानी जारी रखो।" आप यह काम टुकड़ों में तब तक करते हैं जब तक कहानी पूरी न हो जाए।

समाधान: शोधकर्ताओं ने अपनी "अर्ली प्लान" वाली ट्रिक को इस "चेनिंग" वाली ट्रिक के साथ जोड़ा।

  1. वे एक छोटा वीडियो सेगमेंट (भूलभुलैया का पहला भाग) जेनरेट करते हैं।
  2. वे जांचते हैं कि क्या यह अच्छा दिख रहा है।
  3. यदि यह अच्छा है, तो वे उस वीडियो के अंतिम फ्रेम को लेते हैं और उसे अगले वीडियो सेगमेंट के लिए शुरुआती बिंदु के रूप में उपयोग करते हैं।
  4. वे इसे तब तक दोहराते हैं जब तक एल्फ उपहार तक नहीं पहुँच जाता।

परिणाम

इन दो ट्रिक्स (योजनाओं को जल्दी जांचना और छोटे वीडियो को एक साथ जोड़ना) का उपयोग करके, उन्होंने एक ऐसे मॉडल को जो लंबी भूलभुलैया पर 93% बार विफल हो रहा था, उसे 67% बार सफल होने वाले मॉडल में बदल दिया।

सारांश

  • पुराना तरीका: "10 रास्ते आज़माओ, उन सभी को पूरा करो, फिर सबसे अच्छा चुनो।" (धीमा और बर्बादी भरा)।
  • नया तरीका: "100 रास्तों को जल्दी से स्केच करो, 2 सबसे अच्छे चुनो, और उन्हें पूरा करो। यदि रास्ता बहुत लंबा है, तो इसे छोटे टुकड़ों में तोड़ो और उन्हें आपस में जोड़ दो।" (तेज़, कुशल और बहुत स्मार्ट)।

यह पेपर साबित करता है कि ये AI मॉडल वास्तव में "तर्क" (reasoning) और योजना बनाने में काफी अच्छे हैं, बस हमें उनसे इस तरह बात करने की ज़रूरत है जो उनके दिमाग (या एल्गोरिदम) के काम करने के तरीके से मेल खाता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →