← नवीनतम पेपर
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV एक एकीकृत विशाल मल्टीमॉडल मॉडल है जो एक टेम्पोरल सिमिलरिटी राउटर द्वारा निर्देशित पूर्ण-छवि जनरेशन को एक कॉम्पैक्ट विजुअल-अपडेट प्रतिमान से बदलकर तर्क दक्षता और प्रदर्शन को बढ़ाता है, जिसे StructCoT नामक एक नए बड़े पैमाने के इंटरलीव्ड रीजनिंग डेटासेट का समर्थन प्राप्त है।

मूल लेखक: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट दोस्त के साथ "साइमन सेज़" (Simon Says) का एक जटिल खेल खेल रहे हैं, लेकिन केवल सुनने के बजाय, आपको अपने दोस्त को यह दिखाने के लिए कि क्या हो रहा है, व्हाइटबोर्ड पर खेल के हर एक कदम को ड्रा करना होगा।

पुराना तरीका: ओवर-ड्रॉन आर्टिस्ट (अति-चित्रण करने वाला कलाकार)
वर्तमान में, अधिकांश उन्नत AI मॉडल जो चित्रों के साथ समस्याओं को हल करने की कोशिश करते हैं (जैसे कि भूलभुलैया या गणित की पहेली सुलझाना), एक बहुत ही विस्तृत, लेकिन थोड़े अक्षम कलाकार की तरह काम करते हैं। मान लीजिए कि खेल एक मेज पर रखे कप की तस्वीर के साथ शुरू होता है।

  • चरण 1: AI कप के साथ पूरी मेज बनाता है।
  • चरण 2: खेल का नियम कहता है, "कप को बाईं ओर ले जाओ।" AI, हालांकि, पूरे व्हाइटबोर्ड को मिटा देता है और कप को दिखाने के लिए फिर से पूरी मेज बनाता है, जिसमें मेज के पैर, बैकग्राउंड और छाया भी शामिल हैं, सिर्फ इसलिए ताकि वह दिखा सके कि कप एक इंच हिला है।
  • चरण 3: "कप को घुमाएं।" AI सब कुछ मिटा देता है और फिर से पूरी मेज बनाता है।

इस प्रक्रिया को "फुल-इमेज जनरेशन" कहा जाता है। लेखक तर्क देते हैं कि यह ऊर्जा और स्थान का एक बड़ा अपव्यय है। यह एक वाक्य में एक शब्द बदलने के लिए हर बार पूरी डिक्शनरी को फिर से लिखने जैसा है। AI अपना अधिकांश समय उन चीजों को फिर से बनाने में बिताता है जो बिल्कुल नहीं बदली हैं, जिससे यह धीमा हो जाता है और कभी-कभी विवरणों को बिगाड़ देता है (जैसे कि गलती से कप का रंग बदल देना क्योंकि वह भूल गया कि वह पहले कैसा दिखता था)।

नया तरीका: डेल्टावी (DeltaV), "स्टिकर" कलाकार
यह मॉडल DeltaV पेश करता है। पूरी दृश्य को फिर से बनाने के बजाय, DeltaV एक चतुर स्टिकर कलाकार की तरह काम करता है।

  • चरण 1: यह कप के साथ मेज बनाता है ("बेस स्टेट")।
  • चरण 2: जब कप को हिलने की आवश्यकता होती है, तो DeltaV मेज को फिर से नहीं बनाता है। यह बस कप के हिलने का एक छोटा सा "स्टिकर" बनाता है और उसे पुराने स्थान के ऊपर चिपका देता है। यह मेज के पैरों और बैकग्राउंड को अनदेखा कर देता है क्योंकि वे नहीं बदले हैं।
  • चरण 3: जब कप घूमता है, तो यह बस एक छोटा सा "रोटेशन स्टिकर" जोड़ देता है।

इस दृष्टिकोण को विजुअल अपडेट्स कहा जाता है। पेपर सुझाव देता है कि केवल बदलावों (जिसे "डेल्टा" कहा जाता है) को ड्रा करके, AI काम का एक बड़ा हिस्सा बचा लेता है। उनके परीक्षणों में, इस पद्धति ने औसत रूप से नए "ड्राइंग टोकन" (छवि बनाने के लिए उपयोग की जाने वाली डिजिटल स्याही) की संख्या को 55.6% कम कर दिया, बिना चित्रों की गुणवत्ता खराब किए।

स्मार्ट "स्टॉप" बटन: TSIM राउटर
आप सोच सकते हैं: "क्या होगा यदि बदलाव बहुत बड़ा हो? क्या होगा यदि पूरा दृश्य ही बदल जाए?"
DeltaV में एक अंतर्निहित स्मार्ट मैनेजर है जिसे TSIM राउटर कहा जाता है। इसे एक सुपरवाइजर के रूप में सोचें जो यह देखता है कि नया दृश्य पुराने दृश्य से कितना अलग है।

  • यदि परिवर्तन छोटा है (जैसे कप को हिलाना), तो सुपरवाइजर कहता है, "बस कुछ स्टिकर का उपयोग करें।"
  • यदि परिवर्तन बहुत बड़ा है (जैसे कि पूरा कमरा बदल जाना), तो सुपरवाइजर कहता है, "ठीक है, सही ढंग से करने के लिए अधिक स्टिकर का उपयोग करें।"

पेपर ने इसे छवि को पुनर्गठित करने की क्षमता की जांच करके मापा। उन्होंने पाया कि यदि वे एक निश्चित बिंदु के बाद टोकन जोड़ते रहते हैं, तो चित्र बहुत बेहतर नहीं होता है। इसलिए, TSIM राउटर टोकन जोड़ना तब बंद कर देता है जब "अतिरिक्त प्रयास" का लाभ मिलना बंद हो जाता है। यह सुनिश्चित करता है कि AI सरल चरणों में समय बर्बाद न करे लेकिन जटिल चरणों में कमी भी न छोड़े।

प्रशिक्षण का मैदान: StructCoT
DeltaV को यह सिखाने के लिए, शोधकर्ताओं को केवल पुराने पहेली पुस्तकों का उपयोग नहीं किया जा सकता था। उन्होंने एक विशाल नया प्रशिक्षण सेट बनाया जिसे StructCoT कहा जाता है।

  • इसमें 1.05 मिलियन नमूने हैं।
  • यह 44 विभिन्न प्रकार के कार्यों को कवर करता है, जिसमें तर्क पहेलियां और गणित की समस्याएं से लेकर रोबोट प्लानिंग और विज्ञान के प्रश्न तक शामिल हैं।
  • पेपर का तर्क है कि पिछले डेटासेट बहुत छोटे थे या केवल भूलभुलैया जैसी विशिष्ट चीजों पर केंद्रित थे, जबकि StructCoT AI को समय के साथ विजुअल स्टेट कैसे बदलते हैं, इस पर बहुत व्यापक शिक्षा देता है।

परिणाम: क्या यह काम आया?
पेपर रिपोर्ट करता है कि जब उन्होंने DeltaV का परीक्षण किया:

  • इसने पुराने "सब कुछ फिर से बनाने" वाले तरीके की तुलना में मल्टीमॉडल रीजनिंग समस्याओं को 3.3% बेहतर तरीके से हल किया।
  • भले ही DeltaV एक छोटा मॉडल (2B पैरामीटर) है, इसने इन रीजनिंग कार्यों पर औसत 8.4% से बड़े ओपन-सोर्स मॉडल को भी पीछे छोड़ दिया।
  • इसने बाहरी बेंचमार्क पर एक तुलनीय मॉडल Qwen3-VL-2B को 5.9% से भी पछाड़ दिया।

जो पेपर खारिज करता है
लेखक स्पष्ट रूप से उस विचार का खंडन करते हैं जो काम नहीं करता है। वे स्पष्ट रूप से तर्क देते हैं कि हमें हर चरण में एक पूर्ण, हाई-रिज़ॉल्यूशन इमेज जेनरेट करने की आवश्यकता नहीं है। उनका सुझाव है कि ऐसा करने से "विजुअल-टोकन रेडंडेंसी" (डिजिटल स्याही की बर्बादी) पैदा होती है और वास्तव में यह AI की तर्क करने की क्षमता को नुकसान पहुँचाता है क्योंकि यह उन चीजों को फिर से बनाने में विचलित हो जाता है जो महत्वपूर्ण नहीं हैं। वे यह भी नोट करते हैं कि हालांकि यह तरीका रीजनिंग के लिए महान है, लेकिन यह उन कार्यों के लिए सबसे अच्छा नहीं हो सकता है जिनमें अत्यंत सूक्ष्म विवरणों (जैसे धूल के एक छोटे कण को पहचानना) की आवश्यकता होती है, जहाँ एक पूर्ण छवि अभी भी आवश्यक हो सकती है।

निष्कर्ष
पेपर सुझाव देता है कि AI रीजनिंग का भविष्य पूरी दुनिया को बार-बार फिर से बनाने के बारे में नहीं है। इसके बजाय, यह इस बारे में है कि "क्या बदला है?" केवल अपडेट पर ध्यान केंद्रित करके, DeltaV तेज़, अधिक कुशल और अपने भारी, फुल-इमेज-ड्रॉइंग कजों की तुलना में जटिल पहेलियों को हल करने में आश्चर्यजनक रूप से बेहतर बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →