← नवीनतम पेपर
💻 computer science

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker एक नवीन ढांचा है जो विजन-लैंग्वेज मॉडल्स की गतिशील स्थानिक तर्क क्षमता को बढ़ाता है, जिससे वे आंतरिक रूप से सिम्युलेटेड लेटेंट मेंटल इमेजरी के माध्यम से "4D के साथ सोचने" में सक्षम होते हैं, जिसे एक एनोटेशन-फ्री डेटा पाइपलाइन, डायनेमिक-इमेजरी फाइन-ट्यूनिंग और 4D रीइन्फोर्समेंट लर्निंग द्वारा समर्थन प्राप्त है।

मूल लेखक: Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त सड़क का वीडियो देख रहे हैं। एक कार एक लाल इमारत के पास से गुजरती है। यदि आप एक मानक AI से पूछते हैं, "क्या कार इमारत के करीब आ रही है, या कैमरा दूर जा रहा है?" तो AI भ्रमित हो सकता है। यह आमतौर पर दृश्य का वर्णन करने के लिए एक लंबा, शब्दबहुल पैराग्राफ लिखकर उत्तर देने की कोशिश करता है। लेकिन शब्द 3D स्थान में जटिल गति का वर्णन करने के लिए बहुत ही अनाड़ी उपकरण हैं; यह एक नर्तक को देखने के बजाय केवल उसके कदमों को लिखने जैसा है।

4DThinker AI को चलते हुए वीडियो के बारे में "सोचना" सिखाने का एक नया तरीका है। शब्दों को लिखने के बजाय, AI अपने दिमाग के अंदर एक "मानसिक फिल्म" (mental movie) बनाना सीखता है ताकि इस समस्या को हल किया जा सके।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. समस्या: शब्द बनाम गति

वर्तमान AI मॉडल पढ़ने और लिखने में बहुत अच्छे हैं, लेकिन वे डायनेमिक स्पेशियल रीजनिंग (dynamic spatial reasoning) में संघर्ष करते हैं। यह समझने की क्षमता है कि समय के साथ वस्तुएं और कैमरा एक-दूसरे के सापेक्ष कैसे चलते हैं।

  • पुराना तरीका: AI गति को पूरी तरह से टेक्स्ट में वर्णित करने की कोशिश करता है। यह एक रोलरकोस्टर की सवारी को केवल "ऊपर," "नीचे," और "तेज़" जैसे शब्दों की सूची देकर समझाने जैसा है। यह अक्सर अपरिष्कृत और भ्रमित करने वाला होता है।
  • दूसरा पुराना तरीका: कुछ शोधकर्ता AI को 3D आकृतियों को देखने में मदद करने के लिए अतिरिक्त "चश्मे" (बाहरी ज्यामितीय उपकरण) जोड़ देते हैं। लेकिन यह AI को धीमा और भारी बना देता है, जैसे किसी धावक को भारी बैकपैक पहना दिया गया हो।

2. समाधान: "4D के साथ सोचना"

4DThinker AI को आंतरिक रूप से गति का अनुकरण (simulate) करना सिखाता है, जिसे लेखक "डायनेमिक मेंटल इमेजरी" (Dynamic Mental Imagery) कहते हैं।

  • उपमा: कल्पना कीजिए कि आप एक कार को गुजरते हुए देख रहे हैं। केवल यह कहने के बजाय कि "कार बाईं ओर गई," आप अपनी आँखें बंद करते हैं और अपने मन में कार के पथ की कल्पना करते हैं। आप देखते हैं कि कार दूर जाते समय छोटी होती जा रही है। 4DThinker बिल्कुल यही करता है, लेकिन अपने कंप्यूटर कोड के भीतर। यह एक छिपी हुई, अदृश्य "फिल्म" बनाता है जिसे वह उत्तर खोजने के लिए अपने मस्तिष्क के माध्यम से चलाता है।

3. उन्होंने इसे कैसे सिखाया (तीन चरण)

चरण A: अभ्यास डेटा बनाना (बिना मनुष्यों के)
AI को सिखाने के लिए, उन्हें हजारों वीडियो, प्रश्नों और उत्तरों की आवश्यकता थी। आमतौर पर, मनुष्यों को इन वीडियो को लेबल करना पड़ता है, जो धीमा और महंगा है।

  • चाल: उन्होंने एक स्वचालित पाइपलाइन बनाई जो कच्चे वीडियो लेती है और अन्य AI उपकरणों का उपयोग करके स्वचालित रूप से चलती हुई वस्तुओं (जैसे साइकिल पर व्यक्ति) और स्थिर वस्तुओं (जैसे इमारत) को ढूंढती है। फिर यह वीडियो फ्रेम के "हाइलाइट किए गए" संस्करण बनाता है ताकि AI को पता चल सके कि उसे कहाँ ध्यान केंद्रित करना है। इसने बिना एक भी मानव रेखा खींचे, अभ्यास समस्याओं का एक विशाल पुस्तकालय तैयार कर दिया।

चरण B: "वॉर्म-अप" (DIFT)
सबसे पहले, उन्होंने AI को अपने शब्दों और अपनी मानसिक फिल्मों को जोड़ने के लिए प्रशिक्षित किया।

  • उपमा: इसे एक छात्र की तरह समझें जो शिक्षक को सुनते हुए चित्र बनाना सीख रहा है। AI को एक वीडियो फ्रेम दिखाया जाता है, और उसे एक "मानसिक छवि" (दृश्य का प्रतिनिधित्व करने वाला एक छिपा हुआ कोड) और एक टेक्स्ट उत्तर एक साथ उत्पन्न करना होता है। यह सीखता है कि सही उत्तर देने के लिए, उसे बोलने से पहले अपने मन में गति को "देखना" होगा।

चरण C: "कोच" (4D सुदृढीकरण सीखना - Reinforcement Learning)
एक बार जब AI बुनियादी बातें जान जाता है, तो वे इसे अधिक कठिन, जटिल वीडियो पर अभ्यास करने देते हैं जहाँ कैमरा और वस्तुएं दोनों चल रहे होते हैं।

  • चाल: उन्होंने AI को उत्तर नहीं दिए। इसके बजाय, वे एक कोच की तरह काम करते थे। यदि AI ने सही उत्तर दिया, तो उसे एक "पुरस्कार" मिलता था। यदि उत्तर गलत था, तो उसे कोई पुरस्कार नहीं मिलता था। AI ने खुद ही समझ लिया कि पुरस्कार पाने के लिए अपनी मानसिक फिल्मों का उपयोग कैसे करना है। महत्वपूर्ण बात यह है कि उन्होंने इस अभ्यास के दौरान AI को केवल अपने शब्दों को बदलने की अनुमति दी, जिससे "मानसिक फिल्म" वाला हिस्सा स्थिर रहे ताकि वह भ्रमित न हो।

4. परिणाम

इस पेपर ने परीक्षण किया कि इस नए AI ने गति, दूरी और दिशा के बारे में कई कठिन वीडियो क्विज़ पर प्रदर्शन किया।

  • परिणाम: 4DThinker ने अन्य शीर्ष AI मॉडलों को भी लगातार पीछे छोड़ दिया, जिनमें बहुत महंगे "प्रोपराइटरी" (proprietary) मॉडल भी शामिल हैं।
  • यह क्यों जीता: इसे अतिरिक्त उपकरणों या भारी बैकपैक की आवश्यकता नहीं थी। इसने बस अपने दिमाग के भीतर 4D (3D स्थान + समय) में दृश्य की कल्पना करने में बेहतर दक्षता हासिल की, ठीक वैसे ही जैसे इंसान यह समझने की कोशिश करते हैं कि क्या वे स्वयं चल रहे हैं या उनके आसपास की दुनिया चल रही है।

सारांश

4DThinker एक ऐसा ढांचा (framework) है जो AI मॉडलों को गति को अनाड़ी शब्दों के साथ वर्णित करने के बजाय अपने मन में गति का अनुकरण करना सिखाता है। AI को उसके उत्तरों के साथ "मानसिक फिल्में" उत्पन्न करने के लिए प्रशिक्षित करके, यह भौतिक दुनिया के हिलने और बदलने को समझने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →