← नवीनतम पेपर
💻 computer science

Quantized Visual Geometry Grounded Transformer

यह शोध पत्र QuantVGGT को प्रस्तुत करता है, जो बिलियन-स्केल विजुअल ज्योमेट्री ग्राउंडेड ट्रांसफॉर्मर्स (VGGTs) के लिए पहला क्वांटाइजेशन फ्रेमवर्क है, जो उच्च पुनर्निर्माण सटीकता बनाए रखते हुए महत्वपूर्ण मेमोरी और स्पीडअप लाभ प्राप्त करने के लिए ड्यूल-स्मूथड फाइन-ग्रेन्ड क्वांटाइजेशन और नॉइज़-फिल्टर्ड डायवर्स सैंपलिंग के माध्यम से अद्वितीय कैलिब्रेशन और वितरण चुनौतियों पर विजय प्राप्त करता है।

मूल लेखक: Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Quantized Visual Geometry Grounded Transformer" (QuantVGGT) का सरल भाषा और रचनात्मक उपमाओं के साथ स्पष्टीकरण दिया गया है।

बड़ी तस्वीर: "विशाल मस्तिष्क" की समस्या

VGGT नामक एक सुपर-इंटेलिजेंट रोबोट की कल्पना करें। यह रोबोट तस्वीरों की एक श्रृंखला को देखने और उनके पीछे की 3D दुनिया को तुरंत समझने में अद्भुत है—यह समझना कि कैमरा कहाँ था, वस्तुएँ कितनी गहरी हैं, और चीजें कैसे हिल रही हैं। यह एक जादूगर की तरह है जो एक साधारण फोटो एल्बम को 3D मूवी में बदल सकता है।

हालाँकि, एक समस्या है: VGGT एक विशालकाय है। यह इतना बड़ा है (1.2 बिलियन पैरामीटर्स) कि इसे चलाने के लिए एक सुपरकंप्यूटर की आवश्यकता होती है। यह एक ही, विशाल और अक्षम जनरेटर से पूरे शहर को बिजली देने की कोशिश करने जैसा है। आप इसे स्मार्टफोन, ड्रोन या सेल्फ-ड्राइविंग कार में नहीं डाल सकते क्योंकि यह बहुत अधिक बिजली और मेमोरी खाता है।

लक्ष्य: लेखक इस विशाल मस्तिष्क को बिना इसकी बुद्धिमत्ता खोए, जेब के आकार के उपकरण में फिट करने के लिए छोटा करना चाहते थे। वे चाहते थे कि यह मूल मॉडल की तुलना में 2.5 गुना तेज़ चले और 3.7 गुना कम मेमोरी का उपयोग करे, जबकि यह लगभग उतना ही स्मार्ट बना रहे।


समस्या: छोटा करना कठिन क्यों था

आमतौर पर, किसी मॉडल को छोटा करने के लिए, आप क्वांटाइजेशन (Quantization) नामक तकनीक का उपयोग करते हैं। इसे हाई-डेफिनिशन अंग्रेजी (फ्लोटिंग-पॉइंट नंबर्स) में लिखी गई किताब को केवल 4-बिट पूर्णांकों (जैसे कि एक बहुत ही बुनियादी कोड) का उपयोग करके एक सरल, संक्षिप्त संस्करण में अनुवाद करने के रूप में सोचें।

लेकिन जब उन्होंने VGGT को छोटा करने की कोशिश की, तो उन्हें दो प्रमुख बाधाओं का सामना करना पड़ा:

1. "शोर मचाने वाले विशेष मेहमान" (Heavy-Tailed Distributions)

एक कक्षा की कल्पना करें जहाँ 99% छात्र शांति से फुसफुसा रहे हैं (सामान्य इमेज डेटा)। लेकिन, सामने बैठे दो विशेष मेहमान (जिन्हें "कैमरा टोकन" और "रजिस्टर टोकन" कहा जाता है) इतनी ज़ोर से चिल्ला रहे हैं कि वे बाकी सभी को दबा रहे हैं।

  • समस्या: मानक छोटा करने वाली विधियों में, ये "चिल्लाने वाले" मेहमान अनुवादक को उनकी आवाज़ को पकड़ने के लिए संख्याओं की एक विशाल रेंज का उपयोग करने के लिए मजबूर करते हैं। इससे शांत छात्रों का वर्णन करने के लिए बहुत कम जगह बचती है, जिससे पूरी कहानी बिगड़ जाती है।
  • शोध पत्र का समाधान: उन्होंने Dual-Smoothed Fine-Grained Quantization का आविष्कार किया।
    • चरण 1 (मिक्सर): वे कमरे को बिखेरने के लिए एक गणितीय "मिक्सर" (Hadamard rotation) का उपयोग करते हैं। अचानक, चिल्लाने वाले मेहमानों की ऊर्जा पूरे कमरे में समान रूप से फैल जाती है। अब कोई चिल्ला नहीं रहा है; हर कोई बस मध्यम आवाज़ में बात कर रहा है।
    • चरण 2 (इक्वलाइज़र): इसके बाद वे प्रत्येक छात्र की आवाज़ को व्यक्तिगत रूप से समायोजित करते हैं (चैनल स्मूथिंग) ताकि जो थोड़े अधिक तेज़ थे, वे शांत छात्रों को दबा न सकें।
    • परिणाम: डेटा सुचारू और एकसमान हो जाता है, जिससे अर्थ खोए बिना इसे छोटा करना आसान हो जाता है।

2. "खराब नमूना" की समस्या (Unstable Calibration)

मॉडल को छोटा करने के लिए, आपको इसे संकुचित करना सिखाने के लिए कुछ "अभ्यास उदाहरण" (कैलिब्रेशन डेटा) दिखाने की आवश्यकता होती है।

  • समस्या: 3D डेटा पेचीदा है। यदि आप एक अजीब या टूटा हुआ अभ्यास उदाहरण (आउटलायर) चुनते हैं, तो मॉडल गलत नियम सीख लेता है। यह बर्फ से बनी सड़क पर कार चलाना सीखने की कोशिश करने जैसा है। यदि आप एक "सामान्य" सड़क चुनते हैं, तो आप अच्छी तरह से गाड़ी चलाना सीखते हैं। यदि आप गलत चुनते हैं, तो आप गलत सीखते हैं।
  • शोध पत्र का समाधान: उन्होंने Noise-Filtered Diverse Sampling बनाया।
    • चरण 1 (बाउंसर): वे अभ्यास उदाहरणों को स्कैन करते हैं और उन "अजीब" उदाहरणों (आउटलायर्स) को बाहर निकाल देते हैं जो वास्तविक 3D दृश्यों जैसे नहीं दिखते।
    • चरण 2 (समूहीकरण): केवल यादृच्छिक उदाहरण चुनने के बजाय, वे शेष उदाहरणों को इस आधार पर समूह में बांटते हैं कि एक फ्रेम से दूसरे फ्रेम में कैमरा कैसे चलता है (फ्रेम-अवेयर क्लस्टरिंग)। वे विभिन्न प्रकार के दृश्यों का एक संतुलित मिश्रण सुनिश्चित करते हैं।
    • परिणाम: मॉडल एक आदर्श, प्रतिनिधि सेट से सीखता है, इसलिए वह किसी भी स्थिति के लिए खुद को छोटा करने का सही तरीका जानता है।

परिणाम: "जेब वाला जादूगर"

इन दोनों ट्रिक्स को मिलाकर, लेखकों ने QuantVGGT बनाया।

  • पहले: मॉडल एक 16-बिट विशालकाय था, भारी और धीमा।
  • बाद में: मॉडल एक 4-बिट हल्का चैंपियन है।
  • प्रदर्शन: यह 2.5 गुना तेज़ चलता है और 3.7 गुना कम जगह लेता है।
  • सटीकता: इतने बड़े पैमाने पर सिकुड़ने के बावजूद, यह मूल विशालकाय की क्षमता के 98% तक प्रदर्शन करता है। यह एक फुल-साइज़ फेरारी इंजन को लॉन मूवर के इंजन के आकार में छोटा करने जैसा है, लेकिन फिर भी यह उतना ही तेज़ और सुचारू रूप से चलता है।

यह क्यों मायने रखता है

यह केवल जगह बचाने के बारे में नहीं है। इसका मतलब है कि निकट भविष्य में, आपके पास एक रोबोट या फोन हो सकता है जो वास्तविक समय में 3D स्थान को समझ सके।

  • ऑगमेंटेड रियलिटी (AR): आपके चश्मे वास्तविक दुनिया में तुरंत सटीक 3D मानचित्रों को ओवरले कर सकेंगे।
  • सेल्फ-ड्राइविंग कारें: वे जटिल 3D वातावरण को तेज़ी से और सस्ते में प्रोसेस कर सकेंगी।
  • रोबोटिक्स: रोबोट बिना किसी बड़े क्लाउड सर्वर फार्म की आवश्यकता के, अस्त-व्यस्त कमरों में नेविगेट कर सकेंगे।

संक्षेप में, लेखकों ने एक "सुपरकंप्यूटर मस्तिष्क" को सफलतापूर्वक एक "स्मार्टफोन मस्तिष्क" में संकुचित कर दिया है, बिना उसकी प्रतिभा को नुकसान पहुँचाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →