← नवीनतम पेपर
🤖 AI

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

यह शोध पत्र C^2ROPE का प्रस्ताव करता है, जो एक नवीन पोजीशनल एनकोडिंग विधि है जो कार्टेशियन स्थानिक निर्देशांकों को टेम्पोरल इंडेक्स के साथ एकीकृत करती है और 3D लार्ज मल्टीमॉडल मॉडल्स में मानक रोटरी पोजीशन एम्बेडिंग की स्थानिक स्थानीयता हानि (spatial locality loss) और दीर्घकालिक क्षय (long-term decay) की सीमाओं को दूर करने के लिए चेबीशेव कॉज़ल मास्किंग (Chebyshev causal masking) का उपयोग करती है।

मूल लेखक: Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को 3D में "देखना" सिखाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक AI) को एक घर में रास्ता खोजने, खोई हुई चाबी ढूंढने या एक 3D कमरे के बारे में सवालों के जवाब देने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। ऐसा करने के लिए, आप रोबोट को एक लार्ज लैंग्वेज मॉडल (LLM) पर आधारित मस्तिष्क देते हैं—जो मूल रूप से एक सुपर-स्मार्ट टेक्स्ट प्रोसेसर है जो कहानियाँ लिखना और चैट करना जानता है।

समस्या क्या है? टेक्स्ट एक सीधी रेखा है। वाक्य बाएं से दाएं, एक के बाद एक शब्द के रूप में चलते हैं। लेकिन 3D स्पेस एक ग्रिड है। एक कमरे में ऊंचाई, चौड़ाई और गहराई होती है।

यह शोध पत्र तर्क देता है कि वर्तमान तरीका जिससे हम 3D छवियों को इन "टेक्स्ट दिमागों" में जबरदस्ती फिट करते हैं, वह त्रुटिपूर्ण है। लेखक इसे ठीक करने के लिए C2RoPE नामक एक नया समाधान प्रस्तावित करते हैं ताकि रोबोट स्थान (space) को बेहतर ढंग से समझ सके।


समस्या: "कन्वेयर बेल्ट" वाली गलती

एक 3D इमेज को टेक्स्ट-आधारित AI में फीड करने के लिए, कंप्यूटर को उस इमेज को छोटे-छोटे वर्गों (टोकन) की एक लंबी सूची में बदलना पड़ता है, जैसे किसी फोटो को फिल्म की एक पट्टी में बदलना।

वर्तमान विधि (जिसे RoPE कहा जाता है) इस पट्टी के साथ एक कन्वेयर बेल्ट जैसा व्यवहार करती है। यह वर्गों को 1, 2, 3, 4... नंबर देती है, जो पंक्ति दर पंक्ति (बाएं से दाएं, फिर ऊपर से नीचे) चलती है।

उपमा 1: "पड़ोसी" वाली समस्या (स्पेशियल लोकैलिटी लॉस)

कल्पना कीजिए कि आप एक थिएटर में बैठे हैं।

  • वास्तविक दुनिया में (3D स्पेस): जो व्यक्ति आपके ठीक दाईं ओर बैठा है, वह आपका पड़ोसी है। जो आपके ठीक पीछे है, वह भी आपका पड़ोसी है।
  • वर्तमान AI विधि में (RoPE): AI सीटों को कन्वेयर बेल्ट की तरह नंबर देता है।
    • आप सीट नंबर 10 हैं।
    • आपके दाईं ओर वाला व्यक्ति सीट नंबर 11 है। (बहुत बढ़िया, वे पड़ोसी हैं)।
    • लेकिन आपके पीछे वाला व्यक्ति? क्योंकि बेल्ट ने पंक्ति पूरी कर ली और अगली पंक्ति शुरू कर दी, वह सीट नंबर 100 है।
    • परिणाम: AI के लिए, आपके पीछे वाला व्यक्ति फिल्म के किसी बिल्कुल अलग हिस्से का अजनबी है, भले ही वह 3D स्पेस में आपके ठीक बगल में बैठा हो। AI वर्टिकल कॉलम के "पड़ोसी" वाले संबंध को खो देता है।

उपमा 2: "शुरुआत को भूल जाना" (विजुअल टोकन नेग्लेक्ट)

AI को कहानियों पर प्रशिक्षित किया जाता है। एक कहानी में, अंत आमतौर पर शुरुआत से अधिक महत्वपूर्ण होता है क्योंकि अंत में 'पंचलाइन' होती है। AI को सिखाया जाता है कि वह सबसे हालिया शब्दों पर सबसे अधिक ध्यान दे और पुराने शब्दों को अनदेखा करे।

जब AI एक 3D कमरे को देखता है, तो वह इमेज टोकन की हजारों संख्या देखता है।

  • क्योंकि AI सोचता है कि "हालिया = महत्वपूर्ण," वह इमेज स्ट्रिप के केवल अंतिम कुछ वर्गों पर ही ध्यान देता है।
  • वह इमेज के पहले 90% हिस्से को पूरी तरह से अनदेखा कर देता है (स्ट्रिप की शुरुआत), भले ही उस हिस्से में वह दरवाजा हो जिसे आपको खोलना है या वह कुर्सी हो जिस पर आपको बैठना है।
  • परिणाम: रोबोट कमरे के अधिकांश हिस्से के बारे में "भूलने की बीमारी" (amnesia) का शिकार हो जाता है।

समाधान: C2RoPE

लेखकों, गुआंटिंग ये (Guanting Ye) और उनकी टीम ने C2RoPE (कॉज़ल कंटीन्यूअस रोटरी पोजीशनल एनकोडिंग) नामक एक नई प्रणाली बनाई है। इसे रोबोट को एक बेहतर नक्शा देने के रूप में समझें।

सुधार #1: "3D आईडी कार्ड" (स्पैटियो-टेम्पोरल कंटीन्यूटी)

केवल प्रत्येक इमेज वर्ग को एक एकल नंबर (1, 2, 3...) देने के बजाय, C2RoPE उन्हें एक 3-भाग वाला आईडी कार्ड देता है:

  1. समय (Time): सूची में वह कहाँ है (पुराने सिस्टम की तरह)।
  2. X-कोऑर्डिनेट: वह कितना बाएं या दाएं है।
  3. Y-कोऑर्डिनेट: वह कितना ऊपर या नीचे है।

उपमा: कल्पना कीजिए कि कन्वेयर बेल्ट के बजाय, आपके पास एक सिटी ग्रिड (शहर का जाल) है।

  • यदि आप "1st स्ट्रीट और 1st एवेन्यू" पर हैं, तो AI जानता है कि आप "1st स्ट्रीट और 2nd एवेन्यू" के ठीक बगल में हैं।
  • वह यह भी जानता है कि आप "2nd स्ट्रीट और 1st एवेन्यू" के ठीक बगल में हैं।
  • X और Y कोऑर्डिनेट्स को बनाए रखकर, AI कभी भी यह ट्रैक नहीं खोता कि वास्तविक 3D दुनिया में कौन "पड़ोसी" है, भले ही वे सूची में एक-दूसरे से दूर हों।

सुधार #2: "चेबिशेव डिस्टेंस" नियम (कॉज़ल मास्किंग)

पुराने सिस्टम ने माना कि "सूची में जो बाद में आता है वह अधिक महत्वपूर्ण है।" नया सिस्टम कहता है, "जो भौतिक रूप से कमरे में करीब है, वह अधिक महत्वपूर्ण है।"

वे चेबिशेव डिस्टेंस (Chebyshev distance) नामक एक गणितीय अवधारणा का उपयोग करते हैं (इसे शतरंज के राजा की चाल की तरह समझें जो किसी भी दिशा में, तिरछे भी, एक वर्ग चल सकता है)।

  • नियम: AI को निर्देश दिया जाता है कि वह इमेज के टुकड़ों पर ध्यान दे कि वे इमेज के केंद्र से कितनी दूर हैं, न कि केवल इस पर कि वे सूची में कितने पीछे हैं।
  • परिणाम: AI इमेज की शुरुआत को अनदेखा करना बंद कर देता है। वह समझ जाता है कि इमेज की "शुरुआत" (कमरे का बायां हिस्सा) उतनी ही कॉज़ली महत्वपूर्ण है जितना कि "अंत" (दायां हिस्सा)। वह दरवाजे को इसलिए नहीं भूलता क्योंकि उसे सबसे पहले स्कैन किया गया था।

परिणाम: एक स्मार्ट रोबोट

लेखकों ने इसका परीक्षण प्रसिद्ध 3D बेंचमार्क (जैसे ScanQA और SQA3D) पर किया, जो रोबोट के लिए परीक्षाओं की तरह हैं ताकि यह देखा जा सके कि क्या वे 3D कमरों के बारे में सवालों के जवाब दे सकते हैं।

  • C2RoPE से पहले: रोबोट कमरे को देखता, आधा भूल जाता, और गलत अनुमान लगाता। (जैसे, "क्या सिंक बाईं ओर है?" -> "मुझे नहीं पता, शायद दाईं ओर?")।
  • C2RoPE के बाद: रोबोट पूरे कमरे को याद रखता है, लेआउट को समझता है, और सही उत्तर देता है।

संक्षेप में:
यह शोध पत्र उस बग (bug) को ठीक करता है जहाँ AI रोबोट 3D कमरों के साथ कागज की लंबी, सपाट पट्टियों जैसा व्यवहार कर रहे थे, जिससे वे पड़ोसियों का ट्रैक खो देते थे और दृश्य की शुरुआत को भूल जाते थे। C2RoPE AI को एक वास्तविक 3D मानचित्र देता है, यह सुनिश्चित करता है कि वह समझ सके कि "ऊपर" का "नीचे" के बगल में है और कमरे की शुरुआत उतनी ही महत्वपूर्ण है जितना कि अंत। यह रोबोट को वास्तविक दुनिया में नेविगेट करने और तर्क करने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →