← नवीनतम पेपर
💻 computer science

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

यह शोध पत्र QuatRoPE को प्रस्तुत करता है, जो एक स्केलेबल पोजीशनल एम्बेडिंग विधि है जो लीनियर कॉम्प्लेक्सिटी के साथ अटेंशन डॉट प्रोडक्ट्स के माध्यम से स्पष्ट रूप से पेयरवाइज 3D स्थानिक संबंधों की गणना करती है, और इसके साथ ही एक आइसोलेटेड गेटेड RoPE एक्सटेंशन (IGRE) भी प्रदान करती है ताकि मूल LLM क्षमताओं को संरक्षित किया जा सके, जिससे पिछले दृष्टिकोणों की स्केलेबिलिटी या फिडेलिटी संबंधी समस्याओं के बिना एम्बोडीड एजेंट्स में स्थानिक तर्क क्षमता को बढ़ाया जा सके।

मूल लेखक: Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu

प्रकाशित 2026-03-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक रोबोट को 3D में "देखना" सिखाना

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल या LLM) को एक बिखरे हुए लिविंग रूम में नेविगेट करना सिखा रहे हैं। आप उसे इस तरह के निर्देश देना चाहते हैं: "लाल मग उठाओ जो लैंप के बगल में मेज पर रखा है।"

इसे करने के लिए, रोबोट को स्पेशियल रीजनिंग (Spatial Reasoning) की आवश्यकता है: यानी यह समझने की क्षमता कि चीजें एक-दूसरे के सापेक्ष कहाँ हैं, न कि केवल वे कैसी दिखती हैं।

समस्या क्या है? अधिकांश रोबोट टेक्स्ट पढ़ने में तो माहिर होते हैं लेकिन 3D स्पेस को समझने में बहुत खराब होते हैं। उन्हें स्वाभाविक रूप से यह नहीं पता होता कि "बगल में" का अर्थ 3D स्पेस में "पास होना" है।

समस्या: स्पेस सिखाने के दो बुरे तरीके

यह पेपर बताता है कि रोबोट को यह कौशल सिखाने के पिछले प्रयासों में दो बड़ी कमियां थीं:

  1. "जीपीएस कोऑर्डिनेट्स" वाला दृष्टिकोण (Absolute Position):

    • यह कैसे काम करता था: शोधकर्ताओं ने रोबोट को हर वस्तु के सटीक X, Y और Z कोऑर्डिनेट्स दिए (जैसे, "कुर्सी 5.2, 3.1, 0.8 पर है")।
    • खामी: एक इंसान को यह बताने की कल्पना करें, "कप 100, 200, 50 कोऑर्डिनेट्स पर है।" बिना किसी मैप के, इस नंबर का कोई मतलब नहीं है। एक 3D कमरे में, "ओरिजिन" (0,0,0) मनमाना होता है। रोबोट को यह समझने के लिए बहुत कड़ी मेहनत करनी पड़ती है कि "100, 200, 50" क्या "102, 201, 50" के बगल में है। यह ऐसा है जैसे हर बार कप उठाने के लिए आपको एक गणितीय पहेली हल करनी पड़े।
    • परिणाम: रोबोट भ्रमित हो जाता है और वस्तुओं के बीच के संबंधों को पहचानने में चूक जाता है।
  2. "हर संबंध को सूचीबद्ध करना" वाला दृष्टिकोण (Quadratic Scaling):

    • यह कैसे काम करता था: शोधकर्ताओं ने रोबोट को स्पष्ट रूप से हर एक संबंध बताने की कोशिश की: "कुर्सी मेज के बगल में है। मेज लैंप के बगल में है। लैंप सोफे के बगल में है..."
    • खामी: यदि आपके पास 10 वस्तुएं हैं, तो आपको 100 संबंध सूचीबद्ध करने होंगे। यदि आपके पास 1,000 वस्तुएं हैं (जैसे एक व्यस्त कमरे में), तो आपको दस लाख संबंध सूचीबद्ध करने होंगे!
    • परिणाम: इससे "डेटा विस्फोट" (Data Explosion) हो जाता है। रोबोट का दिमाग (LLM) अभिभूत हो जाता है और उसकी मेमोरी खत्म हो जाती है। इसे ठीक करने के लिए, पिछले तरीकों ने "दूर की" वस्तुओं को हटा देने की कोशिश की, लेकिन यह जोखिम भरा है क्योंकि कभी-कभी सबसे महत्वपूर्ण वस्तु दूर होती है।

समाधान: QuatRoPE (एक "जादुई कंपास")

लेखकों ने एक नया तरीका प्रस्तावित किया जिसे QuatRoPE कहा जाता है। इसे एक रोबोट को जीपीएस कोऑर्डिनेट या संबंध की सूची देने के बजाय एक जादुई कंपास देने के रूप में सोचें।

यह इस प्रकार काम करता है, एक उपमा (Analogy) का उपयोग करते हुए:

  • सेटअप: दूरियों की सूची देने के बजाय, हम हर वस्तु के टोकन (डिजिटल प्रतिनिधित्व) के साथ एक विशेष "रोटेशन" जोड़ते हैं।
  • जादू: जब रोबोट का दिमाग दो वस्तुओं (जैसे, एक कुर्सी और एक मेज) को देखता है और यह तय करने की कोशिश करता है कि प्रत्येक पर कितना ध्यान दिया जाए, तो वह एक विशेष गणितीय ऑपरेशन (एक "डॉट प्रोडक्ट") करता है।
  • परिणाम: इस विशेष "रोटेशन" (उपयोग करके जिसे क्वाटरनियंस/Quaternions कहा जाता है, जो 3D कंपास की तरह हैं) के कारण, गणित स्वचालित रूप से पूर्ण स्थिति (absolute position) को रद्द कर देता है।
    • उपमा: कल्पना कीजिए कि दो लोग विशेष चश्मे पहने हुए हैं। जब वे एक-दूसरे को देखते हैं, तो उनके चश्मे स्वचालित रूप से उनके बीच की दूरी की गणना करते हैं, चाहे वे दुनिया में कहीं भी खड़े हों। यदि वे पास हैं, तो उनके चश्मे चमक उठते हैं। यदि वे दूर हैं, तो उनके चश्मे मंद रहते हैं।
  • यह बेहतर क्यों है:
    • लीनियर स्केल (Linear Scale): आपको केवल प्रति वस्तु एक "कंपास" की आवश्यकता है। यदि आपके पास 1,000 वस्तुएं हैं, तो आपके पास केवल 1,000 टोकन हैं। कोई डेटा विस्फोट नहीं!
    • होलिस्टिक (Holistic): यह 3D स्पेस को एक संपूर्ण इकाई के रूप में देखता है। यह उन वस्तुओं से धोखा नहीं खाता जो एक अक्ष (जैसे X) पर पास हैं लेकिन दूसरे अक्ष (जैसे Y) पर दूर हैं। यह वास्तविक 3D दूरी को देखता है।

साइडकिक: IGRE (एक "नॉइज़-कैंसलिंग हेडफ़ोन")

एक पेच था। रोबोट के दिमाग (LLM) में पहले से ही शब्दों के क्रम को समझने के लिए एक अंतर्निहित प्रणाली (जिसे RoPE कहा जाता है) है। यदि आप केवल 3D "जादुई कंपास" को शब्द-क्रम प्रणाली के ऊपर जोड़ देते हैं, तो वे एक-दूसरे से लड़ने लगते हैं, जैसे दो लोग एक ही समय में अलग-अलग भाषाएं बोलने की कोशिश कर रहे हों।

इसे ठीक करने के लिए, लेखकों ने IGRE (Isolated Gated RoPE Extension) बनाया।

  • उपमा: कल्पना कीजिए कि रोबोट का दिमाग एक व्यस्त कार्यालय है।
    • भाषा RoPE मेल (शब्दों) को व्यवस्थित करने वाला एक सचिव है।
    • QuatRoPE फर्नीचर को व्यवस्थित करने वाला एक सुरक्षा गार्ड है।
    • समस्या: यदि सुरक्षा गार्ड मेल को व्यवस्थित करने की कोशिश करता है, तो अराजकता फैल जाती है।
    • IGRE समाधान: वे एक कांच की दीवार बनाते हैं। सुरक्षा गार्ड (QuatRoPE) केवल फर्नीचर टोकन पर काम करता है। सचिव (Language RoPE) केवल टेक्स्ट टोकन पर काम करता है। वे एक-दूसरे में हस्तक्षेप नहीं करते हैं।
    • "गेट" (Gate): यह सिस्टम केवल तभी "दूरी की गणना" होने देता है जब दो वस्तुएं एक-दूसरे से बात कर रही होती हैं। यदि एक शब्द एक वस्तु से बात कर रहा है, तो दूरी की गणना बंद (gated) कर दी जाती है, ताकि रोबोट भ्रमित न हो।

"सत्य परीक्षण": ASR बेंचमार्क

लेखकों ने महसूस किया कि मौजूदा परीक्षण "चीटिंग" कर रहे थे।

  • पुराना टेस्ट: "वह लाल कुर्सी कहाँ है?"
  • चीटिंग: रोबोट को स्थानिक तर्क (spatial reasoning) की आवश्यकता नहीं थी; उसे बस यह जानने की आवश्यकता थी कि "लाल" एक रंग है और एकमात्र लाल कुर्सी को ढूंढना था। उसने वास्तव में "मेज के नीचे" को नहीं समझा।

इसे ठीक करने के लिए, उन्होंने ASR (Attribute-free Spatial Reasoning) बेंचमार्क बनाया।

  • नया टेस्ट: "कुर्सी कहाँ है?" (कोई रंग, कोई आकार, कोई आकार नहीं बताया गया)।
  • लक्ष्य: रोबोट को स्थानिक संकेतों (जैसे "लैंप के बगल में") का उपयोग करना ही होगा। यदि वह विफल रहता है, तो वह असफल माना जाएगा। यह साबित करता है कि रोबोट वास्तव में 3D स्पेस में सोच रहा है, न कि केवल रंगों के आधार पर अनुमान लगा रहा है।

परिणाम

जब उन्होंने इस नई प्रणाली का परीक्षण किया:

  1. यह स्मार्ट हुआ: रोबोट ने पहले की तुलना में स्थानिक पहेलियों को बहुत बेहतर ढंग से हल किया।
  2. यह तेज़ था: यह बड़े कमरों से अभिभूत नहीं हुआ।
  3. यह मनुष्यों को बेहतर समझता था: रोबोट ने मानवीय अनुमान लगाना शुरू कर दिया। उदाहरण के लिए, यदि वहां दो खिड़कियां हैं, और आप कहते हैं "दरवाजे के बाईं ओर वाली खिड़की," तो रोबोट सही ढंग से उस खिड़की को चुनता है जो दरवाजे के सबसे करीब है, जो निहित अर्थ को समझता है, बिल्कुल वैसे ही जैसे एक इंसान करेगा।

सारांश

QuatRoPE AI को यह सिखाने का एक नया तरीका है कि 3D स्पेस को कैसे समझा जाए। इसे भ्रमित करने वाले कोऑर्डिनेट्स या संबंधों की भारी-भरकम सूचियों के बजाय, यह हर वस्तु को एक "जादुई कंपास" देता है जो स्वचालित रूप से गणना करता है कि चीजें एक-दूसरे के कितने करीब हैं। IGRE यह सुनिश्चित करता है कि यह नया कौशल AI की पढ़ने और बोलने की क्षमता को बाधित न करे। परिणाम स्वरूप, एक ऐसा रोबोट मिलता है जो वास्तव में एक कमरे में नेविगेट कर सकता है और चीजों को उनके स्थान के आधार पर ढूंढ सकता है, न कि केवल उनके दिखने के आधार पर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →