← नवीनतम पेपर
💬 NLP

SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments

SpatialEvo 3D स्थानिक तर्क (spatial reasoning) के लिए एक स्व-विकसित (self-evolving) ढांचा है जो अनएनोटेटेड दृश्यों से शून्य-शोर वाला ग्राउंड ट्रुथ (zero-noise ground truth) उत्पन्न करने के लिए नियत ज्यामितीय वातावरण (Deterministic Geometric Environments) का लाभ उठाता है, जिससे एक सह-विकसित प्रश्नकर्ता-समाधानकर्ता (questioner-solver) नीति को त्रुटिपूर्ण मॉडल सर्वसम्मति के बजाय वस्तुनिष्ठ भौतिक फीडबैक के माध्यम से गतिशील रूप से सुधारने में सक्षम बनाया जा सके।

मूल लेखक: Dinging Li, Yingxiu Zhao, Xinrui Cheng, Kangheng Lin, Hongbo Peng, Hongxing Li, Zixuan Wang, Yuhong Dai, Haodong Li, Jia Wang, Yukang Shi, Liang Zhao, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Weiming Lu
प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dinging Li, Yingxiu Zhao, Xinrui Cheng, Kangheng Lin, Hongbo Peng, Hongxing Li, Zixuan Wang, Yuhong Dai, Haodong Li, Jia Wang, Yukang Shi, Liang Zhao, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए लिविंग रूम में नेविगेट करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि उसे पता हो कि कॉफी टेबल सोफे से कितनी दूर है, या टीवी खोजने के लिए किस दिशा में मुड़ना है।

परंपरागत रूप से, रोबोट को यह सिखाने के लिए, इंसानों को हजारों फ्लैशकार्ड्स मैन्युअल रूप से लिखने पड़ते हैं: "यह एक कमरे की तस्वीर है। टेबल 2 मीटर दूर है। सोफा बाईं ओर है।" यह महंगा है, धीमा है, और अंततः, आपके पास लिखने के लिए नए फ्लैशकार्ड्स खत्म हो जाते हैं।

कुछ नए तरीके इस पर ध्यान केंद्रित करते हैं कि रोबिम खुद को सिखाए, जैसे कि वह उत्तरों का अनुमान लगाए और फिर पूछे, "क्या आप अपने ही अनुमान से सहमत हैं?" लेकिन यह एक छात्र द्वारा बिना उत्तर कुंजी (answer key) के अपना होमवर्क खुद जांचने जैसा है। यदि छात्र गलती करता है, तो वह खुद को विश्वास दिला सकता है कि वह सही है, और वह वास्तव में सुधार करना कभी नहीं सीख पाएगा। वे बस अपनी गलतियों को करने में बेहतर होते जाएंगे।

SpatialEvo रोबोट को स्थानिक तर्क (spatial reasoning) सिखाने का एक नया, स्मार्ट तरीका है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग करते हैं:

1. "परफेक्ट जज" (डिटरमिनिस्टिक ज्योमेट्रिक एनवायरनमेंट)

इस पेपर की सबसे बड़ी सफलता एक डिटरमिनिस्टिक ज्योमेट्रिक एनवायरनमेंट (DGE) का विचार है।

कल्पना कीजिए कि रोबोट एक वीडियो गेम की दुनिया (जैसे The Sims या Minecraft) के भीतर एक खेल खेल रहा है। एक वास्तविक वीडियो गेम में, कंप्यूटर दुनिया के सटीक गणित को जानता है। वह जानता है कि सोफा ठीक 2.5 मीटर दूर है क्योंकि उसने कोड के साथ उस कमरे का निर्माण किया है। उसे दूरी का "अनुमान" लगाने या "वोट" देने की आवश्यकता नहीं है; वह बस इसकी गणना करता है।

SpatialEvo इसी तथ्य का उपयोग करता है। रोबोट से यह पूछने के बजाय कि, "क्या आपको लगता है कि यह 2 मीटर है?", यह कंप्यूटर कोड (DGE) से पूछता है, "सटीक दूरी क्या है?"

  • रोबोट एक प्रश्न पूछता है: "लैंप कितनी दूर है?"
  • DGE (द जज) ब्लूप्रिंट की जांच करता है: "लैंप ठीक 1.4 मीटर दूर है।"
  • रोबोट उत्तर देता है: "1.4 मीटर।"
  • परिणाम: रोबोट को एक परफेक्ट, जीरो-एरर स्कोर मिलता है। कोई अनुमान नहीं, कोई पूर्वाग्रह नहीं।

यह हर एक बिना लेबल वाले 3D कमरे को पूर्ण अभ्यास समस्याओं के अनंत स्रोत में बदल देता है।

2. "इंटरव्यूअर और डिटेक्टिव" (को-इवोल्यूशन)

यह पेपर एक एकल AI मॉडल का उपयोग करता है जो एक साथ दो भूमिकाएँ निभाता है, जैसे कि एक व्यक्ति खुद का इंटरव्यू ले रहा हो:

  • भूमिका A: द इंटरव्यूअर (प्रश्नकर्ता)
    AI का यह हिस्सा एक कमरे को देखता है और एक अच्छा प्रश्न सोचने की कोशिश करता है जिसे पूछा जा सके। यह एक शिक्षक की तरह है जो क्विज़ बनाने की कोशिश कर रहा है। शुरुआत में, यह मूर्खतापूर्ण प्रश्न पूछ सकता है जैसे, "अदृश्य यूनिकॉर्न कहाँ है?" "परफेक्ट जज" (DGE) कहता है, "नहीं, यह असंभव है। फिर से प्रयास करें।" AI बेहतर, यथार्थवादी प्रश्न पूछना सीख जाता है।
  • भूमिका B: द डिटेक्टिव (सॉल्वर)
    AI का यह हिस्सा प्रश्न लेता है और उसे हल करने की कोशिश करता है। यह छवियों को देखता है और उत्तर खोजने के लिए तर्क का उपयोग करता है। यदि यह गलत होता है, तो जज इसे ठीक से बताता है कि क्यों (जैसे, "आपने गलत दीवार से दूरी की गणना की")।

मैजिक लूप:
"इंटरव्यूअर" ऐसे सवाल पूछने में बेहतर होता जाता है जिन्हें "डिटेक्टिव" हल कर सके। जैसे-जैसे "डिटेक्टिव" हल करने में स्मार्ट होता जाता है, यह "इंटरव्यूअर" को दुनिया को बेहतर समझने में मदद करता है। वे एक-दूसरे को बेहतर बनाते हैं, बिना किसी इंसान के एक भी फ्लैशकार्ड लिखे, वे स्मार्ट होते जाते हैं।

3. "पर्सनल ट्रेनर" (एडेप्टिव शेड्यूलर)

कल्पना कीजिए कि एक जिम ट्रेनर आपको वर्कआउट करते हुए देख रहा है। यदि आप वजन उठाने में बहुत अच्छे हैं लेकिन दौड़ने में खराब हैं, तो ट्रेनर आपसे और अधिक वजन उठाने के लिए नहीं कहता। वे कहते हैं, "ठीक है, आज दौड़ने पर ध्यान केंद्रित करते हैं।"

SpatialEvo में एक टास्क शेड्यूलर है जो वही करता है। यह AI पर नज़र रखता है:

  • "हे, तुम कुर्सियों को गिनने में बहुत अच्छे हो।" -> इसका अभ्यास करना बंद करो।
  • "तुम कैमरा किस दिशा में देख रहा है, यह समझने में बार-बार विफल हो रहे हो।" -> इस विशिष्ट कौशल का अभ्यास तब तक करें जब तक आप इसे सही न कर लें।

यह एक डायनेमिक करिकुलम बनाता है। AI स्वचालित रूप से अपने कमजोर क्षेत्रों पर ध्यान केंद्रित करता है, जिससे इसका प्रशिक्षण अविश्वसनीय रूप से कुशल हो जाता है।

यह एक बड़ी बात क्यों है?

  • कोई मानवीय बाधा नहीं: हमें अब डेटा को लेबल करने के लिए लोगों की सेना की आवश्यकता नहीं है। AI किसी भी 3D कमरे से सीख सकता है जिसमें डिजिटल मैप मौजूद है।
  • कोई बुरी आदतें नहीं: क्योंकि "जज" कंप्यूटर कोड (गणित) है, न कि स्वयं AI, इसलिए AI अपने ही गलतों को पुख्ता नहीं करता है। यह हमेशा सत्य सीखता है।
  • बेहतर परिणाम: परीक्षणों में, इस पद्धति ने AI मॉडल्स को स्थिर, मानव-निर्मित डेटासेट की तुलना में 3D स्थान (जैसे दूरी, दिशा और आकार) को समझने में काफी बेहतर बनाया है, और इस प्रक्रिया में अन्य दृश्य कार्यों को करने की उनकी क्षमता भी कम नहीं हुई।

संक्षेप में: SpatialEvo एक रोबोट को दुनिया के जादुई मानचित्र और एक पर्सनल ट्रेनर देने जैसा है। रोबोट एक ऐसा खेल खेलता है जहाँ वह प्रश्न पूछता है, सत्य के लिए मानचित्र की जाँच करता है, और ट्रेनर यह सुनिश्चित करता है कि वह सुधार के लिए ठीक उसी चीज़ का अभ्यास करे जिसकी उसे आवश्यकता है। यह एक स्व-सुधार लूप है जो कच्चे 3D डेटा को एक सुपर-स्मार्ट स्थानिक तर्क विशेषज्ञ में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →