← नवीनतम पेपर
💻 computer science

OpenWorldLib: A Unified Codebase and Definition of Advanced World Models

यह शोध पत्र OpenWorldLib को प्रस्तुत करता है, जो एक एकीकृत इन्फरेंस फ्रेमवर्क है जो कुशल पुन: उपयोग और सहयोगात्मक अनुसंधान को सुगम बनाने के लिए धारणा (perception), अंतःक्रिया (interaction) और दीर्घकालिक स्मृति (long-term memory) के आधार पर उन्नत वर्ल्ड मॉडल्स की एक मानकीकृत परिभाषा और व्यवस्थित वर्गीकरण स्थापित करता है।

मूल लेखक: DataFlow Team, Bohan Zeng, Daili Hua, Kaixin Zhu, Yifan Dai, Bozhou Li, Yuran Wang, Chengzhuo Tong, Yifan Yang, Mingkun Chang, Jianbin Zhao, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Junbo Niu, Z
प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: DataFlow Team, Bohan Zeng, Daili Hua, Kaixin Zhu, Yifan Dai, Bozhou Li, Yuran Wang, Chengzhuo Tong, Yifan Yang, Mingkun Chang, Jianbin Zhao, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Junbo Niu, Zimo Meng, Tianyi Bai, Meiyi Qiang, Huanyao Zhang, Zhiyou Xiao, Tianyu Guo, Qinhan Yu, Runhao Zhao, Zhengpin Li, Xinyi Huang, Yisheng Pan, Yiwen Tang, Yang Shi, Yue Ding, Xinlong Chen, Hongcheng Gao, Minglei Shi, Jialong Wu, Zekun Wang, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Yiren Song, Mike Zheng Shou, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को हमारे वास्तविक संसार में रहना सिखाने की कोशिश कर रहे हैं। आप उसे केवल किसी वीडियो गेम का नक्शा नहीं दे सकते; वास्तविक दुनिया अव्यवस्थित, अप्रत्याशित और ऐसी चीजों से भरी है जो बिना चेतावनी के टूट सकती हैं, हिल सकती हैं या बदल सकती हैं।

लंबे समय से, AI शोधकर्ता "वर्ल्ड मॉडल्स" (World Models) बना रहे हैं—ऐसे सिस्टम जो यह समझने की कोशिश करते हैं कि दुनिया कैसे काम करती है ताकि वे भविष्यवाणी कर सकें कि आगे क्या होगा। लेकिन हर कोई इन मॉडल्स को अपने तरीके से बना रहा था, अलग-अलग नियमों, अलग-अलग भाषाओं और अलग-अलग उपकरणों का उपयोग करके। यह ऐसा था जैसे हर कोई एक अलग ब्लूप्रिंट का उपयोग करके घर बना रहा हो; कोई भी आसानी से सामग्री साझा नहीं कर सकता था या एक-दूसरे की मदद नहीं कर सकता था।

OpenWorldLib वह शोध पत्र (paper) है जो कहता है, "आइए हम पहिए का पुनरुद्धार करना बंद करें और एक सार्वभौमिक टूलकिट (universal toolkit) बनाएं।"

यहाँ इस पेपर का एक सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: AI का "टावर ऑफ बेबेल" (The "Tower of Babel" of AI)

अभी, यदि एक टीम एक ऐसा रोबोट बनाती है जो यह अनुमान लगा सकता है कि एक गेंद कैसे उछलती है, और दूसरी टीम एक ऐसा रोबोट बनाती है जो यह अनुमान लगा सकता है कि एक कार कैसे चलती है, तो वे अक्सर एक-दूसरे से बात नहीं कर पाते हैं। वे अलग-अलग कोड, अलग-अलग डेटा फॉर्मेट और "वर्ल्ड मॉडल" की अलग-अलग परिभाषाओं का उपयोग करते हैं।

पेपर का समाधान: लेखकों ने OpenWorldLib बनाया है, जो AI के लिए एक यूनिवर्सल अडैप्टर प्लग या LEGO निर्देश पुस्तिका की तरह है। यह इन जटिल प्रणालियों को बनाने का एक एकल, मानकीकृत तरीका प्रदान करता है ताकि शोधकर्ता आसानी से पुर्जों को बदल सकें, कोड साझा कर सकें और देख सकें कि वास्तव में क्या काम करता है और क्या नहीं।

2. "वर्ल्ड मॉडल" क्या है? ("क्रिस्टल बॉल" बनाम "मस्तिष्क")

यह पेपर एक आम गलतफहमी को स्पष्ट करता है।

  • यह क्या नहीं है: केवल एक शानदार वीडियो जनरेटर। यदि कोई AI केवल उड़ते हुए ड्रैगन का एक सुंदर वीडियो बना सकता है, तो यह अच्छी बात है, लेकिन यह वर्ल्ड मॉडल नहीं है। यह एक जादूगर की तरह है जो टोपी से खरगोश निकालता है; आपको यह नहीं पता कि खरगोश वहाँ कैसे पहुँचा या क्या वह वास्तव में वास्तविक दुनिया में जीवित रह सकता है।
  • यह क्या है: एक ऐसा सिस्टम जो अनुभव करता है (देखता/सुनता है), याद रखता है (दीर्घकालिक स्मृति), तर्क करता है (कारण और प्रभाव को समझता है), और परस्पर क्रिया करता है (कार्रवाई करता है)।
    • उदाहरण: एक वर्ल्ड मॉडल को कंप्यूटर के भीतर रहने वाले एक सिम्युलेटेड मस्तिष्क के रूप में सोचें। यह केवल एक फिल्म नहीं देखता; यह फिल्म के भीतर जीता है। यदि आप इसे कप को धक्का देने के लिए कहते हैं, तो यह समझ जाता है कि कप गिर सकता है, टूट सकता है, या लुढ़क सकता है, और यह अगली बार के लिए इसे याद रखता है।

3. OpenWorldLib का "किचन" (The Framework)

लेखकों ने OpenWorldLib को एक मॉड्यूलर किचन के रूप में डिज़ाइन किया है जहाँ आप किसी भी प्रकार की "विश्व बुद्धिमत्ता" (world intelligence) पका सकते हैं। उन्होंने सिस्टम को पांच मुख्य स्टेशनों (मॉड्यूल) में विभाजित किया है, जिनमें से प्रत्येक का एक विशिष्ट कार्य है:

  • द ऑपरेटर (वेटर): यह पहली चीज़ है जिसे आप देखते हैं। आप इसे एक अव्यवस्थित ऑर्डर देते हैं (एक टेक्स्ट प्रॉम्प्ट, एक वीडियो, एक सेंसर रीडिंग)। ऑपरेटर इसे साफ करता है, इसकी जांच करता है कि क्या यह वैध है, और इसे सही शेफ को सौंप देता है। यह सुनिश्चित करता है कि किचन खराब सामग्री से जाम न हो जाए।
  • द रीजनिंग मॉड्यूल (शेफ का मस्तिष्क): यहाँ सोचने की प्रक्रिया होती है। यह सामग्रियों को देखता है और पूछता है, "यदि मैं इन्हें मिलाता हूँ, तो क्या होगा?" यह स्थानिक तर्क (क्या कप मेज पर है?), श्रव्य तर्क (क्या वह सायरन है?), और सामान्य समझ को संभालता है।
  • द सिंथेसिस मॉड्यूल (कलाकार): यह वह हिस्सा है जो आउटपुट बनाता है। यदि मस्तिष्क निर्णय लेता है कि "कप गिरता है," तो यह मॉड्यूल वास्तव में कप गिरने का वीडियो बनाता है, गिरने की आवाज़ पैदा करता है, या रोबोटिक हाथ को पकड़ने के लिए संकेत भेजता है। यह वीडियो, ऑडियो या रोबोटिक मूवमेंट बना सकता है।
  • द रिप्रेजेंटेशन मॉड्यूल (वास्तुकार): कभी-कभी, केवल एक वीडियो बनाना पर्याप्त नहीं होता। आपको एक 3D मानचित्र की आवश्यकता होती है। यह मॉड्यूल कमरे का एक संरचित 3D मॉडल (जैसे एक वीडियो गेम लेवल) बनाता है ताकि AI भौतिक रूप से वहां नेविगेट कर सके, न कि केवल दृश्य रूप से।
  • द मेमोरी मॉड्यूल (डायरी): यह महत्वपूर्ण है। स्मृति के बिना, AI पलक झपकते ही सब कुछ भूल जाता है। यह मॉड्यूल सब कुछ लिख देता है: "मैंने दोपहर 2:00 बजे लाल ब्लॉक को धक्का दिया, और वह गिर गया।" यह AI को अतीत से सीखने और भविष्य की योजना बनाने की अनुमति देता है।

4. "पाइपलाइन" (The Pipeline - असेंबली लाइन)

ये सभी मॉड्यूल एक पाइपलाइन द्वारा जुड़े हुए हैं। इसे एक फैक्ट्री में कन्वेयर बेल्ट के रूप में सोचें।

  1. आप बेल्ट पर एक कच्चा विचार डालते हैं।
  2. ऑपरेटर इसे साफ करता है।
  3. मेमोरी संदर्भ के लिए डायरी की जाँच करती है।
  4. रीजनिंग मस्तिष्क योजना बनाता है।
  5. सिंथेसिस और रिप्रेजेंटेशन मॉड्यूल परिणाम का निर्माण करते हैं।
  6. मेमोरी नए परिणाम के साथ डायरी को अपडेट करती है।

5. यह क्यों मायने रखता है?

OpenWorldLib से पहले, यदि आप एक नए रोबोट मस्तिष्क का परीक्षण करना चाहते थे, तो आपको पूरी फैक्ट्री को शून्य से बनाना पड़ता था। अब, OpenWorldLib के साथ, आप बस "ब्रेन" मॉड्यूल या "मेमोरी" मॉड्यूल को बदल सकते हैं और देख सकते हैं कि यह कैसा प्रदर्शन करता है।

बड़ी तस्वीर:
इस पेपर का अंतिम लक्ष्य AI को "रेत के डिब्बे में खेलने" (केवल शानदार वीडियो बनाना) से हटाकर "वास्तविक दुनिया में जीने" की ओर ले जाना है। इन प्रणालियों को बनाने के तरीके को मानकीकृत करके, लेखक उन AI एजेंटों के निर्माण को तेज करने की आशा करते हैं जो वास्तव में भौतिकी को समझते हैं, हमारे इतिहास को याद रखते हैं, और हमें जटिल वास्तविक दुनिया के कार्यों—जैसे कार चलाना, अस्पताल में मदद करना, या मंगल ग्रह की खोज करना—में नेविगेट करने में मदद कर सकते हैं।

संक्षेप में: OpenWorldLib वह निर्देश पुस्तिका और टूलकिट है जो वैज्ञानिकों को ऐसे AI बनाने में मदद करता है जो दुनिया को केवल देखता नहीं है, बल्कि उसे समझता है और उसके साथ परस्पर क्रिया करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →