← नवीनतम पेपर
🤖 AI

Emergence of Physical Intelligence via Controllable Information Production

यह शोध पत्र कंट्रोलेबल इंफॉर्मेशन प्रोडक्शन (CIP) प्रस्तुत करता है, जो डायनेमिकल सिस्टम्स और ऑप्टिमल कंट्रोल पर आधारित एक नवीन इंट्रिन्सिक मोटिवेशन फ्रेमवर्क है जो फिजिकल इंटेलिजेंस को इंफॉर्मेशन प्रोडक्शन के साथ एकीकृत करता है, जिससे एजेंटों को सिस्टम को कंट्रोलेबल केओस (controllable chaos) के किनारे की ओर ले जाकर ह्यूमनॉइड सेल्फ-राइटिंग जैसे जटिल कार्यों में महारत हासिल करने में सक्षम बनाया जा सके।

मूल लेखक: Tristan Shah, Stas Tiomkin

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Shah, Stas Tiomkin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं, लेकिन आप उसे कोई चीट शीट या रिवॉर्ड सिस्टम देने से इनकार कर देते हैं। आप उसे यह नहीं कहेंगे, "खड़े हो जाओ और कुकी खाओ," या "आगे बढ़ो और एक पॉइंट प्राप्त करो।" आप चाहते हैं कि रोबोट खुद ही दुनिया के साथ बातचीत करके यह सीख जाए कि कैसे उपयोगी बनना है। यह इंट्रिन्सिक मोटिवेशन (Intrinsic Motivation - IM) की चुनौती है: एक एजेंट को बिना किसी मानवीय निर्देश के, केवल दुनिया के साथ अंतःक्रिया (interaction) करके सीखने के लिए प्रेरित करना।

इसके पिछले प्रयास कुछ इस तरह थे जैसे किसी कुत्ते को उन चीजों के आधार पर सिखाना जो आप अंदाज़ा लगाते हैं कि उसे दिलचस्प लग सकती हैं। शोधकर्ताओं ने कुछ विशिष्ट चीजें चुनीं जिन्हें मापा जा सके (जैसे "रोबोट अपने हाथ को कितना हिला रहा है?") और रोबोट को उन्हें अधिकतम करने के लिए कहा। लेकिन यह मानवीय पूर्वाग्रह (human bias) पैदा करता है; रोबोट केवल वही सीखता है जो इंसान को दिलचस्प लगा, न कि वह जो वास्तव में स्थिति के भौतिक विज्ञान (physics) का मूल आधार है।

यह पेपर इस काम को करने का एक नया, अधिक स्पष्ट तरीका पेश करता है जिसे कंट्रोलेबल इंफॉर्मेशन प्रोडक्शन (Controllable Information Production - CIP) कहा जाता है।

मुख्य विचार: "अराजक तंग रस्सी" (The Chaotic Tightrope)

एक रोबलेट को तंग रस्सी पर चलने वाले (tightrope walker) के रूप में देखें।

  • बहुत स्थिर (Too stable): यदि चलने वाला एक चौड़े, सपाट मंच पर खड़ा है, तो वह बहुत कुछ नहीं कर रहा है। वह सीख नहीं रहा है, और वह वास्तव में "नियंत्रण में" भी नहीं है क्योंकि कुछ भी गलत नहीं हो सकता।
  • बहुत अराजक (Too chaotic): यदि वह बिना रस्सी के एक जंगली, तूफानी समुद्र में है, तो वह बस हाथ-पैर मार रहा है। वह बहुत सारी "सूचना" (रैंडम मूवमेंट) पैदा कर रहा है, लेकिन वह उसे नियंत्रित नहीं कर सकता। वह बस गिर रहा है।
  • सही संतुलन (The Sweet Spot): सबसे दिलचस्प, बुद्धिमान व्यवहार अराजकता के किनारे (edge of chaos) पर होता है। यह एक तेज़ हवा में तंग रस्सी पर चलने जैसा है। चलने वाला लगातार सीधा रहने के लिए संघर्ष कर रहा है। वह बहुत सारी "सूचना" (छोटे समायोजन, डगमगाहट, सुधार) पैदा कर रहा है, लेकिन वह उसे नियंत्रित (control) भी कर रहा है।

लेखकों का तर्क है कि वास्तविक भौतिक बुद्धिमत्ता (physical intelligence) या तो उबाऊ रूप से स्थिर होने के बारे में नहीं है या जंगली रूप से अराजक होने के बारे में नहीं है। यह उस बिंदु के बारे में है जहाँ सिस्टम इतना अस्थिर है कि वह दिलचस्प हो, लेकिन इतना नियंत्रणीय भी है कि उसे साधा जा सके।

"कंट्रोलेबल इंफॉर्मेशन प्रोडक्शन" क्या है?

सरल शब्दों में, CIP एक तरीका है जिससे रोबोट खुद से पूछता है: "अगर मैं इसे नियंत्रित करने की कोशिश करूं, तो मैं दुनिया को कितना बदल सकता हूँ?"

  1. पुराना तरीका (द बायस्ड टीचर): पिछले तरीकों में रोबोट से "विविधता" या "जिज्ञासा" को अधिकतम करने के लिए कहा जाता था। यह एक शिक्षक की तरह है जो कहता है, "जाओ और सबसे रंगीन चीजें ढूंढो!" रोबोट केवल अलग-अलग रंगों को देखने के लिए गोल-गोल घूम सकता है, जो कि बहुत उपयोगी नहीं है।
  2. नया तरीका (CIP): यह तरीका रोबोट को विशिष्ट चीजों की तलाश करने के लिए नहीं कहता। इसके बजाय, यह मापता है कि रोबोट कितनी तेज़ी से ऐसी नई, अप्रत्याशित स्थितियाँ बनाता है जिन्हें वह अभी भी ठीक कर सकता है।

कल्पना कीजिए कि एक बच्चा ब्लॉक के ढेर के साथ खेल रहा है।

  • यदि ब्लॉक का ढेर पहले से ही ज़मीन पर है, तो बच्चा बहुत कुछ नहीं कर सकता (कम सूचना उत्पादन)।
  • यदि बच्चा तुरंत पूरे टॉवर को गिरा देता है, तो वह गिरने को नियंत्रित नहीं कर सकता (उच्च अराजकता, कम नियंत्रण)।
  • लेकिन यदि बच्चा सावधानी से टॉवर को संतुलित करता है, जिससे वह डगमगाता है और उसे गिरने से बचाने के लिए अपने हाथों को समायोजित करता है, तो वह "CIP ज़ोन" में है। वह बहुत सारा जटिल, बदलता हुआ डेटा (डगमगाहट) उत्पन्न कर रहा है, लेकिन परिणाम को नियंत्रित करने वाला वही है।

यह कैसे काम करता है (जादुई ट्रिक)

यह पेपर इस विचार को ऑप्टिमल कंट्रोल (Optimal Control) से जोड़ता है, जो वह गणित है जिसका उपयोग कार चलाने या विमान उड़ाने के सर्वोत्तम तरीके को समझने के लिए किया जाता है।

लेखकों ने एक छिपा हुआ संबंध खोजा है: गणित जो रोबोट को स्थिर रहने के बारे में बताता है (वैल्यू फंक्शन), वह गुप्त रूप से आपको यह भी बताता है कि कितनी "नियंत्रणीय अराजकता" (controllable chaos) हो रही है।

  • उन्होंने पाया कि बिना यह अनुमान लगाए कि किन चरों (variables) को मापना है, इस "अराजकता दर" की गणना कैसे की जाए।
  • उन्होंने एक तेज़, स्थिर कैलकुलेटर (एक एल्गोरिदम) बनाया जो इस गणित को जटिल रोबोटों पर भी चला सकता है, जो पहले बहुत कठिन था।

परिणाम: खड़े होने वाले रोबोट

शोधकर्ताओं ने कई रोबोट सिमुलेशन पर इसका परीक्षण किया, जिनमें शामिल हैं:

  • कार्ट पोल्स (Cart Poles): एक चलते हुए कार्ट पर एक डंडा।
  • डबल और ट्रिपल पेंडुलम (Double and Triple Pendulums): डंडों से लटके हुए डंडे, जो बहुत कठिन होते हैं क्योंकि वे बेतहाशा झूलते हैं।
  • गिबोन (A Gibbon): एक रोबोट जो एक बार (bar) से लटके हुए इंसान की तरह दिखता है, जो खुद को ऊपर खींचकर खड़ा होने की कोशिश कर रहा है।

परिणाम:
बिना किसी मानवीय पुरस्कार या निर्देश के, CIP का उपयोग करने वाले रोबोटों ने सीखा कि कैसे:

  • डंडों को ऊपर की ओर झुकाकर संतुलित किया जाए।
  • लटकने वाली स्थिति से खड़े होने की स्थिति तक खुद को खींचा जाए (सेल्फ-राइटिंग)।

अन्य तरीकों (जैसे "जिज्ञासा" या "विविधता" खोजने वाले) ने ज्यादातर विफल होकर दिखाया। वे लूप में फंस गए या स्थिर स्थिति को संभालने में सक्षम नहीं थे। हालाँकि, CIP रोबोट स्वाभाविक रूप से सीधी स्थिति की ओर आकर्षित हुआ क्योंकि वहीं "नियंत्रणीय सूचना उत्पादन" उच्चतम है। उसे समझ आया कि सीधा खड़ा होना सबसे "दिलचस्प" स्थिति है जिसे नियंत्रित किया जा सकता है।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि बुद्धिमान प्रणालियों को कैसे सीखना चाहिए, इसके लिए एक नया नियम है: प्रणालियों को नियंत्रणीय अराजकता के किनारे की ओर ले जाएं।

रोबोट को यह बताने के बजाय कि उसे क्या करना है, आप उसे एक दिशा-सूचक (compass) देते हैं जो "दिलचस्प, नियंत्रणीय अस्थिरता" की ओर इशारा करता है। रोबोट फिर अपने आप उपयोगी कौशल (जैसे खड़ा होना या संतुलन बनाना) खोज लेता है, क्योंकि वहीं गणित कहता है कि सबसे दिलचस्प नियंत्रण हो रहा है।

संक्षेप में: यह पेपर रोबोटों को एक नया आंतरिक दिशा-सूचक देता है। पुरस्कारों को खोजने के बजाय, वे भौतिकी के "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) की तलाश करते हैं—जहाँ चीजें इतनी अस्थिर हों कि चुनौतीपूर्ण हों, लेकिन इतनी नियंत्रणीय भी हों कि उन्हें साधा जा सके। यह उन्हें जटिल भौतिक कौशल, जैसे खड़ा होना, सीखने की अनुमति देता है, बिना किसी इंसान द्वारा उन्हें यह बताए कि उन्हें क्या करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →