← नवीनतम पेपर
💬 NLP

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

यह शोधपत्र MIMIC का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो व्यवहारिक इरादे (behavioral intent) के भाषाई प्रतिनिधित्व के रूप में "इनर स्पीच" (inner speech) उत्पन्न करने के लिए विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे एक डिफ्यूजन-आधारित पॉलिसी को बिना किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के, अनुमान समय (inference time) पर सूक्ष्म नियंत्रण (fine-grained steerability) के साथ विविध, उच्च-सटीकता वाले मानव-समान व्यवहार प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Rakshit Trivedi, Kartik Sharma, David C Parkes

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rakshit Trivedi, Kartik Sharma, David C Parkes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Inner Speech as Behavior Guides" का सरल भाषा, रचनात्मक उपमाओं और रूपकों का उपयोग करके किया गया स्पष्टीकरण है।

मुख्य विचार: AI को एक "आंतरिक एकालाप" (Inner Monologue) देना

कल्प diजिये कि आप एक मास्टर शेफ को देखते हुए एक जटिल व्यंजन बनाना सीख रहे हैं।

  • पुराना तरीका (Standard AI): आप बस शेफ के हाथों की नकल करते हैं। यदि शेफ का हाथ बाईं ओर जाता है, तो आप भी अपना हाथ बाईं ओर ले जाते हैं। यदि वह दाईं ओर जाता है, तो आप भी दाईं ओर ले जाते हैं। आप एक "मूर्ख नकलची" (mindless mimic) हैं। यदि रसोई का लेआउट थोड़ा बदल जाता है, तो आप भ्रमित हो जाते हैं क्योंकि आपने केवल हलचल को याद किया है, उसके कारणों को नहीं।
  • नया तरीका (MIMIC): आप शेफ को देखते हैं, लेकिन साथ ही यह भी कल्पना करते हैं कि वे क्या सोच रहे हैं। आप उनकी आंतरिक आवाज़ सुनते हैं जो कहती है, "मुझे चाकू दाईं ओर से उठाना चाहिए क्योंकि बायां हैंडल फिसलन भरा है," या "मैं प्याज को छोटा समझकर धीरे-धीरे काटूँगा।"

यह पेपर MIMIC (Modeling Inner Motivations for Imitation and Control) नामक एक सिस्टम पेश करता है। यह AI एजेंटों को कार्य करने से पहले अपनी खुद की "आंतरिक वाणी" (आंतरिक विचारों की एक धारा) उत्पन्न करना सिखाता है। यह आंतरिक वाणी उनके द्वारा देखे जाने वाले दृश्य और उनके द्वारा किए जाने वाले कार्यों के बीच एक सेतु (bridge) का काम करती है।


समस्या: रोबोट बहुत अधिक "रोबोटिक" हैं

वर्तमान AI रोबोट विशिष्ट कार्यों की नकल करने में माहिर हैं, लेकिन वे दो चीजों में संघर्ष करते हैं:

  1. विविधता (Diversity): इंसान अनिश्चित होते हैं। कभी हम मेज के चारों ओर घूमते हैं; कभी हम उसके नीचे से गुजरते हैं। स्टैंडर्ड AI आमतौर पर एक "औसत" रास्ता चुन लेता है और वहीं अटक जाता है।
  2. नियंत्रण (Steering): यदि आप चाहते हैं कि कोई रोबोट विशेष रूप से कार्य करे (जैसे, "बहुत सावधानी से चलें" या "बहुत तेज़ चलें"), तो आपको आमतौर पर पूरे रोबोट को शुरू से फिर से प्रशिक्षित (retrain) करना पड़ता है।

लेखकों ने महसूस किया कि इंसान केवल दुनिया के प्रति प्रतिक्रिया नहीं देते; हमारे पास खुद के साथ एक आंतरिक संवाद होता है जो हमारे विकल्पों का मार्गदर्शन करता है।

समाधान: "आंतरिक एकालाप" ढांचा (The "Inner Monologue" Framework)

MIMIC भाषा को एक गुप्त सूत्र (secret sauce) के रूप में उपयोग करता है। यह रोबोट के मस्तिष्क को तीन भागों में विभाजित करता है, जो एक थिएटर प्रोडक्शन की तरह काम करते हैं:

1. निर्देशक (The Director - Vision-Language Model)

इससे पहले कि रोबोट सीखे, एक "निर्देशक" (एक शक्तिशाली AI जैसे GPT-4) मनुष्यों को कार्य करते हुए वीडियो देखता है। निर्देशक एक स्क्रिप्ट लिखता है जो इस बात का वर्णन करती है कि मानव वह कार्य क्यों कर रहा है।

  • उदाहरण: केवल "रोबोट हाथ हिला रहा है" देखने के बजाय, निर्देशक लिखता है: "रोबोट दीवार से टकराने से बचने के लिए बगल से बॉक्स की ओर बढ़ रहा है।"
  • उपमा: यह एक फिल्म के पात्र के आंतरिक विचारों को लिखने वाले पटकथा लेखक (screenwriter) की तरह है।

2. अभिनेता की आंतरिक आवाज़ (The Actor's Inner Voice - CVAE Generator)

रोबोट उन स्क्रिप्ट्स को अपनी "आंतरिक आवाज़" में बदलना सीखता है। यह एक विशेष न्यूरल नेटवर्क (CVAE) का उपयोग करता है ताकि उन लंबी, विस्तृत स्क्रिप्ट्स को छोटे, प्रभावशाली मानसिक नोट्स में संकुचित (compress) किया जा सके।

  • उपमा: इसे एक अभिनेता द्वारा स्क्रिप्ट याद करने की तरह समझें। वे हर सेकंड पूरा नाटक मन में नहीं दोहराते; वे इसे एक भावना या एक त्वरित विचार जैसे "सावधान रहें" या "तेज़ चलें" में बदल देते हैं।
  • यह आंतरिक आवाज़ स्टोकेस्टिक (stochastic) (अनिश्चित/रैंडम) है। इंसानों की तरह, रोबोट आज "बाईं ओर जाओ" सोच सकता है और कल उसी स्थिति में "दाईं ओर जाओ" सोच सकता है। यह प्राकृतिक विविधता पैदा करता है।

3. कलाकार (The Performer - Diffusion Policy)

अंत में, रोबोट कार्य करता है। लेकिन वह केवल कमरे को नहीं देखता; वह कमरे को देखता है और अपनी आंतरिक आवाज़ को सुनता है।

  • उपमा: एक नर्तक की कल्पना करें। वे संगीत (वातावरण) को देखते हैं, लेकिन उनके दिमाग में एक लय (ताल) भी होती है (आंतरिक वाणी)। नृत्य की मुद्राएं संगीत और उस आंतरिक लय का मिश्रण होती हैं।

यह गेम-चेंजर क्यों है?

1. यह "नियंत्रणीय" है (आप रोबोट से बात कर सकते हैं)

चूंकि रोबोट का व्यवहार भाषा द्वारा निर्देशित होता है, इसलिए आप उसकी "आंतरिक वाणी" के प्रॉम्प्ट को बदलकर उसका व्यक्तित्व बदल सकते हैं।

  • परिदृश्य: आप चाहते हैं कि रोबोट एक अनाड़ी, सतर्क सहायक बने।
  • क्रिया: आप सिस्टम को बताते हैं, "आंतरिक विचार: मैं घबराया हुआ हूँ और धीरे चल रहा हूँ।"
  • परिणाम: रोबोट बिना किसी पुन: प्रशिक्षण (retraining) के सावधानी से चलना शुरू कर देता है।
  • उपमा: यह रोबोट को अलग चश्मा पहनाने जैसा है। यदि आप उसे कहते हैं "मैं एक सतर्क बिल्ली हूँ," तो वह बिल्ली की तरह चलता है। यदि आप कहते हैं "मैं एक तेज़ कुत्ता हूँ," तो वह कुत्ते की तरह चलता है।

2. यह "मानवीय अनिश्चितता" को संभालता है

इंसान निरंतर नहीं होते। कभी हम थके होते हैं; कभी हम ऊर्जावान होते हैं। स्टैंडर्ड AI एक "परफेक्ट औसत" चाल खोजने की कोशिश करता है, जो अक्सर रोबोटिक और सख्त दिखती है।

  • MIMIC का दृष्टिकोण: रैंडम आंतरिक विचार उत्पन्न करके, रोबोट स्वाभाविक रूप से विविध चालें पैदा करता है, ठीक इंसानों की तरह। यह केवल मैकेनिक्स को ही नहीं, बल्कि मानवीय व्यवहार के "अंदाज" (flavor) को भी पकड़ लेता है।

3. यह टीमों में बेहतर काम करता है

पेपर में Overcooked (एक अराजक कुकिंग गेम) नामक खेल में इसका परीक्षण किया गया।

  • जब MIMIC रोबोट्स ने मानव प्रॉक्सी के साथ खेला, तो उन्होंने मानक रोबोट्स की तुलना में उच्च स्कोर प्राप्त किया।
  • क्यों? क्योंकि MIMIC रोबोट इंसान के कार्यों के बारे में "सोच" सकता था। वह केवल प्रतिक्रिया नहीं दे रहा था; वह एक मानव जैसी विचार प्रक्रिया का अनुकरण (simulate) कर रहा था, जिससे वह एक बेहतर साथी बन गया।

प्रक्रिया का सरल सारांश

  1. देखना (Watch): AI मनुष्यों को कार्य करते हुए देखता है।
  2. अनुवाद करना (Translate): एक स्मार्ट AI (निर्देशक) मनुष्यों के कार्यों के आधार पर यह लिखता है कि वे क्या सोच रहे हैं।
  3. आंतरिक बनाना (Internalize): रोबोट उन विचारों को एक संकुचित "आंतरिक आवाज़" में बदलना सीखता है।
  4. कार्य करना (Act): जब रोबोट खेलता है, तो वह एक नया आंतरिक विचार उत्पन्न करता है, और फिर उस विचार + जो वह देख रहा है, के आधार पर कार्य करता है।
  5. नियंत्रण (Control): इंसान रोबोट के व्यवहार को बदलने के लिए उसे नए विचार फुसफुसा सकते हैं।

निष्कर्ष (The Takeaway)

यह पेपर सुझाव देता है कि वास्तव में मानव-तुल्य AI बनाने के लिए, हमें उन्हें केवल यह नहीं सिखाना चाहिए कि क्या करना है। हमें उन्हें यह भी सिखाना चाहिए कि वे जो कर रहे हैं उसके बारे में कैसे सोचना है। AI को "आंतरिक वाणी" देकर, हम उन्हें अधिक लचीला, विविध और नियंत्रित करने में आसान बनाते हैं, जिससे वे कठोर मशीनों से बदलकर अनुकूलन योग्य साथी बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →