← नवीनतम पेपर
🤖 AI

Improving through Interaction: Searching Behavioral Representation Spaces with CMA-ES-IG

यह शोध पत्र CMA-ES-IG प्रस्तुत करता है, जो एक ऐसा एल्गोरिदम है जो दृष्टिगत रूप से विशिष्ट और सूचनात्मक प्रश्नों को उत्पन्न करके रोबोट प्राथमिकता शिक्षण (robot preference learning) को बढ़ाता है, जिससे मौजूदा अत्याधुनिक विधियों की तुलना में स्केलेबिलिटी, मजबूती और उपयोगकर्ता अनुभव में सुधार होता है।

मूल लेखक: Nathaniel Dennler, Zhonghao Shi, Yiran Tao, Andreea Bobu, Stefanos Nikolaidis, Maja Matarić

प्रकाशित 2026-03-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nathaniel Dennler, Zhonghao Shi, Yiran Tao, Andreea Bobu, Stefanos Nikolaidis, Maja Matarić

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपको कॉफी का कप थमाना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि यह तेज़ हो, लेकिन आप यह भी चाहते हैं कि यह कोमल हो। रोबोट अभी तक आपकी विशिष्ट पसंद नहीं जानता है, इसलिए उसे आपसे मदद मांगनी होगी।

समस्या यह है: रोबोट आपसे सही सवाल कैसे पूछे?

यदि रोबोट आपसे दो ऐसे कपों में से चुनने के लिए कहता है जो बिल्कुल एक जैसे दिखते हैं, तो हो सकता है कि आप बस अंदाज़ा लगा लें। यदि वह आपसे एक जलते हुए कप और एक जमे हुए कप के बीच चुनने के लिए कहता है, तो आप सामान्य वाले को चुन लेंगे, लेकिन इससे रोबोट को यह पता नहीं चलेगा कि आपको अपनी कॉफी कैसी पसंद है।

यह पेपर एक नया, स्मार्ट तरीका पेश करता है जिससे रोबोट सीख सकता है कि आपको क्या पसंद है। वे इसे CMA-ES-IG कहते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

दो पुराने तरीके (और उनकी विफलता के कारण)

इस नए तरीके से पहले, रोबनों ने दो मुख्य रणनीतियों को आज़माया था, जिनमें दोनों की खामियां थीं:

  1. "कन्फ्यूजन" रणनीति (Information Gain):

    • यह कैसे काम करती थी: रोबोट उन सवालों को पूछने की कोशिश करता था जहाँ वह पूरी तरह से भ्रमित हो। वह आपको दो विकल्प दिखाता था जो उसके अपने दिमाग में बिल्कुल बराबर (tied) थे, इस उम्मीद में कि आपका चुनाव इस बराबरी को तोड़ देगा।
    • खामी: ऐसा करने के लिए, रोबोट अक्सर बहुत ही घटिया विकल्प सुझाता था (जैसे कि कॉफी का एक कप जो बहुत गर्म या बहुत ठंडा हो) क्योंकि गणितीय रूप से वे रोबोट की नज़र में "बराबर" थे। आप, उपयोगकर्ता, सोचते, "यह रोबोट मुझे कचरा क्यों दिखा रहा है? यह बेहतर क्यों नहीं हो रहा!" आप निराश हो जाते और मदद करना बंद कर देते।
  2. "अंधा खोज" रणनीति (CMA-ES):

    • यह कैसे काम करती थी: रोबोट अपनी रेसिपी को लगातार बेहतर बनाने के लिए उसे ट्यून करके, सबसे अच्छी कॉफी खोजने की कोशिश करता था।
    • खामी: वह अक्सर आपको दो ऐसे कप दिखाता था जो लगभग एक जैसे थे (उदाहरण के लिए, एक में दूसरे की तुलना में 1.01% अधिक चीनी थी)। क्योंकि वे दिखने और स्वाद में इतने समान थे, आपको उनमें अंतर करने में संघर्ष करना पड़ता था। आपका फीडबैक शोर भरा (noisy) होता था ("मुझे लगता है कि पहला वाला पसंद आया?"), और रोबмोट भ्रमित हो जाता था, यह सोचकर कि आपने गलत चीज़ पसंद की है।

नया समाधान: CMA-ES-IG

लेखकों ने एक "सुपर-टीचर" एल्गोरिदम बनाया है जो दोनों दुनियाओं के बेहतरीन हिस्सों को जोड़ता है। इसे एक "स्वाद-परीक्षण जज" (Taste-Test Judge) के रूप में सोचें जो जानता है कि प्रतियोगिता को ठीक से कैसे चलाना है।

यहाँ बताया गया है कि CMA-ES-IG तीन सरल चरणों में कैसे काम करता है:

1. "स्वाद-परीक्षण" फ़िल्टर (Perceptual Distinctness)

कल्पना कीजिए कि रोबोट 100 अलग-अलग कॉफी रेसिपी बनाता है। यदि वह आपको दो ऐसी दिखाता है जो लगभग एक जैसी हैं, तो आप उनका अच्छी तरह से निर्णय नहीं ले पाएंगे।

  • ट्रिक: रोबोट एक तकनीक का उपयोग करता है जिसे K-Means Clustering कहते हैं। कल्पना करें कि आप उन सभी 100 कॉफी रेसिपी को एक कमरे में डाल देते हैं और उन्हें उनके स्वाद के आधार पर खुद को समूहों में बांटने के लिए कहते हैं।
  • परिणाम: रोबोट प्रत्येक समूह के "केंद्र" (center) को चुनता है। अब, आपको दो समान कप दिखाने के बजाय, वह आपको एक "स्ट्रॉन्ग ब्लैक कॉफी", एक "लाटे" और एक "कैरेमल मैकियाटो" दिखाता है। वे अनुभवजन्य रूप से भिन्न (perceptually distinct) हैं। आप उन्हें आसानी से पहचान सकते हैं और एक स्पष्ट उत्तर दे सकते हैं।

2. "सुधार" इंजन (Iterative Learning)

एक बार जब आप उस अलग समूह में से अपना पसंदीदा चुन लेते हैं, तो रोबोट केवल रुकता नहीं है। वह एक स्मार्ट गणितीय इंजन (CMA-ES) का उपयोग यह कहने के लिए करता है, "ठीक है, उपयोगकर्ता को लाटे पसंद आया। चलिए हम अपनी खोज को लाटे-स्वाद वाली कॉफीओं की ओर ले चलते हैं।"

  • परिणाम: अगली बार जब वह आपसे पूछेगा, तो विकल्प पहले से भी बेहतर होंगे। आप देखते हैं कि रोबोट हर सवाल के साथ स्मार्ट और आपकी परफेक्ट कॉफी के करीब होता जा रहा है।

3. "स्वीट स्पॉट" (संतुलन बनाना)

यही CMA-ES-IG का जादू है। यह सूचना (Information) (यह सुनिश्चित करना कि विकल्प एक-दूसरे से पर्याप्त अलग हों ताकि आप निर्णय ले सकें) और गुणवत्ता (Quality) (यह सुनिश्चित करना कि विकल्प वास्तव में अच्छे हों और बेहतर हो रहे हों) के बीच संतुलन बनाता है।

यह क्यों मायने रखता है (The "Aha!" Moment)

पेपर ने इसे दो तरीकों से टेस्ट किया:

  1. सिमुलेशन में: उन्होंने "नकली" उपयोगकर्ताओं के साथ हजारों परीक्षण किए। उन्होंने पाया कि CMA-ES-IG ने पुराने तरीकों की तुलना में उपयोगकर्ता की प्राथमिकताओं को बहुत तेज़ी से और अधिक सटीकता से सीखा, खासकर जब "फ्लेवर स्पेस" जटिल (high-dimensional) था।
  2. वास्तविक जीवन में: उन्होंने असली इंसानों को असली रोबोट्स (एक हाथ जो चीजें थमाता है और एक रोबोट जो चेहरे के भाव बनाता है) के सामने रखा।
    • परिणाम: लोगों को CMA-ES-IG बहुत पसंद आया। उन्हें लगा कि रोबोट वास्तव में सीख रहा है और उनके अनुसार ढल रहा है। उन्हें विकल्पों को रैंक करना बहुत आसान लगा क्योंकि विकल्प स्पष्ट रूप से अलग थे।

बड़ी तस्वीर की उपमा (Big Picture Analogy)

  • पुराना रोबोट: एक छात्र की तरह जो आपसे पूछता रहता है, "क्या आपको यह लाल शर्ट पसंद है या यह थोड़ी और लाल शर्ट?" आप चिढ़ जाते हैं क्योंकि वे एक जैसी हैं, और छात्र वास्तव में कभी नहीं सीख पाता कि आपको क्या पसंद है।
  • CMA-ES-IG रोबोट: एक फैशन सलाहकार की तरह जो आपको एक बोल्ड लाल ड्रेस, एक कैजुअल नीली शर्ट और एक औपचारिक काली सूट दिखाता है। आप आसानी से अपना पसंदीदा चुनते हैं। सलाहकार फिर कहता है, "बहुत बढ़िया, आपको नीला पसंद है! चलिए, अब हम कुछ और नीले विकल्पों को देखते हैं, लेकिन इस बार, आइए थोड़ा गहरा नेवी रंग आज़माते हैं।" आप प्रगति देखते हैं, आपको लगता है कि आपकी बात सुनी जा रही है, और आपको बिल्कुल वही मिलता है जो आप चाहते हैं।

संक्षेप में, CMA-ES-IG रोबोट को ऐसे सवाल पूछना सिखाता है जो इंसानों के लिए जवाब देना आसान होते हैं, जबकि वास्तव में रोबोट को बेहतर बनाने में मदद करते हैं। यह एक निराशाजनक अनुमान लगाने वाले खेल को एक सहज, सहयोगात्मक नृत्य में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →