← नवीनतम पेपर
💻 computer science

Position: Good Embodied Reward Models Need Bad Behavior Data

यह स्थिति पत्र (position paper) तर्क देता है कि एम्बॉडीड एआई (embodied AI) समुदाय को उन रिवॉर्ड मॉडल्स को प्रशिक्षित करने के लिए "बुरे" रोबोट डेटा—जैसे कि विफल, उप-इष्टतम या खतरनाक व्यवहारों—को एकत्र करने और उपयोग करने को प्राथमिकता देनी चाहिए जो मानवीय प्राथमिकताओं के साथ सटीक रूप से संरेखित हों और असुरक्षित या सतही कार्यों के पूरा होने पर अत्यधिक पुरस्कार देने से बचें।

मूल लेखक: Ran Tian, Yilin Wu, Andrea Bajcsy

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ran Tian, Yilin Wu, Andrea Bajcsy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कपड़े तह करना या गिलास में पानी डालना सिखा रहे हैं। इसे अच्छी तरह से सिखाने के लिए, आपको एक "शिक्षक" (रिवॉर्ड मॉडल) की आवश्यकता है जो यह देख सके कि रोबोट क्या कर रहा है और कह सके, "अच्छा काम किया!" या "नहीं, यह तो गड़बड़ हो गई।"

यह शोध पत्र तर्क देता है कि हमारे वर्तमान रोबोट शिक्षक विफल हो रहे हैं क्योंकि उन्होंने केवल परफेक्ट (पूर्ण) उदाहरण ही देखे हैं। उन्हें कभी नहीं दिखाया गया है कि एक तबाही (विनाश) कैसी दिखती है।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के तर्क का विवरण दिया गया है:

1. समस्या: "परफेक्ट स्टूडेंट" का पूर्वाग्रह (The "Perfect Student" Bias)

वर्तमान में, जब हम इन रोबोट शिक्षकों को प्रशिक्षित करते हैं, तो हम उन्हें केवल रोबोट द्वारा कार्यों को पूरी तरह से करने वाले वीडियो दिखाते हैं। यह एक छात्र को पेशेवर ड्राइवरों के वीडियो दिखाकर कार चलाना सिखाने जैसा है जो हमेशा आदर्श मौसम में गाड़ी चलाते हैं, लेकिन उसे कभी टायर पंचर होने, फिसलने या दुर्घटना के करीब पहुँचने जैसी स्थितियों के बारे में नहीं बताया जाता।

क्योंकि शिक्षकों ने कभी "खराब" व्यवहार नहीं देखा है, इसलिए वे अत्यधिक आशावादी (overly optimistic) हैं।

  • परिणाम: यदि कोई रोबोट कप उठाने की कोशिश में एक कटोरा गिरा देता है, तो शिक्षक अभी भी कह सकता है, "बहुत बढ़िया! तुमने कप उठा लिया!" क्योंकि वह कप को हिलते हुए देख रहा है। वह इस तथ्य को अनदेखा कर देता है कि रोबोट ने कुछ और तोड़ दिया है।
  • वास्तविकता: इस शोध पत्र ने तीन शीर्ष-स्तरीय रोबोट शिक्षकों का परीक्षण किया। उन सभी ने उन रोबोटों को उच्च स्कोर दिया जो वास्तव में विफल हो रहे थे, असुरक्षित थे, या कार्य पूरा करने के लिए "शॉर्टकट (चीट्स)" ले रहे थे। जैसे-जैसे कार्य कठिन होते गए (जैसे किसी उपकरण का उपयोग करना), शिक्षक और भी खराब होते गए, और वे लगभग अंदाजे से स्कोर देने लगे।

2. समाधान: हमें "बुरे" डेटा की आवश्यकता है

लेखकों का कहना है कि हमें "विफलताओं" को फेंकना बंद करना चाहिए। हमें रोबot के टकराने, चीजें गिराने या खतरनाक रूप से चलने के वीडियो एकत्र करने और साझा करने की आवश्यकता है।

इसे एक मेडिकल स्कूल की तरह समझें। यदि आप केवल स्वस्थ रोगियों का अध्ययन करते हैं, तो आप बीमारी का निदान करना नहीं जान पाएंगे। आपको बीमार रोगियों का भी अध्ययन करने की आवश्यकता है।

  • शोध पत्र का दावा: थोड़ा सा भी "बुरा" डेटा (रोबोट के विफल होने के वीडियो) होने से शिक्षक यह सीखने में मदद करता है कि किसे पुरस्कृत नहीं करना है।
  • प्रयोग: शोधकर्ताओं ने इसका परीक्षण एक शिक्षक को विफलता का वीडियो (जैसे, नट्स गिर जाना) और त्रुटि का एक लिखित विवरण दिखाकर किया।
    • केवल टेक्स्ट (Text only): इससे ज्यादा मदद नहीं मिली। शिक्षक शब्दों को भौतिक गड़बड़ी से जोड़ नहीं सका।
    • टेक्स्ट + वीडियो (Text + Video): इसने सरल कार्यों (जैसे किसी वस्तु को उठाना) में थोड़ी मदद की।
    • टेक्स्ट + वीडियो + "स्कोरकार्ड" (Text + Video + "Scorecard"): यह सबसे अच्छा काम कर गया। उन्होंने शिक्षक को विफलता का वीडियो दिया और साथ ही एक विस्तृत स्कोरकार्ड दिया जो ठीक-ठीक दिखाता था कि वीडियो के दौरान रोबोट कब और क्यों विफल हुआ। इसने शिक्षक को रोबोट को उसी क्षण दंडित करना सीखने में मदद की जब उसने गलती की, भले ही कार्य का बाकी हिस्सा ठीक लग रहा हो।

3. हमारे पास यह डेटा अभी क्यों नहीं है?

आप पूछ सकते हैं, "हम सभी विफलताओं को रिकॉर्ड क्यों नहीं कर लेते?"

  • बाधा: डिजिटल दुनिया (जैसे टेक्स्ट चैटबॉट्स) में, "बुरा" डेटा बनाना आसान और सस्ता है। आप बस कुछ भी गलत टाइप कर सकते हैं।
  • रोबोट की दुनिया: वास्तविक दुनिया में, रोबट भौतिक होते हैं। बार-बार विफल होने का मतलब अक्सर चीजें तोड़ना, समय बर्बाद करना या सुरक्षा के खतरे पैदा करना होता है। इसके अलावा, अधिकांश रोबोटिक्स लैब सफलता दिखाने पर इतनी केंद्रित होती हैं कि वे किसी के देखने से पहले ही "बदतर" विफलता वाले वीडियो हटा देती हैं।

4. कार्रवाई का आह्वान (The Call to Action)

लेखक रोबोटिक्स समुदाय से चार विशिष्ट चीजें करने के लिए कह रहे हैं:

  1. "बुरे" डेटा को जारी करें: विफलताओं को छिपाना बंद करें। लैब और कंपनियों को रोबोट के टकराने, चीजें गिराने या असुरक्षित रूप से चलने के डेटासेट साझा करने चाहिए, ठीक वैसे ही जैसे वे सफलता की कहानियाँ साझा करते हैं।
  2. विफलताओं को नकली (सिंथेटिक रूप से) बनाएं: चूंकि वास्तविक दुर्घटनाएं महंगी हैं, इसलिए हमें बेहतर कंप्यूटर सिमुलेशन की आवश्यकता है जो यथार्थवादी "क्या होगा अगर" वाली विफलता परिदृश्य उत्पन्न कर सकें (जैसे, "क्या होगा यदि रोबोट यहाँ फिसल जाए?")।
  3. परीक्षण का विकेंद्रीकरण करें: एक लैब द्वारा रोबोट का परीक्षण करने के बजाय, हमें कई अलग-अलग स्थानों द्वारा वास्तविक दुनिया की स्थितियों में उनका परीक्षण करने की आवश्यकता है ताकि विफलताओं के अधिक प्रकारों को पकड़ा जा सके।
  4. शिक्षकों के लिए बेहतर परीक्षण: हमें "शिक्षकों" के परीक्षण के लिए नए बेंचमार्क की आवश्यकता है, यह सुनिश्चित करने के लिए कि वे वास्तव में मानवीय फीडबैक से सीख रहे हैं और केवल अनुमान नहीं लगा रहे हैं।

सारांश

यह शोध पत्र तर्क देता है कि विश्वसनीय रोबोट बनाने के लिए, हमें विफलता को छिपाने वाली गलती के रूप में देखना बंद करना होगा। इसके बजाय, हमें विफलता के डेटा को एक महत्वपूर्ण संसाधन के रूप में मानना चाहिए। "बुरे" व्यवहार को देखे बिना, हमारे रोबोट शिक्षक खतरनाक या लापरवाह रोबोटों को भी उच्च स्कोर देते रहेंगे, यह सोचकर कि वे बहुत अच्छा काम कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →