← नवीनतम पेपर
🤖 AI

Imperfect World Models are Exploitable

यह शोध पत्र सुदृढीकरण aprendizaje (reinforcement learning) में मॉडल शोषण (model exploitation) की एक औपचारिक परिभाषा प्रस्तुत करता है, यह प्रदर्शित करते हुए कि जबकि बड़े नीति सेटों (policy sets) पर शोषण आम तौर पर अपरिहार्य है, शोषण की एक शिथिल धारणा एक सुरक्षित नियोजन क्षितिज (safe planning horizon) के व्युत्पत्ति की अनुमति देती है।

मूल लेखक: Logan Mondal Bhamidipaty (University of Edinburgh), Esmeralda S. Whitammer (University of Edinburgh), David Abel (University of Edinburgh), Mykel J. Kochenderfer (Stanford University), Subramanian Ram
प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Logan Mondal Bhamidipaty (University of Edinburgh), Esmeralda S. Whitammer (University of Edinburgh), David Abel (University of Edinburgh), Mykel J. Kochenderfer (Stanford University), Subramanian Ramamoorthy (University of Edinburgh)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खजाना खोजने के लिए भूलभुलैया (maze) में रास्ता दिखाना सिखा रहे हैं। इसे कुशलतापूर्वक करने के लिए, आप रोबोट को एक मैप (एक "वर्ल्ड मॉडल") देते हैं जो यह भविष्यवाणी करता है कि कदम उठाने पर क्या होगा। रोबोट इस मैप का उपयोग अपना रास्ता तय करने के लिए करता है, ताकि वह अधिक से अधिक खजाना खोज सके।

समस्या यह है कि कोई भी मैप एकदम सटीक नहीं होता। कभी-कभी मैप में छोटी त्रुटियां होती हैं। यह शोध पत्र एक महत्वपूर्ण प्रश्न पूछता है: क्या एक खराब मैप एक रोबोट को यह विश्वास दिलाकर धोखा दे सकता है कि एक बहुत ही बुरा रास्ता वास्तव में सबसे अच्छा है?

लेखक इस घटना को "मॉडल एक्सप्लॉइटेशन" (Model Exploitation) कहते हैं। उनके निष्कर्षों का सरल उपमाओं (analogies) के माध्यम से विवरण यहाँ दिया गया है:

1. मुख्य समस्या: "गलत मोड़" का जाल

कल्पना कीजिए कि आपके पास एक ही शहर के दो मैप हैं:

  • मैप A (वास्तविक दुनिया): दिखाता है कि उत्तर (North) की ओर जाने से एक पार्क (अच्छा) मिलता है, और दक्षिण (South) की ओर जाने से एक दलदल (बुरा) मिलता है।
  • मैप B (अपूर्ण मॉडल): एक छोटी सी त्रुटि के कारण, यह दिखाता है कि दक्षिण की ओर जाने से एक पार्क मिलता है, और उत्तर की ओर जाने से दलदल मिलता है।

यदि आप मैप B का पालन करते हैं, तो आप खुशी-खुशी दक्षिण की ओर जाएंगे, यह सोचकर कि आप पार्क जा रहे हैं। लेकिन वास्तव में, आप एक दलदल में जा रहे हैं। शोध पत्र "एक्सप्लॉइटेशन" को उस क्षण के रूप में परिभाषित करता है जब आपका अपूर्ण मैप (मैप B) आपको ठीक वही करने के लिए कहता है जो वास्तविक दुनिया (मैप A) आपसे नहीं चाहती।

2. बड़ी खोज: आप हमेशा जाल से बच नहीं सकते

शोधकर्ता यह जानना चाहते थे: "यदि हम रोबोट को केवल कुछ विशिष्ट रास्तों तक सीमित रखते हैं, तो क्या हम गारंटी दे सकते हैं कि मैप उसे धोखा नहीं देगा?"

उन्होंने पाया कि नहीं, आप सुरक्षा की गारंटी नहीं दे सकते यदि रोबोट के पास बहुत सारे विकल्प हैं।

  • उपमा: कल्पना कीजिए कि संभावित ड्राइविंग मार्गों का एक विशाल पुस्तकालय है। यदि पुस्तकालय पर्याप्त बड़ा है (गणितीय रूप से, यदि इसमें संभावनाओं का एक "ओपन सबसेट" शामिल है), तो लेखक सिद्ध करते हैं कि कोई भी अपूर्ण मैप अंततः रोबोट को धोखा देगा। हमेशा ऐसे दो मार्ग होंगे जहाँ वास्तविक दुनिया मार्ग X को पसंद करती है, लेकिन खराब मैप जोर देता है कि मार्ग Y बेहतर है।
  • परिणाम: जटिल, वास्तविक दुनिया के परिदृश्यों में जहाँ एक एजेंट (रोबोट) के पास कई अलग-अलग रणनीतियाँ चुनने की क्षमता होती है, मॉडल एक्सप्लॉइटेशन अपरिहार्य है। एक खराब मैप किसी विशिष्ट, अजीब रणनीति के लिए खुद को एक अच्छा मैप दिखाने का तरीका ढूंढ ही लेगा।

3. "खराब मैप्स" और "खराब लक्ष्यों" के बीच का अंतर

पिछले शोध ने दिखाया था कि यदि आप रोबोट को एक खराब लक्ष्य देते हैं (जैसे, "जितने संभव हो सके अंक प्राप्त करें" लेकिन अंक चीजें तोड़ने के लिए दिए जाते हैं), तो रोबोट सिस्टम को "हैक" कर लेगा।

  • लेखकों ने दिखाया कि खराब मैप्स (अपूर्ण विश्व मॉडल) खराब लक्ष्यों (अपूर्ण रिवॉर्ड्स) से अलग हैं।
  • उपमा: एक खराब लक्ष्य को ठीक करना खेल के नियमों को बदलने जैसा है। एक खराब मैप को ठीक करना एक धुंधले GPS के साथ शहर में नेविगेट करने की कोशिश करने जैसा है। जो गणित यह सिद्ध करता है कि आप एक खराब लक्ष्य को ठीक नहीं कर सकते, वह यह सिद्ध नहीं करता कि आप एक खराब मैप को ठीक नहीं कर सकते। वास्तव में, पेपर दिखाता है कि खराब मैप्स को नियंत्रित करना और भी कठिन है क्योंकि मैप की त्रुटियाँ रोबोट के विकल्पों के साथ एक जटिल, नॉन-लीनियर तरीके से परस्पर क्रिया करती हैं।

4. आशा की किरण: "सेफ होराइजन" (Safe Horizon)

चूंकि हम लंबे समय में रोबोट को धोखा देने से नहीं रोक सकते, इसलिए लेखकों ने पूछा: "क्या भविष्य की योजना बनाने के लिए कोई सुरक्षित दूरी है?"

उन्होंने ϵ\epsilon-exploitation (ϵ\epsilon-एक्सप्लॉइटेशन) की अवधारणा पेश की।

  • उपमा: यह मांग करने के बजाय कि मैप हमेशा के लिए सटीक हो, हम कहते हैं, "यह ठीक है यदि मैप थोड़ा गलत है, जब तक कि वह हमें किसी विपत्ति में न डाल दे।"
  • उन्होंने एक "सेफ होराइजन" की गणना की। यह एक सीमा है कि रोबोट को भविष्य में कितनी दूर तक योजना बनानी चाहिए।
    • यदि मैप बहुत सटीक है, तो रोबोट काफी आगे तक योजना बना सकता है।
    • यदि मैप बहुत धुंधला है (उच्च त्रुटि), तो रोबोट को केवल कुछ कदमों के बाद योजना बनाना बंद कर देना चाहिए।
    • सूत्र: उन्होंने एक विशिष्ट गणितीय सीमा निकाली। यदि रोबोट इस सीमा से आगे की योजना बनाता है, तो धोखा खा जाने का जोखिम बहुत अधिक हो जाता है। यदि वह इस सीमा के भीतर रहता है, तो यह गणितीय रूप से गारंटी दी जा सकती है कि वह बड़े धोखों से सुरक्षित है।

5. सारांश और मुख्य निष्कर्ष

  • बुरी खबर: यदि आपके पास एक जटिल दुनिया है और एक रोबोट है जो कई अलग-अलग रणनीतियों के बारे में सोच सकता है, तो आप एक त्रुटिपूर्ण मैप के खिलाफ पूर्ण सुरक्षा गारंटी नहीं बना सकते। रोबोट अंततः धोखा खाने का तरीका ढूंढ ही लेगा।
  • अच्छी खबर: आप अभी भी सुरक्षित रूप से योजना बना सकते हैं, लेकिन आपको भविष्य को देखने के अपने नजरिए में विनम्र होना होगा। आपका मैप जितना खराब होगा, आपकी प्लानिंग की सीमा (horizon) उतनी ही छोटी होनी चाहिए।
  • सेतु (The Bridge): यह पेपर "रिवॉर्ड हैकिंग" (लक्ष्यों को धोखा देना) और "मॉडल एक्सप्लॉइटेशन" (मैप को धोखा देना) के विचार को जोड़ता है, यह दिखाते हुए कि वे संबंधित हैं लेकिन अलग-अलग समस्याएं हैं।

संक्षेप में: आप एक त्रुटिपूर्ण मैप पर हमेशा के लिए भरोसा नहीं कर सकते। लेकिन यदि आप इसका उपयोग केवल एक बार में कुछ कदम उठाने के लिए करते हैं, तो आप रोबोट को दलदल में गिरने से बचा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →