← नवीनतम पेपर
💬 NLP

Agent Learning via Early Experience

यह शोध पत्र "अर्ली एक्सपीरियंस" (early experience) को प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जहाँ भाषा एजेंट निहित विश्व मॉडलिंग (implicit world modeling) और आत्म-चिंतन (self-reflection) के माध्यम से स्पष्ट पुरस्कार संकेतों के बिना अपने स्वयं के इंटरेक्शन डेटा से सीखते हैं, जो सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग के बीच के अंतर को पाटते हुए बेहतर प्रभावशीलता और सामान्यीकरण का प्रदर्शन करता है।

मूल लेखक: Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, X
प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, जटिल भूलभुलैया (maze) में रास्ता खोजने के लिए सिखा रहे हैं। अतीत में, इस रोबोट को सिखाने के दो मुख्य तरीके थे:

  1. "शैडोइंग" विधि (इमिटेशन लर्निंग - नकल सीखना): आप एक मानव विशेषज्ञ को काम पर रखते हैं जिसने पहले ही भूलभुलैया को पूरी तरह से हल कर लिया है। आप रोबोट को बार-बार विशेषज्ञ के रास्ते पर चलते हुए देखता है। रोबोट कदमों को याद कर लेता है: "लाल दरवाजे पर बाएं मुड़ें, फिर सीधे जाएं।"

    • समस्या: रोबोट केवल वही एक रास्ता जानता है जो विशेषज्ञ ने लिया था। यदि विशेषज्ञ ने एक छोटी सी गलती की, या यदि रोबोट थोड़ा सा अपने रास्ते से भटक गया, तो वह घबरा जाता है क्योंकि उसे यह नहीं पता कि अगर उसने बाएं के बजाय दाएं मुड़ा तो क्या होगा। यह बिल्कुल वैसा ही है जैसे कोई छात्र जिसने अभ्यास परीक्षा के उत्तर रट लिए हों, लेकिन वास्तविक परीक्षा में फेल हो जाता है क्योंकि प्रश्न थोड़े अलग होते हैं।
  2. "ट्रायल एंड एरर" विधि (रीइन्फोर्समेंट लर्निंग - प्रयास और त्रुटि): आप रोबोट को अपने आप भूलभुलैया में दौड़ने देते हैं। हर बार जब वह किसी दीवार से टकराता है, तो उसे एक "झटका" (नकारात्मक इनाम) मिलता है। हर बार जब वह बाहर निकलने का रास्ता ढूंढ लेता है, तो उसे एक "कुकी" (सकारात्मक इनाम) मिलती है।

    • समस्या: वास्तविक दुनिया में (जैसे वेबसाइट ब्राउज़ करना या किसी टूल का उपयोग करना), हर कदम पर "झटके" या "कुकीज़" इंतज़ार नहीं करतीं। आप एक बटन क्लिक कर सकते हैं और कुछ नहीं होता, या आप एक फॉर्म भर सकते हैं और आपको दिनों बाद तक पता नहीं चलेगा कि आपने इसे सही किया या नहीं। स्पष्ट फीडबैक के बिना, रोबोट अपने पहिए घुमाता रहेगा, लाखों चीज़ें बेतरतीब ढंग से आज़माता रहेगा, जो बहुत धीमा और अक्षम है।

नया विचार: "अर्ली एक्सपीरियंस" (प्रारंभिक अनुभव)

यह पेपर "अर्ली एक्सपीरियंस" नामक एक चतुर मध्य मार्ग प्रस्तावित करता है।

इसे इस तरह सोचें: केवल विशेषज्ञ को देखने के बजाय, रोबलेट को वास्तविक प्रशिक्षण शुरू करने से पहले अपने आप कुछ "अभ्यास स्विंग" करने की अनुमति दी जाती है।

यह कैसे काम करता है, यहाँ दो विशिष्ट रणनीतियों का उपयोग किया गया है जिन्हें लेखकों ने विकसित किया है:

1. "क्या होगा अगर" सिम्युलेटर (इम्प्लिसिट वर्ल्ड मॉडलिंग)

कल्पना कीजिए कि रोबोट सड़क के एक मोड़ पर खड़ा है।

  • विशेषज्ञ कहता है: "बाएं जाओ।"
  • रोबोट पूछता है: "अगर मैं दाएं गया तो क्या होगा?" या "अगर मैं कूदा तो क्या होगा?"

"अर्ली एक्सपीरियंस" पद्धति में, रोबोट वास्तव में एक सुरक्षित सिमुलेशन में इन "क्या होगा अगर" वाले कदमों को आज़माता है। वह परिणाम देखता है: "ओह, अगर मैं दाएं गया, तो मैं गड्ढे में गिर जाऊंगा," या "अगर मैं कूदा, तो मैं छत से टकरा जाऊंगा।"

रोबोट को यह सीखने के लिए "कुकी" या "झटके" की आवश्यकता नहीं है। वह बस दुनिया के नियमों को सीखता है। वह कारण-और-प्रभाव का एक आंतरिक मानचित्र बनाता है: क्रिया A से परिणाम X होता है। अगले क्या होने वाला है, इसकी भविष्यवाणी करके, रोबोट वातावरण को विशेषज्ञ के पथ को केवल याद करने वाले रोबोट की तुलना में बहुत बेहतर समझता है।

2. "आत्म-चिंतन" जर्नल (सेल्फ-रिफ्लेक्शन)

कल्पना कीजिए कि रोबोट भाषण का अभ्यास कर रहा है।

  • विशेषज्ञ कहता है: "'नमस्ते' कहें।"
  • रोबोट आज़माता है: "'अलविदा' कहें।"
  • परिणाम: दर्शक भ्रमित दिखते हैं।

इस रणनीति में, रोबोट अपनी "गलतियों" और विशेषज्ञ के "सही" चुनाव को अगल-बगल देखता है। फिर वह अपने स्वयं के मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) का उपयोग करके अपने लिए एक छोटा सा नोट लिखता है: "मैंने 'अलविदा' कहा, लेकिन विशेषज्ञ ने 'नमस्ते' कहा। जब मैंने 'अलविदा' कहा तो दर्शक भ्रमित दिखे, लेकिन जब विशेषज्ञ ने 'नमस्ते' कहा तो वे मुस्कुराए। इसलिए, 'नमस्ते' बेहतर है क्योंकि यह स्थिति के अनुकूल है।"

रोबोट केवल "नमस्ते" शब्द को याद नहीं कर रहा है; वह उस तर्क को सीख रहा है कि क्यों वह विकल्प बेहतर था। वह अपनी विफलताओं को एक पाठ योजना में बदल देता है।

यह क्यों मायने रखता है (परिणाम)

शोधकर्ताओं ने आठ अलग-अलग "भूलभुलैयाओं" पर इस विचार का परीक्षण किया, जिनमें शामिल हैं:

  • वेबसाइटों का उपयोग करना (जैसे किसी विशिष्ट शर्ट की खरीदारी करना)।
  • विज्ञान प्रयोगों को हल करना।
  • जटिल यात्रा कार्यक्रम की योजना बनाना।
  • कंप्यूटर टूल्स का उपयोग करना।

निष्कर्ष स्पष्ट थे:

  • सिर्फ देखने से बेहतर: "अर्ली एक्सपीरियंस" के साथ प्रशिक्षित रोबोट उन रोबोटों की तुलना में समस्याओं को हल करने में बहुत बेहतर थे जिन्होंने केवल विशेषज्ञों को देखा था।
  • आश्चर्यों को संभालने में बेहतर: जब रोबोटों को ऐसी नई स्थितियों का सामना करना पड़ा जो उन्होंने पहले नहीं देखी थीं (आउट-ऑफ-डोमेन), तो वे उतनी बार क्रैश नहीं हुए। वे खेल के नियमों को समझते थे, न कि केवल चालों को।
  • कम डेटा की आवश्यकता: उन्होंने विशेषज्ञ डेटा के आवश्यक हिस्से के केवल एक अंश का उपयोग करके उच्च प्रदर्शन प्राप्त किया।
  • भविष्य के लिए एक सेतु: भले ही बाद में स्पष्ट पुरस्कार (जैसे वीडियो गेम में) उपलब्ध हों, "अर्ली एक्सपीरियंस" के साथ शुरू करने से रोबोट और भी तेज़ी से सीख पाए।

बड़ी तस्वीर

यह पेपर तर्क देता है कि हमें हर वास्तविक कार्य के लिए पूर्ण "रिवॉर्ड सिस्टम" (जैसे कुकीज़ और झटके) के आविष्कार का इंतज़ार करने की ज़रूरत नहीं है। हम एजेंटों को अपने "क्या होगा अगर" वाले परिदृश्यों और अपनी गलतियों पर अपने चिंतन से सीखने के लिए अभी सिखा सकते हैं। यह एक रोबोट को केवल उत्तर याद करने वाले निष्क्रिय छात्र से बदलकर एक सक्रिय शिक्षार्थी बनाने का तरीका है जो समझता है कि दुनिया कैसे काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →