← नवीनतम पेपर
🤖 machine learning

Subspace Inference Enables Efficient Active Reward Learning from Preferences

यह शोध पत्र PreferenceEKF प्रस्तुत करता है, जो एक सैंपल-एफिशिएंट एक्टिव लर्निंग पद्धति है जो न्यूरल नेटवर्क रिवॉर्ड मॉडल्स के लिए स्केलेबल अनसर्टेन्टी क्वांटिफिकेशन को सक्षम करने हेतु एक लो-डायमेंशनल पैरामीटर सबस्पेस के भीतर एक्सटेंडेड कलमन फ़िल्टरिंग का लाभ उठाती है, जिससे ह्यूमन फीडबैक से रिइन्फोर्समेंट लर्निंग की दक्षता और प्रदर्शन में सुधार होता है।

मूल लेखक: Yutai Zhou, Erdem Bıyık

प्रकाशित 2026-09-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yutai Zhou, Erdem Bıyık

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक निरंतर चुनौती बनी हुई है जिसे मानव प्रतिक्रिया (ह्यूमन फीडबैक) से सीखने की "सैंपल इनएफिशिएंसी" (नमूना अक्षमता) के रूप में जाना जाता है। कल्पना कीजिए कि आप एक जटिल कंप्यूटर प्रोग्राम को इस तरह व्यवहार करने के लिए सिखा रहे हैं जो मानवीय मूल्यों के अनुरूप हो। वर्तमान में उपलब्ध सबसे शक्तिशाली विधि में लोगों से दो अलग-अलग परिणामों—जैसे कि दो रोबोटिक गतिविधियाँ या दो लिखित प्रतिक्रियाएँ—की तुलना करने और यह बताने के लिए कहना शामिल है कि वे किसे बेहतर मानते हैं। हालाँकि मनुष्यों के लिए यह प्रतिक्रिया देना आसान है, लेकिन यह अविश्वसनीय रूप से विरल (स्पार्स) है; एक एकल प्राथमिकता केवल सूचना का एक बहुत छोटा हिस्सा प्रदान करती है। मनुष्यों की पसंद का एक विश्वसनीय मॉडल बनाने के लिए, एक एल्गोरिदम को ऐसे हजारों प्रश्न पूछने होंगे। यदि कंप्यूटर गलत प्रश्न पूछता है, तो वह समय और पैसा बर्बाद करता है। यदि वह सही प्रश्न पूछता है, तो वह बहुत तेजी से सीखता है। कठिनाई यह जानने में है कि कौन से प्रश्न सबसे अधिक सूचनात्मक होंगे। ऐसा करने के लिए, कंप्यूटर को यह समझने की आवश्यकता है कि वह अभी तक क्या नहीं जानता है, जिसे अनिश्चितता (अनसर्टेन्टी) कहा जाता है। हालाँकि, विशाल, आधुनिक न्यूरल नेटवर्क के लिए इस अनिश्चितता की गणना करना अत्यंत कठिन और कम्प्यूटेशनल रूप से महंगा है, जिसमें अक्सर एक मोटा अनुमान प्राप्त करने के लिए दर्जनों अलग-अलग मॉडलों को प्रशिक्षित करने की आवश्यकता होती है।

सदर्न कैलिफोर्निया विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस बाधा को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जिससे कंप्यूटर मानव प्राथमिकताओं से कहीं अधिक गति और दक्षता के साथ सीख सकते हैं। उन्होंने 'प्रिफरेंस ईकेएफ' (PreferenceEKF) नामक एक विधि पेश की, जो प्राथमिकताओं को सीखने की प्रक्रिया को एक विशाल, एकमुश्त गणना के बजाय एक निरंतर, चरण-दर-चरण फ़िल्टरिंग समस्या के रूप में देखती है। एक विशाल न्यूरल नेटवर्क के प्रत्येक संभावित बदलाव का मानचित्रण करने के बजाय, शोधकर्ताओं ने महसूस किया कि नेटवर्क के व्यवहार को एक बहुत छोटे, निम्न-आयामी स्थान (लोअर-डायमेंशनल स्पेस) के भीतर सटीक रूप से ट्रैक किया जा सकता है। इस संक्षिप्त उप-स्थान (सबस्पेस) पर अपनी गणनाओं को केंद्रित करके, वे एक क्लासिक गणितीय उपकरण, 'एक्सटेंडेड कलमन फ़िल्टर' का उपयोग करके, नए उत्तर आने के साथ वास्तविक समय में मॉडल की समझ को अपडेट करने में सक्षम थे। इस तकनीक ने उन्हें बिना किसी भारी कम्प्यूटेशनल लागत के, कई स्वतंत्र नेटवर्कों को प्रशिक्षित किए बिना, तुरंत हजारों अलग-अलग रिवॉर्ड मॉडल उत्पन्न करने की अनुमति दी।

शोधकर्ताओं ने रोबोटिक नियंत्रण और निर्णय लेने के विभिन्न मानक बेंचमार्क का उपयोग करके अपने तरीके का कई मौजूदा तकनीकों के विरुद्ध परीक्षण किया। उन्होंने पाया कि उनका दृष्टिकोण न केवल काफी तेज़ था—कुछ सबसे उन्नत विकल्पों की तुलना में चालीस गुना अधिक तेज़—बल्कि इसके भविष्यवाणियों में भी अधिक सटीक था। उन प्रयोगों में जहाँ लक्ष्य मानव तुलनाओं की एक सीमित संख्या से रिवॉर्ड मॉडल सीखना था, नया तरीका अन्य तरीकों की तुलना में कम प्रश्नों का उपयोग करके सही प्राथमिकताओं को सीखने में लगातार सफल रहा। इसके अलावा, इसके द्वारा निर्मित मॉडल बेहतर कैलिब्रेटेड थे, जिसका अर्थ है कि कंप्यूटर का अपने उत्तरों पर विश्वास, उन उत्तरों की वास्तविक सटीकता के अधिक करीब था। यह सटीकता 'एक्टिव लर्निंग' के लिए अत्यंत महत्वपूर्ण है, जहाँ सिस्टम को यह तय करना होता है कि अगला प्रश्न कौन सा पूछा जाए; यदि सिस्टम अनिश्चित है, तो वह उस अनिश्चितता को दूर करने के लिए एक प्रश्न पूछता है, और यदि वह आश्वस्त है, तो वह आगे बढ़ जाता है। नया तरीका इस संतुलन बनाने में उत्कृष्ट रहा, जिससे ऐसे रिवॉर्ड मॉडल तैयार हुए जो जटिल कार्यों को करने के लिए रोबोटिक नीतियों को सफलतापूर्वक प्रशिक्षित कर सके, और उन नीतियों के प्रदर्शन के बराबर पहुँच सके जिन्हें बहुत अधिक महंगी और समय लेने वाली विधियों से प्रशिक्षित किया गया था।

इस कार्य के सबसे उल्लेखनीय पहलुओं में से एक यह है कि यह इन प्रणालियों के प्रशिक्षण के वर्कफ़्लो को कैसे बदल देता है। पारंपरिक विधियों के लिए अक्सर हर बार नया फीडबैक प्राप्त होने पर कंप्यूटर को दुनिया की अपनी पूरी समझ को फिर से प्रशिक्षित या पुनर्मूल्यांकन करने की आवश्यकता होती है, एक ऐसी प्रक्रिया जो सिस्टम के बड़े होने के साथ धीमी होती जाती है। इसके विपरीत, नया तरीका अपनी जानकारी को क्रमिक रूप से अपडेट करता है, केवल नवीनतम जानकारी को शामिल करता है और अब तक सीखी गई जानकारी का एक रनिंग एस्टीमेट बनाए रखता है। यह सिस्टम को कुशलतापूर्वक स्केल करने की अनुमति देता है, जिससे बड़े न्यूरल नेटवर्क को संभालना और मेमोरी या समय समाप्त किए बिना रिवॉर्ड मॉडल के अधिक नमूने बनाना संभव हो जाता है। शोधकर्ताओं ने यह भी प्रदर्शित किया कि यह दृष्टिकोण बिना किसी प्रारंभिक डेटा के भी काम करता है, जहाँ एक रैंडम प्रोजेक्शन तकनीक का उपयोग करके शून्य से आवश्यक सबस्पेस बनाया जाता है, और इसने उन इमेज-आधारित कार्यों में भी संभावना दिखाई जहाँ इनपुट डेटा सरल संख्याओं की तुलना में बहुत अधिक जटिल होता है।

हालाँकि यह विधि बड़ी संभावना दिखाती है, शोधकर्ता इसकी सीमाओं के प्रति भी सावधान हैं। जिस गणितीय ढांचे का उन्होंने उपयोग किया है, वह यह मानकर चलता है कि सीखी जा रही प्राथमिकताएं एक ही, सुसंगत स्रोत से आती हैं। जब उन्होंने सिस्टम का परीक्षण कई अलग-अलग मानव एनोटेटरों के डेटा के साथ किया जिनके विचार परस्पर विरोधी हो सकते हैं, तो यह पद्धति उन अलग-अलग मतों की पूरी जटिलता को पकड़ने में संघर्ष करती है। यह सुझाव देता है कि जबकि यह दृष्टिकोण सीखने की प्रक्रिया को सुव्यवस्थित करने के लिए एक शक्तिशाली उपकरण है, यह उन परिदृश्यों के लिए सबसे उपयुक्त है जहाँ एक एकल, सुसंगत प्राथमिकताओं के सेट को मॉडल किया जा रहा हो। फिर भी, परिणाम संकेत देते हैं कि यह मानव इरादे के प्रति आर्टिफिशियल इंटेलिजेंस को अधिक अनुकूल बनाने की दिशा में एक महत्वपूर्ण कदम है। सीखने की प्रक्रिया को तेज़ और अधिक कुशल बनाकर, यह कार्य बुद्धिमान प्रणालियों को वास्तविक दुनिया के परिवेश में तैनात करने की एक बड़ी बाधा को दूर करता है, जैसे कि व्यक्तिगत अनुशंसाएँ से लेकर स्वायत्त रोबोट तक, जहाँ मानव समय की लागत अधिक है और तीव्र, सटीक सीखने की आवश्यकता महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →