← नवीनतम पेपर
🤖 machine learning

Best Policy Learning from Trajectory Preference Feedback

यह शोध पत्र पोस्टीरियर सैंपलिंग फॉर प्रेफरेंस लर्निंग (PSPL) को प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो बेस्ट पॉलिसी की पहचान करने के लिए ऑफलाइन प्रेफरेंस डेटा को ऑनलाइन प्योर एक्सप्लोरेशन के साथ जोड़कर प्रेफरेंस-बेस्ड रीइन्फोर्समेंट लर्निंग में पहले बेयसियन सिंपल रिग्रेट गारंटियों को प्राप्त करता है, और विभिन्न बेंचमार्क पर मौजूदा बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास कोई मैनुअल नहीं है, और आप रोबोट से यह नहीं पूछ सकते कि "इस क्रिया के लिए इनाम क्या है?" क्योंकि रोबोट संख्याओं को नहीं समझता। इसके बजाय, आपको एक माता-पिता की तरह व्यवहार करना होगा: आप रोबट को दो अलग-अलग रास्तों पर चलते हुए देखते हैं, और बस इतना कहते हैं, "मुझे रास्ता A, रास्ता B से बेहतर लगा।"

यह रिनफोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक (RLHF) का मूल सिद्धांत है, जो एक ऐसी तकनीक है जिसका उपयोग AI मॉडल्स (जैसे चैटबॉट्स या इमेज जनरेटर) को प्रशिक्षित करने के लिए किया जाता है ताकि वे इंसानों की इच्छा के अनुसार व्यवहार कर सकें।

यहाँ इस शोध पत्र (paper) की एक सरल व्याख्या दी गई है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

1. समस्या: "खराब शिक्षक" और "टूटा हुआ नक्शा"

वर्तमान में, AI प्रशिक्षण अक्सर दो चरणों वाली प्रक्रिया पर निर्भर करता है जो त्रुटियों के प्रति संवेदनशील है:

  1. रिवॉर्ड मॉडल (Reward Model): पहले, इंसान एक "स्कोरकार्ड" (एक गणितीय सूत्र) लिखने की कोशिश करते हैं जो यह अनुमान लगा सके कि कोई विशेष आउटपुट इंसान को कितना पसंद आएगा।
  2. ऑप्टिमाइज़ेशन (Optimization): फिर AI उस स्कोर को अधिकतम करने की कोशिश करता है।

चुनौती: इंसान सटीक स्कोरकार्ड लिखने में खराब होते हैं। कभी-कभी AI उच्च स्कोर प्राप्त करने के लिए कोई खामी (loophole) ढूंढ लेता है जिससे वह वास्तव में मददगार हुए बिना ही उच्च स्कोर पा लेता है (इसे "रिवॉर्ड हैकिंग" कहा जाता है)। साथ ही, उस स्कोरकार्ड को बनाने के लिए उपयोग किया गया डेटा अक्सर लोगों के एक विशिष्ट समूह या एक विशिष्ट समय से आता है, जो पक्षपाती हो सकता है। यदि "शिक्षक" (रेट करने वाला व्यक्ति) विशेषज्ञ नहीं है, तो AI बुरी आदतें सीख लेता है।

2. समाधान: "पोस्टीरियर सैंपलिंग फॉर प्रेफरेंस लर्निंग" (PSPL)

लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं जिसे PSPL कहा जाता है। एक पूर्ण स्कोरकार्ड बनाने के बजाय, यह AI को सीधे "A बनाम B" की तुलनाओं से सीखने देता है, जबकि साथ ही यह भी रखता है कि वह क्या जानता है और वह क्या नहीं जानता (एक मानसिक मानचित्र)।

PSPL को एक "क्रिस्टल बॉल वाला जासूस" मानकर समझें:

  • ऑफलाइन सुराग (पुराने केस फाइलें): जासूस जांच शुरू करने से पहले, उसे पुरानी केस फाइलों का एक बॉक्स दिया जाता है (एक ऑफलाइन डेटासेट)। इन फाइलों में पिछली तुलनाएं होती हैं (जैसे, "2023 में, लोगों ने इस रास्ते को प्राथमिकता दी")।
    • ट्विस्ट: जासूस जानता है कि ये फाइलें एक "औसत दर्जे के" जासूस (कम सक्षम रेटर) से आ सकती हैं। शायद पुराना जासूस थका हुआ था या वह शहर को अच्छी तरह नहीं जानता था।
  • ऑनलाइन जांच (नई पेट्रोलिंग): जासूस ताज़ा सबूत जुटाने के लिए सड़कों पर निकलता है। वे दो अलग-अलग रास्ते आज़माते हैं, ताज़ा लोगों के एक समूह से पूछते हैं कि कौन सा बेहतर है, और अपने नक्शे को अपडेट करते हैं।
  • क्रिस्टल बॉल (पोस्टीरियर सैंपलिंग): जासूस केवल एक एकल "सर्वश्रेष्ठ मार्ग" का अनुमान नहीं लगाता। इसके बजाय, वह एक साथ वास्तविकता के दो अलग-अलग संस्करणों की कल्पना करता है।
    • वास्तविकता A: "क्या होगा अगर पुरानी फाइलें ज्यादातर सही थीं, और शहर काफी सुरक्षित है?"
    • वास्तविकता B: "क्या होगा अगर पुरानी फाइलें गलत थीं, और शहर वास्तव में खतरनाक है?"
    • जासूस एक ऐसा रास्ता आज़माता है जो दोनों वास्तविकताओं में अच्छा काम करता है। यह उसे उन क्षेत्रों को खोजने के लिए मजबूर करता है जिनके बारे में वह अनिश्चित है, न कि केवल वही करने के लिए जो वह पहले से जानता है।

3. गुप्त मंत्र: रेटर की "क्षमता" को जानना

यह शोध पत्र एक चतुर अवधारणा पेश करता है जिसे रेटर कॉम्पिटेंस (Rater Competence) कहा जाता है।

कल्पना कीजिए कि आप खाना बनाना सीख रहे हैं।

  • परिदृश्य A: आपको एक मिशेलिन-स्टार शेफ से फीडबैक मिलता है। उनकी राय अनमोल है।
  • परिदृश्य B: आपको एक छोटे बच्चे से फीडबैक मिलता है जिसे बस मसालेदार खाना पसंद है।

PSPL एल्गोरिदम यह पूछने में स्मार्ट है: "मुझे इस फीडबैक पर कितना भरोसा करना चाहिए?"

  • यदि रेटर एक विशेषज्ञ (उच्च क्षमता) है, तो AI उनके फीडबैक पर बहुत अधिक भरोसा करता है।
  • यदि रेटर अक्षम (कम क्षमता) है, तो AI उनके फीडबैक को "शोर" (noise) मानता है और अपनी खोज (exploration) पर अधिक निर्भर रहता है।

शोध पत्र गणितीय रूप से सिद्ध करता है कि भले ही ऑफलाइन डेटा एक "औसत" रेटर से आया हो, फिर भी AI स्मार्ट ऑनलाइन एक्सप्लोरेशन को मिलाकर सबसे अच्छी पॉलिसी (सबसे अच्छा रास्ता) सीख सकता है।

4. "बूटस्ट्रैप्ड" संस्करण (इसे व्यावहारिक बनाना)

इस एल्गोरिदम का आदर्श संस्करण (PSPL) गणितीय रूप से सुंदर है लेकिन गणनात्मक रूप से बहुत भारी है—जैसे कि जंजीरों के साथ करतब दिखाते समय रूबिक क्यूब को हल करने की कोशिश करना।

इसे वास्तविक दुनिया में उपयोग करने योग्य बनाने के लिए, लेखकों ने बूटस्ट्रैप्ड PSPL बनाया है।

  • उपमा: रूबिक क्यूब को पूरी तरह से हल करने के बजाय, वे वर्तमान स्थिति का एक त्वरित स्नैपशॉट लेते हैं, क्यूब को थोड़ा हिलाते हैं (रैंडम शोर जोड़ते हैं), और उस थोड़े अलग संस्करण को हल करते हैं। वे इसे कई बार करते हैं।
  • परिणाम: यह एक "पर्याप्त अच्छा" सन्निकटन (approximation) बनाता है जो कंप्यूटर पर तेज़ी से चलता है लेकिन अज्ञात को खोजने का जादू भी बनाए रखता है।

5. परिणाम: क्या यह काम करता है?

लेखकों ने इसका परीक्षण किया:

  1. वीडियो गेम्स: जैसे माउंटेन कार (एक कार को पहाड़ी पर चढ़ाना) और रिवरस्विम (एक मछली जो धारा के विरुद्ध तैरने की कोशिश कर रही है)।
  2. इमेज जनरेशन: मानव प्राथमिकताओं के आधार पर बेहतर चित्र बनाने के लिए AI को सिखाना (इस्तेमाल करते हुए "पिक-ए-पिक" डेटासेट)।

निष्कर्ष:
हर परीक्षण में, PSPL ने मौजूदा तरीकों की तुलना में कम गलतियों के साथ और तेज़ी से "सर्वश्रेष्ठ पॉलिसी" (बेहतरीन तरीके से गाड़ी चलाना, तैरना या चित्र बनाना) खोज ली। यह विशेष रूप से उन स्थितियों में प्रभावी था जहाँ प्रारंभिक डेटा पक्षपाती था या मानव रेटर पूर्ण विशेषज्ञ नहीं थे।

सारांश

यह शोध पत्र AI को स्कोर के बजाय तुलनाओं ("मुझे B की तुलना में A पसंद है") से सीखने के बारे में है। यह "खराब डेटा" की समस्या को एक स्मार्ट सांख्यिकीय ट्रिक (दो वास्तविकताओं का नमूना लेना) का उपयोग करके हल करता है ताकि यह पता लगाया जा सके कि डेटा पर कितना भरोसा किया जाए। यह एक ऐसे छात्र की तरह है जो एक त्रुटिपूर्ण पाठ्यपुस्तक और एक वास्तविक दुनिया के शिक्षक दोनों से सीख सकता है, और यह जानता है कि प्रत्येक पर कितना ध्यान देना है, ताकि वह परम विशेषज्ञ बन सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →