← नवीनतम पेपर
💻 computer science

Learning Reasoning Reward Models from Expert Demonstration via Inverse Reinforcement Learning

यह शोध पत्र एक एडवर्सरियल इनवर्स रिइन्फोर्समेंट लर्निंग (AIRL) फ्रेमवर्क प्रस्तावित करता है जो विशेषज्ञ प्रदर्शनों (expert demonstrations) से सीधे पुन: प्रयोज्य तर्क पुरस्कारों (reusable reasoning rewards) को सीखता है, और यह प्रदर्शित करता है कि ये सीखे गए पुरस्कार मॉडल के प्रदर्शन में सुधार करके, प्रभावी इन्फरेंस-टाइम रीरैंकर के रूप में कार्य करके, और तर्क संबंधी विफलताओं के निदान के लिए क्रॉस-टास्क ट्रांसफर को सक्षम करके सुपरवाइज्ड फाइन-ट्यूनिंग और आउटकम-आधारित रिइन्फोर्समेंट लर्निंग से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन प्रशिक्षु शेफ (apprentice chef) को एक बेहतरीन गोर्मे (gourmet) भोजन बनाना सिखाने की कोशिश कर रहे हैं। आपके पास एक विश्व प्रसिद्ध मास्टर शेफ (विशेषज्ञ प्रदर्शन) द्वारा लिखे गए रेसिपी कार्डों का एक ढेर है।

वर्तमान में, प्रशिक्षु को सिखाने के दो मुख्य तरीके हैं:

  1. "नकल करने वाला" तरीका (Supervised Fine-Tuning): आप प्रशिक्षु से कहते हैं, "बस वही ठीक-ठीक कॉपी करो जो मास्टर शेफ ने कार्ड पर लिखा है।"
    • समस्या: यदि प्रशिक्षु कहीं अटक जाता है या कोई नया घटक (ingredient) आज़माने की कोशिश करता है, तो उसे पता नहीं होता कि क्या करना है। वह केवल नकल कर रहा है, वास्तव में यह नहीं समझ रहा है कि कोई कदम अच्छा है या बुरा क्यों है।
  2. "स्वाद-परीक्षण" तरीका (Reinforcement Learning): आप प्रशिक्षु को खाना बनाने देते हैं, और केवल अंत में, आप व्यंजन का स्वाद चखते हैं। यदि यह अच्छा है, तो आप उसे एक गोल्ड स्टार देते हैं। यदि यह जल गया है, तो आप थम्स डाउन देते हैं।
    • समस्या: यदि व्यंजन जल गया है, तो आपको यह पता नहीं चलेगा कि कहाँ गलती हुई। क्या उन्होंने स्टेप 1 में लहसुन जला दिया? क्या वे स्टेप 5 में नमक डालना भूल गए? फीडबैक बहुत देर से और बहुत अस्पष्ट मिलता है।

नया समाधान: "स्मार्ट फूड क्रिटिक" (यह पेपर)

लेखक इस पेपर में एक तीसरा तरीका प्रस्तावित करते हैं। प्रशिक्षु को केवल कार्ड कॉपी करने देने या अंत में स्वाद चखने के बजाय, वे एक स्मार्ट फूड क्रिटिक (एक AI रिवॉर्ड मॉडल) को वास्तविक समय में खाना पकाने की प्रक्रिया को देखने के लिए प्रशिक्षित करते हैं।

यहाँ बताया गया है कि वे इसे कैसे करते हैं, उनके एडवर्सरियल इनवर्स रीइन्फोर्समेंट लर्निंग (AIRL) फ्रेमवर्क का उपयोग करके:

1. क्रिटिक को प्रशिक्षित करना ("भीतर से स्वाद-परीक्षण")

शोधकर्ता क्रिटिक को कोई नियम पुस्तिका नहीं देते। इसके बजाय, वे क्रिटिक को दो प्रकार के कुकिंग वीडियो दिखाते हैं:

  • वीडियो A: मास्टर शेफ द्वारा पूरी तरह से खाना बनाना।
  • वीडियो B: प्रशिक्षु द्वारा खाना बनाना (कभी सही, कभी गलत)।

क्रिटिक का काम यह पता लगाना है कि: "वीडियो A को मास्टरपीस और वीडियो B को आपदा बनाने में क्या अंतर है?"

चतुर तकनीक यह है कि क्रिटिक केवल अंतिम परिणाम को नहीं, बल्कि अच्छे तर्क वाले कदमों (reasoning steps) को पहचानना सीखता है। वह सीखता है कि "प्याज को समान रूप से काटना" एक अच्छा कदम है, भले ही बाद में कुछ और गलत होने के कारण अंतिम व्यंजन खराब हो जाए। वह यह सीखता है कि कहना, "प्याज पर बढ़िया काम किया! लेकिन रुकिए, आपने अभी नमकीन सूप में चीनी डाल दी—यह एक गलत कदम है!"

2. क्रिटिक की "सूक्ष्मता" (Granularity)

पेपर प्रयोग करता है कि क्रिटिक की प्रतिक्रिया कितनी विस्तृत होनी चाहिए:

  • स्पार्स (Sparse) (द "एंड-ऑफ-शिफ्ट" क्रिटिक): केवल अंत में फीडबैक देता है। "अच्छा काम किया" या "बुरा काम किया।" यह स्थिर है लेकिन बहुत अधिक मदद नहीं करता है।
  • डेंस (Dense) (द "रियल-टाइम" क्रिटिक): हर एक क्रिया के बाद फीडबैक देता है। "बढ़िया कटिंग," "गलत आंच," "परफेक्ट सीजनिंग।" यह गलतियों को तुरंत सुधारने के लिए बहुत मददगार है, लेकिन इसे प्रशिक्षित करना कठिन है क्योंकि क्रिटिक छोटी-छोटी बारीकियों से भ्रमित हो सकता है।

3. प्रशिक्षु कैसे सीखता है

एक बार जब क्रिटिक प्रशिक्षित हो जाता है, तो प्रशिक्षु (AI मॉडल) फिर से खाना बनाना शुरू करता है। इस बार, क्रिटिक हर कदम पर नज़र रखता है और स्कोर देता है।

  • यदि प्रशिक्षु एक ऐसा कदम उठाता है जो मास्टर शेफ के तर्क जैसा दिखता है, तो क्रिटिक उच्च स्कोर देता है।
  • यदि प्रशिक्षु कोई अजीब शॉर्टकट लेता है या तार्किक त्रुटि करता है, तो क्रिटिक कम स्कोर देता है।

प्रशिक्षु इन स्कोर का उपयोग बेहतर खाना बनाना सीखने के लिए करता है, बिना इस आवश्यकता के कि हर व्यंजन को चखने के लिए किसी इंसान की जरूरत हो।

4. क्रिटिक का "दूसरा जीवन"

सबसे अच्छी बात? क्रिटिक न केवल प्रशिक्षु को सीखने में मदद करता है; यह सीखने के बाद भी मदद करता है।

  • "रीरैंकिंग" (Reranking) का तरीका: कल्पना कीजिए कि प्रशिक्षु को एक ही व्यंजन के 16 अलग-अलग संस्करण बनाने के लिए कहा गया है। आमतौर पर, आप बस पहले वाले को चुन लेंगे। लेकिन अब, क्रिटिक सभी 16 संस्करणों का स्वाद चखता है और सबसे अच्छा वाला चुनता है।
  • परिणाम: पेपर दिखाता है कि केवल अनुमान लगाने की तुलना में इस क्रिटिक का उपयोग करके सबसे अच्छे प्रयास को चुनने से अंतिम परिणाम में 17.4% तक सुधार हो सकता है।

5. "क्यों" का निदान करना

क्योंकि क्रिटिक हर कदम को देखता है, इसलिए वह एक जासूस की तरह काम कर सकता है। यदि अंतिम व्यंजन खराब है, तो क्रिटिक ठीक उस क्षण की ओर इशारा कर सकता है जहाँ प्रशिक्षु पटरी से उतर गया था।

  • उदाहरण: "आप स्टेप 7 तक बहुत अच्छा कर रहे थे, जहाँ आपने केक को ओवन के बजाय फ्रीजर में रखने का फैसला किया। यहीं आपकी गलती हुई थी।"

संक्षेप में

यह पेपर AI मॉडल्स को केवल नकल करने के बजाय विशेषज्ञों की तरह सोचना सिखाता है।

  • वे एक स्मार्ट क्रिटिक बनाते हैं जो प्रक्रिया (प्रोसेस) को समझने के लिए विशेषज्ञ उदाहरणों से सीखता है।
  • यह क्रिटिक AI को केवल कॉपी करने की तुलना में तेजी से और अधिक सटीक रूप से सीखने में मदद करता है।
  • यह कई प्रयासों में से सबसे अच्छा विकल्प चुनने में मदद करता है।
  • यह बिल्कुल स्पष्ट कर सकता है कि AI ने कहाँ गलती की, जिससे यह एक व्यक्तिगत ट्यूटर की तरह काम करता है।

यह "शिक्षक की अंधाधुंध नकल करने" और "सही होने तक अनुमान लगाने" के बीच के अंतर को पाटता है, जिससे AI को चरण-दर-चरण समस्याओं को हल करने की वास्तविक समझ मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →