← नवीनतम पेपर
🤖 AI

MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop

यह शोध पत्र MulFeRL को पेश करता है, जो एक मल्टी-टर्न सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विफल नमूनों पर समृद्ध मौखिक फीडबैक को प्रशिक्षण योग्य शिक्षण संकेतों में परिवर्तित करके तर्क क्षमता को बढ़ाता है, जिससे यह इन-डोमेन और आउट-ऑफ-डोमेन दोनों कार्यों में मौजूदा सुपरवाइज्ड और RLVR बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MulFeRL पेपर का विवरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

समस्या: AI की "खामोश विफलता" (The "Silent Failure" of AI)

कल्पना कीजिए कि आप एक छात्र को जटिल गणित के सवाल हल करना सिखा रहे हैं। आप उसे एक टेस्ट देते हैं, और वह एक उत्तर गलत देता है।

मानक AI प्रशिक्षण (जिसे RLVR कहा जाता है) में, शिक्षक बस कहता है, "गलत।" बस इतना ही। कोई स्पष्टीकरण नहीं, कोई संकेत नहीं, बस एक शून्य स्कोर।

  • समस्या: यदि छात्र 100 सवाल गलत करता है, तो उसे 100 बार "गलत" का स्कोर मिलता है। उसे यह समझ ही नहीं आता कि वह क्यों असफल हुआ। क्या उसने संख्याओं को जोड़ने में गलती की? क्या उसने प्रश्न को गलत समझा? क्या उसने कोई चरण छोड़ दिया?
  • परिणाम: AI अटक जाता है। वह बेतरतीब ढंग से अनुमान लगाना जारी रखता है क्योंकि "लर्निंग सिग्नल" (फीडबैक) बहुत कम और अनुपयोगी है। यह कार चलाने सीखने जैसा है जहाँ आपको केवल तब बताया जाता है कि "दुर्घटना हुई" जब आप दीवार से टकरा जाते हैं, बिना यह बताए कि आपने रियरव्यू मिरर देखना भूल गए थे।

समाधान: MulFeRL (एक "क्लिपबोर्ड वाला कोच")

शोधकर्ता MulFeRL (Multi-turn Feedback-guided Reinforcement Learning) का प्रस्ताव देते हैं। केवल "गलत" कहने के बजाय, यह सिस्टम एक कठोर लेकिन मददगार कोच की तरह काम करता है जो विशिष्ट, मौखिक सलाह देता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "सभी की विफलता" का जाल (The "All-Failed" Trap)

आमतौर पर, यदि कोई AI कठिन समस्या को हल करने की कोशिश करता है और विफल हो जाता है, तो वह रुक जाता है। ट्रेनिंग लूप टूट जाता है क्योंकि "गलत" उत्तर की तुलना करने के लिए कोई "अच्छा" उत्तर मौजूद नहीं होता।

  • MulFeRL का कदम: जब AI पूरी तरह विफल हो जाता है, तो सिस्टम हार नहीं मानता। यह रुकता है और एक "फीडबैक प्रदाता" (जैसे एक बुद्धिमान मानव या एक अधिक शक्तिशाली AI) से उस गड़बड़ी को देखने के लिए कहता है।

2. "मौखिक फीडबैक" (कोच के नोट्स)

फीडबैक प्रदाता केवल "गलत" नहीं कहता। वह एक नोट लिखता है:

  • "आपने पाइथागोरस प्रमेय का उपयोग करने की कोशिश की, लेकिन आप पहले संख्याओं का वर्ग (square) करना भूल गए।"
  • "आपने चरण 3 में एक माइनस (-) चिह्न छोड़ दिया।"
    यह मौखिक फीडबैक (Verbal Feedback) है। यह एक अस्पष्ट विफलता को एक विशिष्ट सबक में बदल देता है।

3. "पुनर्जनन" (दोबारा प्रयास - The "Regeneration")

अब, AI को दूसरा मौका मिलता है। वह मूल समस्या और कोच के नोट्स को लेकर फिर से हल करने की कोशिश करता है।

  • जादू: यदि AI नोट्स का सही उपयोग करता है, तो वह अंततः सही उत्तर तक पहुँच सकता है।
  • श्रेय (Credit): अब सिस्टम जानता है: "आह! जब हमने AI को संख्याओं को वर्ग करने के बारे में विशिष्ट नोट दिया, तो वह सफल रहा।" यह "विफलता" को एक ऐसे "सफलता" में बदल देता है जिससे सीखा जा सकता है।

4. सीखने के दो तरीके (स्कोरकार्ड)

पेपर इस नई प्रक्रिया को ग्रेड देने के दो विशिष्ट तरीके पेश करता है:

  • परिदृश्य A: "मिश्रित बैग" (GRCT/GRPO)
    कभी-कभी, नोट्स मिलने के बाद, AI 8 बार प्रयास करता है। कुछ प्रयास अभी भी गलत होते हैं, लेकिन कुछ सही होते हैं।

    • उपमा: यह एक स्पोर्ट्स टीम की तरह है जहाँ कुछ खिलाड़ी गलती करते हैं लेकिन अन्य शानदार प्रदर्शन करते हैं। कोच कह सकता है, "उन खिलाड़ियों को देखें जो सफल हुए; उनकी चालों की नकल करें।" AI अपने ही अच्छे प्रयासों की तुलना अपने ही बुरे प्रयासों से करके सीखता है।
  • परिदृश्य B: "पूर्ण सुधार" (Total Turnaround - FCO)
    कभी-कभी, नोट्स इतने अच्छे होते हैं कि सभी 8 प्रयास सही हो जाते हैं।

    • उपमा: पूरी टीम अचानक बिल्कुल सही खेलती है। मानक प्रशिक्षण में, यह भ्रमित करने वाला है क्योंकि "बुरे" उदाहरणों की तुलना करने के लिए कोई नहीं है।
    • MulFeRL की ट्रिक: यह "पहले और बाद" को देखता है। यह "पहले" (जहाँ सभी विफल हुए) की तुलना "बाद" (जहाँ सभी सफल हुए) से करता है। यह AI को बताता है: "याद करो कि तुम पहले कैसे विफल हुए थे? याद करो कि नोट्स के बाद तुम कैसे सफल हुए थे? 'बाद' वाले संस्करण को अधिक करो।" इसे फीडबैक-कॉन्ट्रास्टिव ऑप्टिमाइजेशन (FCO) कहा जाता है।

5. "फिक्स्ड स्लॉट" (एक स्टिकी नोट - The "Fixed Slot")

यह सुनिश्चित करने के लिए कि AI वास्तव में नोट्स को पढ़ता है, MulFeRL फीडबैक को केवल पेज के नीचे नहीं चिपकाता है। यह फीडबैक को सोचने की प्रक्रिया के बीच में एक निश्चित, विशेष बॉक्स (जैसे कि <feedback> टैग) में रखता है।

  • उपमा: यह एक छात्र के कैलकुलेटर पर लगे एक स्टिकी नोट की तरह है जिस पर लिखा है "अपने चिन्हों (signs) की जाँच करें!" बजाय इसके कि वह सप्ताह के अंत में रिपोर्ट कार्ड पढ़े। यह AI को काम करते समय सलाह देखने के लिए मजबूर करता है।

यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि इस "क्लिपबोर्ड वाले कोच" के दृष्टिकोण का उपयोग करके:

  1. यह "खामोश विफलता" की समस्या को ठीक करता है: यह एक तरीका खोजता है जिससे AI तब भी सीख सके जब वह शुरुआत में सब कुछ गलत कर दे।
  2. यह तेजी से सीखता है: AI अधिक तेज़ी से सुधार करता है क्योंकि उसे केवल एक स्कोर नहीं, बल्कि अपनी गलतियों को कैसे ठीक किया जाए, इसके बारे में विशिष्ट निर्देश मिलते हैं।
  3. यह नई चीजों पर भी काम करता है: भले ही इसे गणित की समस्याओं पर प्रशिक्षित किया गया था, लेकिन यह विज्ञान और सामान्य तर्क कार्यों में भी बेहतर हुआ, जो यह साबित करता है कि इसने केवल गणित के उत्तर नहीं रटे, बल्कि सोचने का एक बेहतर तरीका सीखा है।

सारांश

MulFeRL एक ऐसी विधि है जो AI को तब फंसने से रोकती है जब वह विफल हो जाता है। विफल प्रयासों को अनदेखा करने के बजाय, यह AI को फिर से प्रयास करने के लिए मार्गदर्शन करने हेतु मौखिक फीडबैक का उपयोग करता है। इसके बाद, यह AI को केवल सही उत्तर पाने के लिए ही नहीं, बल्कि फीडबैक के आधार पर सुधार करने के लिए भी पुरस्कृत करता है। यह "मैं विफल हुआ" को "यहाँ बताया गया है कि मैंने इसे कैसे ठीक किया" में बदल देता है, जिससे सीखने की प्रक्रिया बहुत समृद्ध और अधिक प्रभावी हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →