← नवीनतम पेपर
💬 NLP

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad एक नया सुदृढीकरण शिक्षण (reinforcement learning) प्रतिमान पेश करता है जो मुक्त-रूप प्राकृतिक भाषा फीडबैक को स्पैन-स्तरीय ग्रेडिएंट्स में परिवर्तित करता है ताकि भाषा मॉडलों में विशिष्ट टोकन स्पैन को सीधे परिष्कृत किया जा सके, जिससे पारंपरिक स्केलर-रिवॉर्ड विधियों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्राप्त होती है।

मूल लेखक: Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

प्रकाशित 2026-01-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना, गणित की समस्या हल करना या कंप्यूटर कोड लिखना सिखा रहे हैं। अतीत में, जब रोबोट कोई गलती करता था, तो शिक्षक (कंप्यूटर सिस्टम) केवल कहता था, "खराब काम। स्कोर: -1।"

यह वैसा ही है जैसे एक शिक्षक किसी छात्र को 10 पन्नों के निबंध पर बिना एक भी गलती को घेरे या यह बताए बिना कि अंत क्यों भ्रमित करने वाला था, फेल कर दे। रोबोट जानता है कि वह असफल रहा है, लेकिन उसे यह पता नहीं होता कि वह कहाँ गलत हुआ। उसे अनुमान लगाना पड़ता है, फिर से प्रयास करना पड़ता है और उम्मीद करनी पड़ती है कि वह भाग्यशाली होगा। यह धीमा, निराशाजनक है और अक्सर इससे रोबोट गलत सबक सीख जाता है।

TEXT2GRAD सिखाने का एक नया तरीका है जो खेल बदल देता है। साधारण "खराब काम" के बजाय, अब शिक्षक कहता है:

"पहला पैराग्राफ बहुत अच्छा है! लेकिन 'नीले ड्रैगन' के बारे में वाक्य भ्रमित करने वाला है क्योंकि इस कहानी में ड्रैगन नीले नहीं होते हैं। साथ ही, अंत बहुत छोटा है। उन विशिष्ट हिस्सों को ठीक करें।"

यहाँ बताया गया है कि TEXT2GRAD कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "हाइलाइटर" शिक्षक (फीडबैक)

पुराने तरीके (जिसे RLHF कहा जाता है) में, शिक्षक एक एकल संख्या (एक स्केलर रिवॉर्ड) देता है। यह एक थर्मामीटर की तरह है जो केवल "गर्म" या "ठंडा" बताता है, बिना यह बताए कि सूप बहुत नमकीन है या आग बहुत बड़ी है।

TEXT2GRAD में, शिक्षक रोबोट के आउटपुट को पढ़ता है और एक प्राकृतिक भाषा आलोचना (natural language critique) लिखता है। यह केवल "गलत" नहीं कहता। यह उन सटीक शब्दों (या "स्पैन") की ओर इशारा करता है जो समस्याग्रस्त हैं और बताता है कि वे क्यों हैं।

  • उपमा: कल्पना कीजिए कि एक शिक्षक छात्र के निबंध में एक विशिष्ट वर्तनी की गलती को लाल पेन से घेरता है और उसके बगल में "यहाँ वर्तनी की जाँच करें" लिखता है, जबकि एक अच्छी तरह से लिखे गए वाक्य के बगल में एक गोल्ड स्टार रखता है।

2. "अनुवादक" (शब्दों को गणित में बदलना)

कंप्यूटर लाल पेन से नहीं सीखते; वे गणित से सीखते हैं। TEXT2GRAD का जादू उस लाल-पेन वाले फीडबैक को गणितीय निर्देशों (ग्रेडिएंट्स) में अनुवाद करने की इसकी क्षमता है।

  • उपमा: सोचिए कि रोबोट का मस्तिष्क एक विशाल, जटिल मशीन है जिसमें लाखों छोटे-छोटे नॉब्स (knobs) हैं।
    • पुराना तरीका: शिक्षक पूरी मशीन को थोड़ा सा किसी यादृच्छिक दिशा में धकेलता है, इस उम्मीद में कि इसमें सुधार होगा।
    • TEXT2GRAD का तरीका: शिक्षक "नीले ड्रैगन" वाली गलती के लिए जिम्मेदार सटीक नॉब्स को ढूँढता है और उसे ठीक करने के लिए केवल उन्हीं विशिष्ट नॉब्स को घुमाता है। यह मशीन के बाकी हिस्सों को अनदेखा कर देता है।

3. "त्वरित सुधार" (ट्रेनिंग लूप)

एक बार जब फीडबैक को इन सटीक गणितीय निर्देशों में अनुवादित कर दिया जाता है, तो रोबोट अपने मस्तिष्क को तुरंत अपडेट करता है।

  • उपमा: यदि आप पियानो सीखने में थे और आपके शिक्षक ने कहा, "C-मेजर स्केल पर आपकी उंगलियां बहुत सख्त हैं," तो आप अपने पूरे जीवन के बारे में सोचने के लिए एक महीने तक पियानो खेलना नहीं छोड़ेंगे। आप तुरंत उस विशिष्ट स्केल पर अपनी उंगलियों को समायोजित करेंगे। TEXT2GRAD एआई को यह करने की अनुमति देता है: यह अपने मस्तिष्क के उन विशिष्ट हिस्सों में सूक्ष्म, सटीक समायोजन करता है जिन्होंने त्रुटि पैदा की थी, न कि पूरे सिस्टम को फिर से प्रशिक्षित करता है।

यह बेहतर क्यों है?

इस पेपर का परीक्षण तीन मुख्य कार्यों पर किया गया: समाचारों का सारांश बनाना, कोड लिखना, और प्रश्नों के उत्तर देना

  • गति: क्योंकि रोबोट को पता है कि क्या ठीक करना है, वह बहुत तेज़ी से सीखता है। वह अनुमान लगाने में समय बर्बाद नहीं करता।
  • सटीकता: कोडिंग में, एक गलत अक्षर भी पूरे प्रोग्राम को तोड़ सकता है। TEXT2GRAD उस एक अक्षर को ढूंढ सकता है और उसे ठीक कर सकता है, जबकि पुराना तरीका केवल यह कह सकता है कि "कोड खराब है" और पूरी चीज़ को फिर से लिखने की कोशिश कर सकता है।
  • समझ: रोबोट वास्तव में सीखता है कि वह क्यों गलत था क्योंकि फीडबैक मानव भाषा में है, जिसे वह तर्क को समझने के लिए प्रोसेस कर सकता है।

निचोड़

TEXT2GRAD एक ऐसे शिक्षक से अपग्रेड करने जैसा है जो आपको केवल ग्रेड (A, B, या F) देता है, बजाय एक ऐसे शिक्षक के जो आपको सुधारने के लिए विशिष्ट सलाह के साथ एक विस्तृत रिपोर्ट कार्ड देता है। यह "आप असफल रहे" को "यहाँ वह है जिसे आपको बदलना है" में बदल देता है, और फिर इस सलाह का उपयोग एआई के मस्तिष्क को सर्जिकल रूप से अपडेट करने के लिए करता है। परिणाम एक स्मार्ट, तेज़ सीखने वाला एआई है जो कम गलतियाँ करता है और मानव फीडबैक को बहुत बेहतर समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →