← नवीनतम पेपर
💬 NLP

Learning from Natural Language Feedback for Personalized Question Answering

यह शोध पत्र VAC को प्रस्तुत करता है, जो एक नया फ्रेमवर्क है जो कमजोर स्केलर रिवॉर्ड्स के स्थान पर समृद्ध, सुधारात्मक प्राकृतिक भाषा फीडबैक का उपयोग करके बड़े भाषा मॉडलों (LLMs) को पुनरावृत्ति से फाइन-ट्यून करता है, जिससे व्यक्तिगत प्रश्न उत्तर (personalized question answering) में सुधार होता है।

मूल लेखक: Alireza Salemi, Hamed Zamani

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Alireza Salemi, Hamed Zamani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट, जटिल व्यंजन बनाना सीख रहे हैं—मान लीजिए, स्पाइसी रामेन की एक पारंपरिक पारिवारिक रेसिपी।

पुराना तरीका: "थम्स अप/थम्स डाउन" वाला शिक्षक

वर्तमान AI प्रशिक्षण (जिसे रिइन्फोर्समेंट लर्निंग कहा जाता है) में, "शिक्षक" एक जज की तरह है जो केवल आपको एक स्कोर देता है। आप रामेन का एक कटोरा बनाते हैं, और शिक्षक उसे चखता है और कहता है, "10 में से 6।"

आप वहां भ्रमित खड़े रह जाते हैं। यह 6 क्यों है? क्या यह बहुत नमकीन था? क्या नूडल्स की बनावट गलत थी? क्या मसालों का स्तर कुछ ज्यादा या कम था? क्योंकि फीडबैक सिर्फ एक संख्या (एक "स्केलर रिवॉर्ड") है, आपको यह समझने के लिए कि शिक्षक वास्तव में क्या चाहता है, बहुत अधिक समय अनुमान लगाने और गलतियाँ करने में बिताना पड़ता है। यह धीमा, निराशाजनक और अक्षम है।

नया तरीका (VAC): "मास्टर शेफ" मेंटर

UMass Amherst के शोधकर्ताओं ने VAC नामक एक नई प्रणाली बनाई है। एक स्कोरकार्ड वाले जज के बजाय, VAC आपको एक मास्टर शेफ मेंटर देता है जो नेचुरल लैंग्वेज फीडबैक (NLF) प्रदान करता है।

जब आप वह रामेन बनाते हैं, तो मास्टर शेफ केवल "6/10" नहीं कहता। वे कहते हैं: "ब्रोथ (शोरबा) स्वादिष्ट है, लेकिन इस स्टाइल के लिए नूडल्स थोड़े ज्यादा नरम हैं, और आपको तीखे सुगंधित तत्वों के लिए उपयोगकर्ता की पसंद के अनुसार इसमें थोड़ा और अदरक डालना चाहिए।"

यह कार्यवाही योग्य सलाह (actionable advice) है। आपको अनुमान लगाने की ज़रूरत नहीं है; आप जानते हैं कि ठीक क्या करना है।


"VAC" ट्रेनिंग लूप कैसे काम करता है

पेपर प्रशिक्षण के दौरान दो अलग-अलग AI मॉडलों के बीच एक चतुर "नृत्य" का वर्णन करता है:

  1. स्टूडेंट (द पॉलिसी मॉडल): यह वह AI है जो यह सीखने की कोशिश कर रहा है कि आपके सवालों के जवाब इस तरह से कैसे दिए जाएं जो आपको व्यक्तिगत रूप से महसूस कराएं (आपका इतिहास, आपकी पसंद और आपकी शैली को जानते हुए)।
  2. मेंटर (द फीडबैक मॉडल): यह AI स्टूडेंट के काम को देखता है और विस्तृत, सहायक नोट्स लिखता है।

इटरेटिव लूप (पुनरावृत्ति चक्र):

  • चरण 1: स्टूडेंट एक सवाल का जवाब देने की कोशिश करता है।
  • चरण 2: मेंटर उस जवाब को पढ़ता है और एक "आलोचना" (जैसे, "आप यह बताना भूल गए कि यह उपयोगकर्ता पर्यावरण के अनुकूल उत्पादों को प्राथमिकता देता है") लिखता है।
  • चरण 3: स्टूडेंट उस आलोचना को लेता है और जवाब को एकदम सटीक बनाने के लिए फिर से लिखता है।
  • चरण 4: स्टूडेंट फिर उस "परफेक्ट" दोबारा लिखे गए जवाब का इतनी गहराई से अध्ययन करता है कि अंततः उसे मेंटर की ज़रूरत ही नहीं पड़ती।

परिणाम: जब तक प्रशिक्षण समाप्त होता है, स्टूडेंट ने मेंटर के ज्ञान को "आंतरिक" (internalized) कर लिया होता है। जब आप वास्तव में वास्तविक जीवन में उस AI का उपयोग करते हैं, तो यह बिना पहले फीडबैक मांगे, तुरंत आपको एक व्यक्तिगत उत्तर देता है।

यह क्यों मायने रखता है?

शोधकर्ताओं ने इसका परीक्षण LaMP-QA नामक एक बेंचमार्क पर किया (जो यह परीक्षण करता है कि AI किसी व्यक्ति के अनूठे इतिहास के आधार पर उसके सवालों के जवाब कितनी अच्छी तरह दे सकता है)।

परिणाम प्रभावशाली थे:

  • यह स्मार्ट है: इसने पुराने तरीकों की तुलना में काफी बेहतर प्रदर्शन किया जो केवल "थम्स अप/डाउन" स्कोर का उपयोग करते थे।
  • यह तेज़ है: यह अन्य उन्नत तरीकों की तुलना में वास्तविक दुनिया के कार्यों के दौरान वास्तव में तेज़ी से काम करता था क्योंकि इसे हर बार "प्लानिंग" चरण से गुजरने की आवश्यकता नहीं होती है—इसने पैटर्न को पहले ही सीख लिया है।
  • इंसान इसे पसंद करते हैं: मानव परीक्षणों में, लोगों ने VAC उत्तरों को पसंद किया क्योंकि वे अधिक "महसूस" करते थे कि उन्हें समझा गया है।

संक्षेप में (Summary in a Nutshell)

AI को केवल ग्रेड देकर सिखाने के बजाय, हम इसे रचनात्मक आलोचना (constructive criticism) देकर सिखा रहे हैं। यह यह कहे जाने के बीच का अंतर है कि "आप ठीक कर रहे हैं" और यह कहे जाने के बीच कि "आप बहुत अच्छा कर रहे हैं, लेकिन थोड़ी आंच कम करने की कोशिश करें।" एक आपको सोचने पर मजबूर छोड़ देता है; दूसरा आपको एक उस्ताद बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →