Enhancing LLMs through human feedback: a journey towards self-improvement
यह शोध पत्र एक नवीन ह्यूमन-इन-द-लूप कार्यप्रणाली प्रस्तावित करता है जो निरंतर उपयोगकर्ता फीडबैक के माध्यम से एक प्राथमिक RAG सिस्टम के प्रदर्शन को पुनरावृत्ति से परिष्कृत करने के लिए एक सहायक फीडबैक RAG सिस्टम को एकीकृत करता है, जो LLM-एज़-अ-जज मूल्यांकन के माध्यम से विविध बेंचमार्क में सटीकता और प्रासंगिकता में महत्वपूर्ण सुधार प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसका नाम RAG है। यह लाइब्रेरियन किताबें (दस्तावेज़) खोजने और उनके आधार पर उत्तर लिखने में अद्भुत है। लेकिन कभी-कभी, यह लाइब्रेरियन चीजें गलत कर देता है, या इसके उत्तर थोड़े नीरस और रोबोटिक लगते हैं। पारंपरिक रूप से, यदि आपको कोई उत्तर पसंद नहीं आता था, तो आप बस 'थम्स डाउन' (अंगूठा नीचे) दे देते थे। यह एक बाइनरी स्विच की तरह था: चालू या बंद। यह रोबोट को बताता था कि "बुरा है," लेकिन यह नहीं बताता था कि क्यों या इसे कैसे ठीक किया जाए।
यह पेपर इस लाइब्रेरियन को सिखाने का एक नया तरीका पेश करता है, जिसे FLARE (फीडबैक-ड्रिवन एलएलएम एडेप्टिव आरएजी एन्हांसमेंट) कहा जाता है। केवल थम्स डाउन देने के बजाय, FLARE उपयोगकर्ताओं को विस्तृत नोट्स, सुधार और यहाँ तक कि स्टाइल टिप्स लिखने की अनुमति देता है। इसे एक ऐसे अंतर के रूप में सोचें जहाँ एक छात्र को टेस्ट पर केवल लाल "X" मिलने के बजाय एक शिक्षक का नोट मिलता है जो कहता है, "तुमने तारीख तो सही लिखी, लेकिन तुम देश का उल्लेख करना भूल गए, और तुम्हारा लहजा बहुत रूखा था।"
दो-चरणीय नृत्य: ऑफलाइन तैयारी और ऑनलाइन जादू
FLARE एक दो-चरणीय नृत्य की तरह काम करता है जो बैकग्राउंड में तब होता है जब लाइब्रेरियन अपना काम कर रहा होता है।
चरण 1: ऑफलाइन तैयारी (स्टडी सेशन)
जब कोई उपयोगकर्ता विस्तृत नोट छोड़ता है, तो FLARE उसे केवल फाइल करके नहीं रख देता। यह नोट को एक "कॉन्टेक्स्टुअल एनरिचमेंट" (संदर्भ संवर्धन) प्रक्रिया से गुजारता है। कल्पना कीजिए कि एक उपयोगकर्ता कहता है, "गलत, यह डोनाल्ड ट्रम्प है।" FLARE उस टुकड़े को लेता है और चैट हिस्ट्री का उपयोग करके, उसे एक स्पष्ट, पूर्ण वाक्य में बदल देता है: "वर्ष 2025 के अनुसार वर्तमान अमेरिकी राष्ट्रपति डोनाल्ड ट्रम्प हैं।"
फिर, एक विशेष AI ("जज") इन नोट्स को दो बाल्टियों में वर्गीकृत करता है:
- फैक्ट चेक्स (तथ्य जाँच): "हे, डेटाबेस अपडेट करें, राष्ट्रपति बदल गए हैं!"
- स्टाइल गाइड्स (शैली मार्गदर्शिका): "हे, अगली बार, अधिक विनम्र रहें और अधिक इतिहास शामिल करें।"
इन नोट्स को फिर डिजिटल "सर्च टैग्स" में बदल दिया जाता है और एक विशेष लाइब्रेरी (वेक्टर डेटाबेस) में संग्रहीत किया जाता है। यह "ऑफलाइन" हिस्सा है जहाँ सिस्टम अतीत से सीखता है।
चरण 2: ऑनलाइन जादू (लाइव शो)
अब, एक नया उपयोगकर्ता एक प्रश्न पूछता है। लाइब्रेरियन के उत्तर देने से पहले, FLARE एक त्वरित साइड-चेक करता है। वह पूछता है, "क्या पहले भी किसी ने ऐसा ही कुछ पूछा है? क्या उन्होंने कोई नोट छोड़ा था?" यदि उत्तर हाँ है, तो FLARE उन नोट्स को पकड़ता है और उन्हें लाइब्रेरियन के उत्तर लिखते समय सीधे उसके दिमाग में इंजेक्ट कर देता है। यह ऐसा है जैसे लाइब्रेरियन को अचानक पिछले ग्राहक के एक स्टिकी नोट की याद आ जाती है जिसमें लिखा है, "अतिरिक्त विवरण देना न भूलें!"
प्रमाण: क्या यह काम कर गया?
लेखकों ने इस विचार का परीक्षण तीन अलग-अलग "प्लेग्राउंड्स" में किया ताकि यह देखा जा सके कि क्या इसने लाइब्रेरियन को वास्तव में स्मार्ट बनाया।
- काल्पनिक प्लेग्राउंड: उन्होंने काल्पनिक पात्रों के बारे में बनाए गए संवादों का उपयोग किया। FLARE के बिना, लाइब्रेरियन थोड़ा भ्रमित था, और संदर्भ गायब होने पर केवल 1 में से 5 का स्कोर प्राप्त कर रहा था। FLARE के साथ, लाइब्रेरियन लगभग पूर्ण स्कोर (5 में से 5) प्राप्त करने में सफल रहा।
- ट्रिविया प्लेग्राउंड: यह कठिन हिस्सा था। उन्होंने 2024 और 2025 की घटनाओं के बारे में प्रश्न पूछे—ऐसी चीजें जिन्हें रोबोट को अभी तक नहीं जानना चाहिए था क्योंकि इसका ट्रेनिंग डेटा पहले समाप्त हो गया था।
- FLARE के बिना: लाइब्रेरियन गलत अनुमान लगाता या अस्पष्ट उत्तर देता, जिसका औसत स्कोर 3.06 (5 में से) था।
- FLARE के साथ: लाइब्रेरियन ने पिछले उपयोगकर्ताओं के फीडबैक का उपयोग करके नए तथ्यों को सीखा। औसत स्कोर बढ़कर 3.91 (5 में से) हो गया।
- उदाहरण: 2025 ऑस्कर्स के बारे में पूछे जाने पर, बेसिक लाइब्रेरियन विजेता को गलत बताता। FLARE ने इसे सही व्यक्ति में सुधारा और यहाँ तक कि यह शानदार विवरण भी जोड़ा कि यह एक विशिष्ट जनसांख्यिकीय के लिए एक ऐतिहासिक जीत थी।
- टेक सपोर्ट प्लेग्राउंड: उन्होंने वायरलेस नेटवर्किंग (इंटेल के आंतरिक डेटा) के बारे में वास्तविक दुनिया के प्रश्नों पर इसका परीक्षण किया। यहाँ, उन्होंने पाया कि FLARE सही फीडबैक ढूँढने में बहुत अच्छा था (यह 95% बार सफल रहा)। हालाँकि, सिस्टम केवल 61% बार उस फीडबैक का उपयोग अंतिम उत्तर को बेहतर बनाने के लिए कर पाया।
FLARE क्या नहीं है (और इसे अभी क्या चाहिए)
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है। लेखक सावधानी बरतते हुए कहते हैं कि FLARE कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है।
- यह कोई पूर्ण समाधान नहीं है: टेक सपोर्ट परीक्षणों में, भले ही सिस्टम ने सही नोट्स 95% बार ढूँढ लिए, लेकिन वह केवल 61% बार ही उत्तर को ठीक करने के लिए उनका उपयोग कर पाया। लेखक सुझाव देते हैं कि ऐसा इसलिए है क्योंकि जिस तरह से वे नोट्स को "इंजेक्ट" करते हैं (उन्हें टेक्स्ट में डालना), वह कभी-कभी रोबोट को सबसे महत्वपूर्ण हिस्सों को अनदेखा करने पर मजबूर कर देता है।
- यह अभी पूरी तरह से स्वायत्त नहीं है: सिस्टम वर्तमान में सभी फीडबैक को समान मानता है। इसे यह नहीं पता कि नोट किसी विश्व-विशेषज्ञ द्वारा दिया गया है या किसी भ्रमित उपयोगकर्ता द्वारा, या नोट कल का है या पिछले साल का। लेखक स्वीकार करते हैं कि उन्हें एक स्मार्ट तरीका बनाने की आवश्यकता है जिससे यह तय किया जा सके कि कौन से नोट्स सबसे अधिक मायने रखते हैं।
- यह कोई "हल हुआ" (solved) मामला नहीं है: पेपर स्पष्ट रूप से कहता है कि इसमें "आगे और परिष्कृत करने के अवसर" मौजूद हैं। वे इसमें ऐसे फीचर्स जोड़ने की योजना बना रहे हैं जैसे कि यह देखना कि फीडबैक किसने लिखा और यह देखना कि क्या उत्तर कमजोर लग रहा है तो नोट्स को दोबारा पढ़ना।
मुख्य निष्कर्ष
मुख्य निष्कर्ष यह है कि रोबोट लाइब्रेरियन को विस्तृत, लिखित फीडबैक देना—और फिर उसे नए प्रश्नों के उत्तर देते समय उन नोट्स को पढ़ने के लिए कहना—उसे सटीक और सहायक होने में काफी बेहतर बनाता है। उनके द्वारा किए गए सिमुलेशन और परीक्षणों में, इस "ह्यूमन-इन-द-लूप" दृष्टिकोण ने एक अच्छे सिस्टम को एक महान सिस्टम में बदल दिया, विशेष रूप से नई जानकारी के मामले में जिसे रोबोट पहले से नहीं जानता था। लेकिन, जैसा कि लेखक बताते हैं, एक पूरी तरह से स्व-सुधार करने वाले रोबोट की यात्रा अभी समाप्त नहीं हुई है; उन्हें अभी यह भी सीखना होगा कि रोबोट को केवल किसी भी नोट के बजाय सबसे अच्छे नोट्स पर ध्यान केंद्रित करने के लिए कैसे प्रेरित किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।