DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning
यह शोध पत्र DRIFT को प्रस्तुत करता है, जो एक नवीन प्राथमिकता शिक्षण (preference learning) ढांचा है जो सकारात्मक उदाहरणों को गतिशील रूप से नमूना लेने के लिए प्रचुर वास्तविक दुनिया के उपयोगकर्ता असंतोष संकेतों का लाभ उठाता है, जिससे समाधान की विविधता को बनाए रखते हुए और ग्रेडिएंट क्षरण (gradient degeneration) से बचते हुए बेस मॉडल और मजबूत बेसलाइन की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को खाना बनाना सिखा रहे हैं।
पुराना तरीका: फाइव-स्टार रिव्यू का इंतज़ार करना
परंपरागत रूप से, एक रोबोट शेफ को सिखाने के लिए, आप मानव खाद्य आलोचकों के एक पैनल से हर व्यंजन को चखने और उसे थम्स-अप या थम्स-डाउन देने के लिए कहते थे। लेकिन यहाँ समस्या यह है: अधिकांश लोग समीक्षा लिखने के लिए रुकने के लिए बहुत व्यस्त होते हैं। केवल एक बहुत छोटा हिस्सा (1-3%) ही "थम्स अप" क्लिक करने की जहमत उठाता है। और जो ऐसा करते हैं? वे आमतौर पर तभी समीक्षा लिखते हैं जब खाना अद्भुत हो या घिनौना हो। वे शायद ही कभी आपको बताते हैं, "यह सूप ठीक है, लेकिन इसमें थोड़ा नमक और चाहिए।"
इस कारण से, रोबकार शेफ केवल कुछ चरम उदाहरणों से सीख पाता है, और वह उस सूक्ष्मता (nuance) को मिस कर देता है जो लोग वास्तव में चाहते हैं।
नया तरीका: बड़बड़ाने (Grumbles) को सुनना (DRIFT)
यह पेपर DRIFT नामक एक नई विधि पेश करता है। "थम्स अप" का दुर्लभ इंतज़ार करने के बजाय, DRIFT "बड़बड़ाने" (grumbles) पर ध्यान केंद्रित करता है।
इसे इस तरह समझें: जब कोई ग्राहक शिकायत करता है, "यह पिज्जा बहुत नमकीन है," या "क्या आप क्रस्ट को और कुरकुरा बना सकते हैं?" तो वे आपको जानकारी की एक खान (goldmine) दे रहे हैं। वे आपको ठीक-ठीक बता रहे हैं कि क्या काम नहीं कर रहा है। वास्तविक दुनिया में, लोग प्रशंसा (संतुष्टि) की तुलना में शिकायत (असंतोष) बहुत अधिक करते हैं।
DRIFT एक सरल लूप में काम करता है:
- शिकायत को पकड़ना: यह एक वास्तविक बातचीत को ढूँढता है जहाँ उपयोगकर्ता रोबोट के उत्तर से नाखुश था (नेगेटिव उदाहरण)।
- फिर से प्रयास करना: यह रोबोट से उसी प्रश्न का उत्तर फिर से देने के लिए कहता है, लेकिन इस बार, यह अब तक सीखी गई बातों के आधार पर बेहतर करने की कोशिश करता है (पॉजिटिव उदाहरण)।
- अंतर को समझना: यह रोबोट को सिखाता है: "हे, तुम्हारे पहले उत्तर ने उपयोगकर्ता को नाराज कर दिया। तुम्हारा नया उत्तर बेहतर है। इस अंतर को याद रखो।"
यह गेम-चेंजर क्यों है
पेपर का दावा है कि यह दृष्टिकोण तीन मुख्य कारणों से अन्य विधियों से बेहतर है:
- यह प्रचुर मात्रा में है: आपको किसी इंसान द्वारा बटन क्लिक करने का इंतज़ार करने की ज़रूरत नहीं है। आप उन लाखों बार का उपयोग कर सकते हैं जब उपयोगकर्ता कहते हैं, "नहीं, यह गलत है," या "फिर से कोशिश करो," जो चैट में स्वाभाविक रूप से होता है।
- यह अटकता नहीं है: अन्य विधियाँ कभी-कभी एक ऐसे लूप में फंस जाती हैं जहाँ रोबोट एक ही उबाऊ उत्तर बार-बार देने लगता है क्योंकि वह गलती करने से डरता है। DRIFT रोबोट को खोजबीन (exploring) जारी रखने में मदद करता है। क्योंकि यह लगातार एक "बुरे" वास्तविक दुनिया के उत्तर की तुलना एक "ताज़ा" नए प्रयास से करता है, इसलिए रोबोट केवल एक सुरक्षित उत्तर को रटने के बजाय समस्याओं को हल करने के नए, रचनात्मक तरीके खोजता रहता है।
- यह वास्तव में काम करता है: शोधकर्ताओं ने वास्तविक दुनिया के डेटा पर इसका परीक्षण किया। उन्होंने पाया कि DRIFT के साथ प्रशिक्षित मॉडल काफी स्मार्ट हो गए। उदाहरण के लिए, DRIFT के साथ प्रशिक्षित एक 14-बिलियन-पैरामीटर वाला मॉडल, GPT-4o-mini जैसे व्यावसायिक मॉडल की तुलना में जटिल कार्यों पर बेहतर प्रदर्शन करता है।
निष्कर्ष
DRIFT एक ऐसे कोच की तरह है जो दुर्लभ "बहुत अच्छा काम किया!" को नज़रअंदाज़ करता है और इसके बजाय बार-बार होने वाले "यह काम नहीं किया" पर ध्यान केंद्रित करता है। वास्तविक जीवन में लोग जो गलतियाँ करते हैं उनसे सीखकर, और लगातार बेहतर करने की कोशिश करके, AI तेज़ी से सीखता है, अधिक रचनात्मक रहता है, और बिना किसी महंगे मानव शिक्षक के हर उत्तर को ग्रेड दिए अधिक मददगार बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।