DiscoverLLM: From Executing Intents to Discovering Them
DiscoverLLM एक नवीन ढांचा है जो एक संज्ञानात्मक अवस्था-आधारित उपयोगकर्ता सिम्युलेटर के माध्यम से बड़े भाषा मॉडलों (Large Language Models) को उपयोगकर्ताओं के अस्पष्ट इरादों को खोजने और उन्हें मूर्त रूप देने में मदद करने के लिए प्रशिक्षित करता है, जिसके परिणामस्वरूप रचनात्मक, तकनीकी और दृश्य कार्यों में काफी बेहतर कार्य प्रदर्शन, छोटी बातचीत और उच्च उपयोगकर्ता संतुष्टि प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ से एक बहुत ही विशिष्ट भोजन ऑर्डर करने की कोशिश कर रहे हैं, लेकिन आप वास्तव में यह नहीं जानते कि आप क्या खाना चाहते हैं। आप बस इतना जानते हैं कि आपको भूख लगी है और आप कुछ "अच्छा" चाहते हैं।
यदि आप एक मानक AI शेफ से पूछते हैं, "मेरे लिए कुछ अच्छा बनाओ," तो वह स्टेक का अनुमान लगा सकता है। आप एक निवाला लेते हैं और कहते हैं, "हम्म, यह बिल्कुल सही नहीं है।" शेफ पूछता है, "क्या आप इसे अधिक तीखा चाहते हैं?" आप कहते हैं, "मुझे नहीं पता।" शेफ फिर से अनुमान लगाता है, शायद एक सलाद। आप कहते हैं, "नहीं, यह बहुत ठंडा है।" यह सिलसिला अनंत काल तक चल सकता है क्योंकि शेफ आपके यह जानने का इंतज़ार कर रहा है कि आपको वास्तव में क्या चाहिए, इससे पहले कि वह खाना बना सके।
DISCOVERLLM एक नया तरीका है AI शेफ को यह समझने के लिए प्रशिक्षित करने का कि हो सकता है कि आप कुछ देखने तक यह न जान पाएं कि आपको क्या चाहिए।
यहाँ शोध पत्र इस बात को सरल उपमाओं का उपयोग करके समझाता है:
1. समस्या: "हिडन मेनू" (छिपा हुआ मेनू)
आमतौर पर, AI मॉडल यह मान लेते हैं कि आपके दिमाग में एक पूर्ण ऑर्डर (एक "पूरी तरह से निर्मित मंशा") है। वे सोचते हैं कि उनका काम केवल स्पष्ट करने वाले प्रश्न पूछना है जैसे, "क्या आप इसे गर्म या ठंडा चाहते हैं?"
लेकिन वास्तविक जीवन में, विशेष रूपकर कहानी लिखने या चित्र बनाने जैसे रचनात्मक कार्यों के साथ, अक्सर आप तब तक उत्तर नहीं जानते जब तक कि आप कोई उदाहरण न देख लें। आप शेफ को यह नहीं बता सकते कि आपको "तीखा" चाहिए यदि आपने अभी तक तीखा स्वाद चखा ही नहीं है। आपको तीखा खाना पसंद है, यह जानने के लिए आपको उसे खोजना (discover) होगा।
2. समाधान: "टेस्टिंग मेनू" सिम्युलेटर
शोधकर्ताओं ने AI को प्रशिक्षित करने के लिए एक विशेष "सिम्युलेटेड यूजर" (एक रोबोट जो इंसान की तरह व्यवहार करता है) बनाया है। इस रोबोट के पास पसंद का एक गुप्त, छिपा हुआ मेनू है जिसे वह खुद भी नहीं जानता कि उसके पास है।
- हिडन मेनू: कल्पना कीजिए कि रोबोट के पास इच्छाओं की एक गुप्त सूची है: "मुझे एक कविता चाहिए," "मुझे एक जानवर चाहिए," "मुझे एक बिल्ली चाहिए," "मुझे एक सोती हुई बिल्ली चाहिए।"
- खोज की प्रक्रिया (Discovery Process): शुरू में, रोबोट को केवल यह पता है कि उसे "एक कविता" चाहिए। उसे यह नहीं पता कि उसे एक बिल्ली चाहिए।
- AI का काम: केवल यह पूछने के बजाय कि, "आपको कौन सा जानवर चाहिए?" (जिसका उत्तर रोबोट अभी नहीं दे सकता), AI विभिन्न विकल्प पेश करने की कोशिश करता है।
- AI प्रयास करता है: "यहाँ कुत्ते के बारे में एक कविता है।"
- रोबोट सोचता है: "ओह, कुत्ता ठीक है, लेकिन शायद मुझे कुछ नरम चाहिए।" (रोबोट को पता चलता है कि उसे एक पालतू जानवर पसंद है)।
- AI प्रयास करता है: "यहाँ एक सोती हुई बिल्ली के बारे में एक कविता है।"
- रोबोट सोचता है: "हाँ! यही है!" (रोबोट अब अपनी वास्तविक मंशा को खोज चुका है)।
3. प्रशिक्षण: "नज" (धकेलना/प्रेरित करना) करना सीखना
AI को एक रिवॉर्ड सिस्टम (पुरस्कार प्रणाली) का उपयोग करके प्रशिक्षित किया जाता है। इसे न केवल सही उत्तर देने के लिए, बल्कि उपयोगकर्ता को यह समझने में मदद करने के लिए भी अंक मिलते हैं कि उन्हें क्या चाहिए।
- गलत कदम: यदि AI पूछता है, "क्या आप बिल्ली या कुत्ता चाहते हैं?" जब उपयोगकर्ता को पता ही नहीं है, तो AI को कोई अंक नहीं मिलता। उपयोगकर्ता अटक जाता है।
- सही कदम: यदि AI कुत्ते की एक तस्वीर दिखाता है, और उपयोगकर्ता कहता है, "नहीं, शायद कुछ छोटा," तो AI को अंक मिलते हैं। उसने सफलतापूर्वक उपयोगकर्ता को एक नई पसंद खोजने के लिए "नज" किया।
शोध पत्र इस संतुलन को डाइवर्जेंस (Divergence - अन्वेषण के लिए कई अलग-अलग विकल्प दिखाना) और कन्वर्जेंस (Convergence - एक बार जब उपयोगकर्ता जान जाए कि उसे क्या पसंद है, तो उसे सीमित करना) कहते हैं।
4. परिणाम: कम बातें, अधिक काम
शोधकर्ताओं ने इस नए AI का परीक्षण कहानियाँ लिखने, तकनीकी लेख लिखने और डिजिटल चित्र बनाने जैसे कार्यों पर किया।
- तेज़ खोज: नए AI ने उपयोगकर्ताओं को उनकी पसंद खोजने में पुराने मॉडलों की तुलना में लगभग 10% तेज़ी से मदद की।
- छोटी बातचीत: क्योंकि AI ने बेकार सवाल पूछना बंद कर दिया और सहायक उदाहरण दिखाना शुरू कर दिया, इसलिए बातचीत 40% छोटी हो गई।
- खुश उपयोगकर्ता: वास्तविक मनुष्यों के साथ एक अध्ययन में, लोगों ने महसूस किया कि नया AI अधिक सहायक था और ऐसा लगा जैसे वह उनकी जरूरतों को "पूर्वानुमानित" (anticipate) कर रहा है, भले ही उपयोगकर्ता स्वयं यह नहीं जानते थे कि उन्हें क्या चाहिए।
बड़ी तस्वीर
पुराने AI को एक वेटर के रूप में सोचें जो आपके पूरे मेनू को पढ़ने और ऑर्डर करने का इंतज़ार करता है।
नए DISCOVERLLM को एक टेस्टिंग शेफ के रूप में सोचें जो विभिन्न व्यंजनों के छोटे नमूने लेकर आता है। जैसे-जैसे आप चखते हैं, आपको एहसास होता है, "ओह, मुझे वास्तव में तीखा वाला पसंद है!" या "मुझे ठंडा सूप पसंद नहीं है।"
शोध पत्र का दावा है कि AI को उस टेस्टिंग शेफ के रूप में सिखाकर—यानी केवल निर्देशों का इंतज़ार करने के बजाय अन्वेषण के माध्यम से आपकी अपनी पसंद को खोजने में आपकी मदद करके—हम AI को रचनात्मक और खुले कार्यों में बहुत बेहतर बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।