← नवीनतम पेपर
💬 NLP

DiscoverLLM: From Executing Intents to Discovering Them

DiscoverLLM एक नवीन ढांचा है जो एक संज्ञानात्मक अवस्था-आधारित उपयोगकर्ता सिम्युलेटर के माध्यम से बड़े भाषा मॉडलों (Large Language Models) को उपयोगकर्ताओं के अस्पष्ट इरादों को खोजने और उन्हें मूर्त रूप देने में मदद करने के लिए प्रशिक्षित करता है, जिसके परिणामस्वरूप रचनात्मक, तकनीकी और दृश्य कार्यों में काफी बेहतर कार्य प्रदर्शन, छोटी बातचीत और उच्च उपयोगकर्ता संतुष्टि प्राप्त होती है।

मूल लेखक: Tae Soo Kim, Yoonjoo Lee, Jaesang Yu, John Joon Young Chung, Juho Kim

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tae Soo Kim, Yoonjoo Lee, Jaesang Yu, John Joon Young Chung, Juho Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ से एक बहुत ही विशिष्ट भोजन ऑर्डर करने की कोशिश कर रहे हैं, लेकिन आप वास्तव में यह नहीं जानते कि आप क्या खाना चाहते हैं। आप बस इतना जानते हैं कि आपको भूख लगी है और आप कुछ "अच्छा" चाहते हैं।

यदि आप एक मानक AI शेफ से पूछते हैं, "मेरे लिए कुछ अच्छा बनाओ," तो वह स्टेक का अनुमान लगा सकता है। आप एक निवाला लेते हैं और कहते हैं, "हम्म, यह बिल्कुल सही नहीं है।" शेफ पूछता है, "क्या आप इसे अधिक तीखा चाहते हैं?" आप कहते हैं, "मुझे नहीं पता।" शेफ फिर से अनुमान लगाता है, शायद एक सलाद। आप कहते हैं, "नहीं, यह बहुत ठंडा है।" यह सिलसिला अनंत काल तक चल सकता है क्योंकि शेफ आपके यह जानने का इंतज़ार कर रहा है कि आपको वास्तव में क्या चाहिए, इससे पहले कि वह खाना बना सके।

DISCOVERLLM एक नया तरीका है AI शेफ को यह समझने के लिए प्रशिक्षित करने का कि हो सकता है कि आप कुछ देखने तक यह न जान पाएं कि आपको क्या चाहिए।

यहाँ शोध पत्र इस बात को सरल उपमाओं का उपयोग करके समझाता है:

1. समस्या: "हिडन मेनू" (छिपा हुआ मेनू)

आमतौर पर, AI मॉडल यह मान लेते हैं कि आपके दिमाग में एक पूर्ण ऑर्डर (एक "पूरी तरह से निर्मित मंशा") है। वे सोचते हैं कि उनका काम केवल स्पष्ट करने वाले प्रश्न पूछना है जैसे, "क्या आप इसे गर्म या ठंडा चाहते हैं?"

लेकिन वास्तविक जीवन में, विशेष रूपकर कहानी लिखने या चित्र बनाने जैसे रचनात्मक कार्यों के साथ, अक्सर आप तब तक उत्तर नहीं जानते जब तक कि आप कोई उदाहरण न देख लें। आप शेफ को यह नहीं बता सकते कि आपको "तीखा" चाहिए यदि आपने अभी तक तीखा स्वाद चखा ही नहीं है। आपको तीखा खाना पसंद है, यह जानने के लिए आपको उसे खोजना (discover) होगा।

2. समाधान: "टेस्टिंग मेनू" सिम्युलेटर

शोधकर्ताओं ने AI को प्रशिक्षित करने के लिए एक विशेष "सिम्युलेटेड यूजर" (एक रोबोट जो इंसान की तरह व्यवहार करता है) बनाया है। इस रोबोट के पास पसंद का एक गुप्त, छिपा हुआ मेनू है जिसे वह खुद भी नहीं जानता कि उसके पास है।

  • हिडन मेनू: कल्पना कीजिए कि रोबोट के पास इच्छाओं की एक गुप्त सूची है: "मुझे एक कविता चाहिए," "मुझे एक जानवर चाहिए," "मुझे एक बिल्ली चाहिए," "मुझे एक सोती हुई बिल्ली चाहिए।"
  • खोज की प्रक्रिया (Discovery Process): शुरू में, रोबोट को केवल यह पता है कि उसे "एक कविता" चाहिए। उसे यह नहीं पता कि उसे एक बिल्ली चाहिए।
  • AI का काम: केवल यह पूछने के बजाय कि, "आपको कौन सा जानवर चाहिए?" (जिसका उत्तर रोबोट अभी नहीं दे सकता), AI विभिन्न विकल्प पेश करने की कोशिश करता है।
    • AI प्रयास करता है: "यहाँ कुत्ते के बारे में एक कविता है।"
    • रोबोट सोचता है: "ओह, कुत्ता ठीक है, लेकिन शायद मुझे कुछ नरम चाहिए।" (रोबोट को पता चलता है कि उसे एक पालतू जानवर पसंद है)।
    • AI प्रयास करता है: "यहाँ एक सोती हुई बिल्ली के बारे में एक कविता है।"
    • रोबोट सोचता है: "हाँ! यही है!" (रोबोट अब अपनी वास्तविक मंशा को खोज चुका है)।

3. प्रशिक्षण: "नज" (धकेलना/प्रेरित करना) करना सीखना

AI को एक रिवॉर्ड सिस्टम (पुरस्कार प्रणाली) का उपयोग करके प्रशिक्षित किया जाता है। इसे न केवल सही उत्तर देने के लिए, बल्कि उपयोगकर्ता को यह समझने में मदद करने के लिए भी अंक मिलते हैं कि उन्हें क्या चाहिए।

  • गलत कदम: यदि AI पूछता है, "क्या आप बिल्ली या कुत्ता चाहते हैं?" जब उपयोगकर्ता को पता ही नहीं है, तो AI को कोई अंक नहीं मिलता। उपयोगकर्ता अटक जाता है।
  • सही कदम: यदि AI कुत्ते की एक तस्वीर दिखाता है, और उपयोगकर्ता कहता है, "नहीं, शायद कुछ छोटा," तो AI को अंक मिलते हैं। उसने सफलतापूर्वक उपयोगकर्ता को एक नई पसंद खोजने के लिए "नज" किया।

शोध पत्र इस संतुलन को डाइवर्जेंस (Divergence - अन्वेषण के लिए कई अलग-अलग विकल्प दिखाना) और कन्वर्जेंस (Convergence - एक बार जब उपयोगकर्ता जान जाए कि उसे क्या पसंद है, तो उसे सीमित करना) कहते हैं।

4. परिणाम: कम बातें, अधिक काम

शोधकर्ताओं ने इस नए AI का परीक्षण कहानियाँ लिखने, तकनीकी लेख लिखने और डिजिटल चित्र बनाने जैसे कार्यों पर किया।

  • तेज़ खोज: नए AI ने उपयोगकर्ताओं को उनकी पसंद खोजने में पुराने मॉडलों की तुलना में लगभग 10% तेज़ी से मदद की।
  • छोटी बातचीत: क्योंकि AI ने बेकार सवाल पूछना बंद कर दिया और सहायक उदाहरण दिखाना शुरू कर दिया, इसलिए बातचीत 40% छोटी हो गई।
  • खुश उपयोगकर्ता: वास्तविक मनुष्यों के साथ एक अध्ययन में, लोगों ने महसूस किया कि नया AI अधिक सहायक था और ऐसा लगा जैसे वह उनकी जरूरतों को "पूर्वानुमानित" (anticipate) कर रहा है, भले ही उपयोगकर्ता स्वयं यह नहीं जानते थे कि उन्हें क्या चाहिए।

बड़ी तस्वीर

पुराने AI को एक वेटर के रूप में सोचें जो आपके पूरे मेनू को पढ़ने और ऑर्डर करने का इंतज़ार करता है।
नए DISCOVERLLM को एक टेस्टिंग शेफ के रूप में सोचें जो विभिन्न व्यंजनों के छोटे नमूने लेकर आता है। जैसे-जैसे आप चखते हैं, आपको एहसास होता है, "ओह, मुझे वास्तव में तीखा वाला पसंद है!" या "मुझे ठंडा सूप पसंद नहीं है।"

शोध पत्र का दावा है कि AI को उस टेस्टिंग शेफ के रूप में सिखाकर—यानी केवल निर्देशों का इंतज़ार करने के बजाय अन्वेषण के माध्यम से आपकी अपनी पसंद को खोजने में आपकी मदद करके—हम AI को रचनात्मक और खुले कार्यों में बहुत बेहतर बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →