Navigating User Behavior toward Personalized Multimodal Generation
यह शोध पत्र NaviGen का प्रस्ताव करता है, जो व्यवहार एन्कोडिंग और निर्देश लेखन की चुनौतियों से निपटने के लिए डुअल आइडेंटिफायर और टू-स्टेज SFT+RL पाइपलाइन का उपयोग करके, उपयोगकर्ता इंटरैक्शन इतिहास को व्यक्तिगत मल्टीमॉडल जनरेशन के लिए निष्पादन योग्य निर्देशों में परिवर्तित करने वाला एक फ्रेमवर्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, हाई-टेक कलाकार (एक AI) है जो आपके निर्देशों के आधार पर सुंदर चित्र बना सकता है या अद्भुत वीडियो बना सकता है। समस्या यह है कि यह कलाकार बहुत ही शाब्दिक (literal) है। यदि आप कहते हैं, "एक काल्पनिक दृश्य (fantasy scene) बनाओ," तो वे कुछ ऐसा बना सकते हैं जो आपकी विशिष्ट पसंद से मेल नहीं खाता। अधिकांश लोग पेशेवर कलाकार नहीं होते, इसलिए वे वह सटीक और विस्तृत निर्देश नहीं लिख पाते जो आपकी पसंद की चीज़ पाने के लिए आवश्यक होते हैं।
बड़ी समस्या:
हमारे पास जो चीज़ उपयोगकर्ता वास्तव में पसंद करते हैं (उनके क्लिक करने, देखने या खरीदने के आधार पर) और AI को क्या बनाने के लिए विशिष्ट निर्देश देने की आवश्यकता है, उसके बीच एक बड़ा अंतर है। उपयोगकर्ता शायद ही कभी कहेंगे, "मुझे गोधूलि बेला में वॉल्यूमेट्रिक फॉग के साथ रोमन कोलोसियम का एक सिनेमाई वाइड शॉट चाहिए।" वे बस कुछ शानदार वीडियो पर क्लिक करते हैं या कुछ गेम खरीदते हैं। AI को यह समझने की ज़रूरत है कि उनके इन क्लिक्स को एक सटीक निर्देश में कैसे बदला जाए।
समाधान: NaviGen
शोधकर्ताओं ने NaviGen (नेविगेशन + जनरेशन) नामक एक सिस्टम बनाया है जो एक "अनुवादक" (translator) के रूप में आपके पिछले व्यवहार और AI कलाकार के बीच काम करता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. डुअल-ID सिस्टम (द "नेम टैग" और द "रिज्यूमे")
आपको समझने के लिए, NaviGen आपके द्वारा इंटरैक्ट किए गए हर आइटम (जैसे कोई गेम या वीडियो) को दो विशेष "ID कार्ड" देता है:
- कोलेबोरेटिव आइडेंटिफायर (CID): इसे एक व्यवहार संबंधी फिंगरप्रिंट (behavioral fingerprint) समझें। यह एक कोड है जो कहता है, "जिन्होंने इसे पसंद किया, उन्हें वह भी पसंद आया।" यह आपके स्वाद के पैटर्न को बिना टेक्स्ट पढ़े कैप्चर करता है। यह एक गुप्त कोड की तरह है जो AI को बताता है, "यह आइटम 'एडवेंचर' परिवार का हिस्सा है।"
- टेक्स्टुअल आइडेंटिफायर (TID): इसे एक संक्षिप्त रिज्यूमे (condensed resume) समझें। यह कीवर्ड्स (जैसे "फैंटेसी," "रोमांस," "एक्शन") की एक छोटी, व्यवस्थित सूची है जो उस आइटम का वर्णन करती है।
इन दोनों को मिलाकर, NaviGen AI को एक कॉम्पैक्ट "व्यव行为ल सबस्ट्रेट" (कोड) और एक "सिमेंटिक ब्रिज" (कीवर्ड्स) एक ही पैकेज में प्रदान करता है। इससे AI यह समझने में मदद मिलती है कि आपने किसी चीज़ को क्यों पसंद किया, न कि केवल यह कि वह क्या थी।
2. प्रशिक्षण प्रक्रिया (लिखना सीखना)
AI को दो चीजें सीखनी होती हैं: आपकी पसंद को समझना और एक अच्छा निर्देश लिखना। NaviGen इसे दो चरणों में सिखाता है:
चरण 1: सुपरवाइज्ड फाइन-ट्यूनिंग (द "स्टडी हॉल"):
सिस्टम एक चतुर तकनीक जिसे इवोल्यूशनरी सर्च (Evolutionary Search) कहा जाता है, का उपयोग करता है। कल्पना कीजिए कि लेखकों का एक समूह एक उपयोगकर्ता के लिए सटीक निर्देश का अनुमान लगाने की कोशिश कर रहा है। वे तीन अलग-अलग शैलियों (रूढ़िवादी, संतुलित, खोजी) के साथ शुरुआत करते हैं। वे अपने विचारों को आपस में मिलाते हैं (जैसे पौधों का प्रजनन/breeding करना), और एक "एडिटर" (एक अन्य AI) अगले पीढ़ी के निर्देशों के लिए सबसे अच्छे विचारों को चुनता है।
मॉडल इन "विकसित" (evolved) निर्देशों से सीखता है। यह "चेन-ऑफ-थॉट" (Chain-of-Thought) के माध्यम से "ज़ोर से सोचना" भी सीखता है, यानी यह समझाता है कि उपयोगकर्ता की पसंद एक मज़ेदार एल्फ वीडियो से बदलकर एक रोमांटिक एनिमे सीन तक कैसे विकसित हुई।चरण 2: रीइन्फोर्समेंट लर्निंग (द "गेम शो"):
एक बार जब मॉडल निर्देश लिखना सीख जाता है, तो यह बेहतर होने के लिए एक खेल खेलता है। इसे निम्नलिखित के लिए अंक (रिवॉर्ड्स) मिलते हैं:- सटीकता (Accuracy): क्या इसने अगले आइटम के लिए सही "व्यवहार संबंधी कोड" (CID) की भविष्यवाणी की जिसे उपयोगकर्ता पसंद कर सकता है?
- गुणवत्ता (Quality): क्या निर्देश विशिष्ट, रचनात्मक और वास्तव में इमेज/वीडियो जनरेटर के लिए बनाना संभव है?
- निरंतरता (Consistency): क्या निर्देश अनुमानित आइटम से मेल खाता है, और क्या अनुमानित आइटम उपयोगकर्ता के इतिहास से मेल खाता है?
3. परिणाम
शोधकर्ताओं ने इसे तीन अलग-अलग दुनियाओं पर परखा: शॉपिंग (उत्पाद), गेमिंग, और शॉर्ट वीडियो।
- बेहतर कला: जब NaviGen ने निर्देश लिखे, तो परिणामी चित्र और वीडियो अन्य तरीकों द्वारा लिखे गए निर्देशों की तुलना में उपयोगकर्ता की विशिष्ट पसंद के अधिक प्रासंगिक, सौंदर्यपूर्ण और रचनात्मक थे।
- बेहतर भविष्यवाणी: यह यह अनुमान लगाने में भी बेहतर था कि उपयोगकर्ता अगले किस आइटम पर क्लिक करेगा, जिससे सिद्ध हुआ कि यह वास्तव में उपयोगकर्ता के "व्यवहार संबंधी फिंगरप्रिंट" को समझता है।
- "अहा!" मोमेंट: एक केस स्टडी में, एक उपयोगकर्ता का इतिहास "मज़ेदार एल्फ वीडियो" से बदलकर "रोमांटिक एनिमे" हो गया। अन्य सिस्टमों ने इसे केवल "एनिमे" के रूप में देखा। NaviGen ने इस परिवर्तन (transition) को देखा और एक "छात्र जोड़े के साथ रोमांटिक एनिमे सीन" के लिए निर्देश लिखा, जो उपयोगकर्ता की वास्तविक इच्छा के बहुत करीब था।
सारांश
NaviGen एक व्यक्तिगत सहायक की तरह है जो देखता है कि आप क्या आनंद लेते हैं, आपके छिपे हुए स्वाद के पैटर्न को समझता है, और फिर AI कलाकार के लिए सटीक, विस्तृत प्रॉम्प्ट लिखता है ताकि ऐसी सामग्री बनाई जा सके जिसे आप वास्तव में पसंद करेंगे। यह आपके मौन क्लिक और उन विस्तृत निर्देशों के बीच के अंतर को पाटता है जिनकी एक AI को जादू रचने के लिए आवश्यकता होती है।
नोट: पेपर पूरी तरह से उपयोगकर्ता व्यवहार के आधार पर चित्र और वीडियो उत्पन्न करने पर केंद्रित है। यह दावा नहीं करता है कि इसका उपयोग चिकित्सा निदान, क्लिनिकल थेरेपी या किसी अन्य गैर-रचनात्मक अनुप्रयोगों के लिए किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।