PromptSplit: Revealing Prompt-Level Disagreement in Generative Models
मूल लेखक: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
मूल लेखक: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: PromptSplit
समस्या विवरण (Problem Statement)
प्रॉम्ट-निर्देशित जनरेटिव एआई मॉडल (विज़न और लैंग्वेज दोनों में फैले हुए) की संख्या में तेजी से वृद्धि हुई है, फिर भी विशिष्ट इनपुट प्रॉम्ट्स के सापेक्ष उनके व्यवहार की तुलना करने के लिए व्यवस्थित विधियाँ सीमित हैं। मौजूदा मूल्यांकन मेट्रिक्स, जैसे कि FID, Inception Score, और CLIP-Score, एग्रीगेट क्वालिटी इंडिकेटर प्रदान करते हैं जो मॉडल के व्यवहार को एकल स्केलर मानों में संकुचित कर देते हैं। ये मेट्रिक्स प्रॉम्ट-निर्भर विसंगतियों (discrepancies) को अक्सर छिपा देते हैं। उदाहरण के लिए, दो मॉडल किसी दिए गए प्रॉम्ट के लिए उच्च-गुणवत्ता वाली छवियां उत्पन्न कर सकते हैं, लेकिन विशिष्ट प्रॉम्ट श्रेणियों (जैसे, एक मॉडल लगातार पुरुष आकृतियाँ उत्पन्न करता है जबकि दूसरा "एक व्यक्ति" प्रॉम्ट के लिए महिला आकृतियाँ उत्पन्न करता है) के आधार पर उनके आउटपुट के 'कंटेंट' या 'स्टाइल' में महत्वपूर्ण अंतर हो सकता है। वर्तमान स्पेक्ट्रल और डिस्ट्रीब्यूशनल तुलना विधियाँ आमतौर पर प्रॉम्ट-मुक्त सेटिंग में कार्य करती हैं, जो प्रॉम्ट्स पर औसत (marginalize) निकाल देती हैं और उन विशिष्ट इनपुट श्रेणियों को अलग करने में विफल रहती हैं जो व्यवहारिक विचलन (behavioral divergence) के लिए जिम्मेदार हैं।
कार्यप्रणाली (Methodology)
लेखक PromptSplit का प्रस्ताव करते हैं, जो एक प्रॉम्ट-जागरूक, अनसुपरवाइज्ड स्पेक्ट्रल फ्रेमवर्क है जिसे दो जनरेटिव मॉडल्स के बीच प्रॉम्ट-निर्भर असहमति का पता लगाने और विश्लेषण करने के लिए डिज़ाइन किया गया है।
1. संयुक्त प्रॉम्ट-आउटपुट प्रतिनिधित्व (Joint Prompt-Output Representation)
PromptSplit प्रॉम्ट फीचर्स (ϕT) और आउटपुट फीचर्स (ϕX या ϕY) के टेन्सर-प्रोडक्ट एम्बेडिंग्स बनाकर एक संयुक्त प्रतिनिधित्व का निर्माण करता है। एक प्रॉम्ट t और आउटपुट x के लिए, संयुक्त फीचर को इस प्रकार परिभाषित किया गया है:
ϕ⊗(t,x)=ϕT(t)⊗ϕX(x)
यह एक प्रोडक्ट कर्नेल k⊗([t,x],[t′,x′])=kT(t,t′)⋅kX(x,x′) को प्रेरित करता है, जो इनपुट और आउटपुट स्पेस के बीच मल्टीप्लिकेटिव इंटरैक्शन को कैप्चर करता है।
2. कर्नेल कोवेरिएंस डिफरेंस (Kernel Covariance Difference)
दो डेटासेट्स DX (मॉडल X से) और DY (मॉडल Y से) के लिए, विधि एम्पिरिकल जॉइंट कर्नेल कोवेरिएंस ऑपरेटर्स C^T⊗X और C^T⊗Y की गणना करती है। विश्लेषण का मुख्य केंद्र कोवेरिएंस-डिफरेंस ऑपरेटर है:
Λ^X,Y∣T=C^T⊗X−ηC^T⊗Y
जहाँ η एक हाइपरपैरामीटर है। इस ऑपरेटर के प्रमुख आइजनवेक्टर्स (principal eigenvectors) उन दिशाओं को प्रकट करते जहाँ दोनों मॉडल संयुक्त स्पेस में सबसे महत्वपूर्ण व्यवहारिक अंतर प्रदर्शित करते हैं।
3. कर्नेल ट्रिक और स्पेक्ट्रल विश्लेषण (Kernel Trick and Spectral Analysis)
उच्च-आयामी कोवेरिएंस ऑपरेटर का सीधा आइजनडीकंपोजिशन (eigendecomposition) कम्प्यूटेशनल रूप से अव्यवहार्य है। लेखक एक ब्लॉक कर्नेल मैट्रिक्स KX,ηY∣T को फॉर्म्युलेट करने के लिए कर्नेल ट्रिक का उपयोग करते हैं जिसका आकार (n+m)×(n+m) है, जो उच्च-आयामी ऑपरेटर के समान गैर-शून्य आइजनवैल्यू साझा करता है। इस ब्लॉक मैट्रिक्स के आइजनवेक्टर्स संयुक्त स्पेस में असहमति के मोड (disagreement modes) के अनुरूप होते हैं।
4. स्केलेबल रैंडम प्रोजेक्शन (Scalable Random Projection)
बड़े पैमाने के डेटासेट्स (जहाँ n,m दसियों हजार से अधिक हैं) को संभालने के लिए, PromptSplit एक रैंडम-प्रोजेक्शन एप्रोक्सिमेशन का उपयोग करता है। संयुक्त टेन्सर फीचर्स को गाऊसी रैंडम मैट्रिसेस का उपयोग करके एक निम्न आयाम r में प्रोजेक्ट किया जाता है। यह स्पेक्ट्रल डीकंपोजिशन की कम्प्यूटेशनल जटिलता को O((n+m)3) से घटाकर O((n+m)r2+r3) कर देता है।
- सैद्धांतिक गारंटी (Theoretical Guarantee): पेपर यह सिद्ध करता है कि आइजनस्पेस एस्टीमेट का पूर्ण-आयामी परिणाम से अपेक्षित विचलन O(1/r2) द्वारा सीमित है, जो यह सुनिश्चित करता है कि एप्रोक्सिमेशन उच्च संभावना के साथ असहमति की दिशाओं को संरक्षित करता है।
मुख्य योगदान (Key Contributions)
- प्रॉम्ट-लेवल तुलना फॉर्मूलेशन: यह कार्य मॉडल तुलना को एक संयुक्त प्रॉम्ट-आउटपुट स्पेक्ट्रल समस्या के रूप में फॉर्म्युलेट करता है, जो एग्रीगेट मेट्रिक्स से आगे बढ़कर उन विशिष्ट प्रॉम्ट श्रेणियों की पहचान करता है जो विचलन वाले व्यवहार का कारण बनते हैं।
- PromptSplit फ्रेमवर्क: एक कर्नेल-आधारित फ्रेमवर्क का परिचय जो संयुक्त स्पेस में असहमति के मोड का विश्लेषण करने के लिए टेन्सर-प्रोडक्ट एम्बेडिंग्स के माध्यम से प्रॉम्ट्स और आउटपुट्स को जोड़ता है।
- स्केलेबल एप्रोक्सिमेशन: एक रैंडम-प्रोजेक्शन विधि का विकास जो बड़े डेटासेट्स के विश्लेषण को सक्षम बनाता है, जिसमें O(1/r2) का सैद्धांतिक एरर बाउंड है, जिससे यह वास्तविक दुनिया के जनरेटिव मॉडल मूल्यांकन के लिए व्यावहारिक बन जाता है।
- व्याख्यात्मकता (Interpretability): विधि असहमति के व्याख्यात्मक "मोड्स" प्रदान करती है, जो विशिष्ट प्रॉम्ट क्लस्टर्स को आउटपुट विचलन की प्रकृति से स्पष्ट रूप से जोड़ती है।
प्रयोगात्मक परिणाम (Experimental Results)
लेखकों ने टेक्स्ट-टू-इमेज (T2I) और टेक्स्ट-टू-टेक्स्ट (LLM) सेटिंग्स में PromptSplit का मूल्यांकन किया:
- सिंथेटिक वैलिडेशन: नियंत्रित सेटिंग्स (जैसे, ज्ञात कलर/ग्रेस्केल प्रॉम्ट मिसमैच के साथ MNIST-M) में, PromptSplit ने सफलतापूर्वक उन ग्राउंड-ट्रुथ प्रॉम्ट श्रेणियों की पहचान की जो असहमति के लिए जिम्मेदार थीं।
- टेक्स्ट-टू-इमेज मॉडल्स: Stable Diffusion XL, PixArt-Σ, और Kandinsky के बीच तुलना ने स्टाइल, कंपोजिशन और अलाइनमेंट में प्रॉम्ट-निर्भर विचलन को प्रकट किया। उदाहरण के लिए, विधि ने विशिष्ट व्यवसाय-आधारित प्रॉम्ट्स (जैसे, "नर्स," "बढ़ई") की पहचान की जहाँ मॉडल्स ने काफी भिन्न दृश्य प्रतिनिधित्व उत्पन्न किए।
- लार्ज लैंग्वेज मॉडल्स (LLMs): NQ-Open डेटासेट पर Qwen 3 और Gemma 3 के बीच तुलना ने प्रश्नों के विशिष्ट क्लस्टर्स (जैसे, अमेरिकी राष्ट्रपतियों या अभिनेताओं के संबंध में) की पहचान की जहाँ मॉडल्स ने विचलन वाले उत्तर उत्पन्न किए।
- गाइडेंस एप्लीकेशन: लेखकों ने लेटेंट डिफ्यूजन प्रक्रिया को गाइड करने के लिए PromptSplit का उपयोग करना प्रदर्शित किया, और डिस्एग्रीमेंट ग्रेडिएंट को सैंपलिंग प्रक्रिया में शामिल करके एक संदर्भ डेटासेट (जैसे, विशिष्ट पेंटिंग शैलियों) के साथ उत्पन्न छवियों के वितरण को सफलतापूर्वक अलाइन किया।
महत्व और दावे (Significance and Claims)
पेपर का दावा है कि PromptSplit एक सिद्धांतगत, व्याख्यात्मक टूल प्रदान करता है जो यह पहचानने में मदद करता है कि जनरेटिव मॉडल्स कहाँ और कैसे असहमत होते हैं, जो एग्रीगेट क्वालिटी मेट्रिक्स द्वारा छोड़े गए अंतराल को भरता है। संयुक्त प्रॉम्ट-आउटपुट स्पेस को स्पष्ट रूप से मॉडल करके, यह उन विशिष्ट इनपुट श्रेणियों को अलग करता है जो व्यवहारिक अंतर को संचालित करती हैं।
लेखक PromptSplit को एक एम्बेडिंग-आधारित, सेकंड-ऑर्डर स्पेक्ट्रल मेथड के रूप में प्रस्तुत करते हैं। वे विनम्रतापूर्वक नोट करते हैं कि जबकि इसका डिज़ाइन स्केलेबिलिटी और व्याख्यात्मकता सक्षम करता है, इसका उद्देश्य सभी उच्च-क्रम (higher-order) पहलुओं को चरित्रित करना नहीं है। यह कार्य जनरेटिव एआई मॉडल्स के बढ़ते इकोसिस्टम के लिए अधिक सूक्ष्म, प्रॉम्ट-कंडीशन्ड मूल्यांकन की दिशा में एक कदम के रूप में प्रस्तुत किया गया है। इस डोमेन में आगे के अनुसंधान को सुगम बनाने के लिए इसका कार्यान्वयन सार्वजनिक रूप से उपलब्ध कराया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते AI के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।