End-to-End Semantic ID Generation for Generative Advertisement Recommendation
यह शोध पत्र UniSID का प्रस्ताव करता है, जो एक जनरेटिव विज्ञापन अनुशंसा (एडवरटाइजमेंट रिकमेंडेशन) के लिए एंड-टू-एंड फ्रेमवर्क है जो पारंपरिक दो-चरणीय रेसिडुअल क्वांटाइजेशन (रेसिड्यूअल क्वांटाइजेशन) की सीमाओं को दूर करने के लिए एम्बेडिंग और सिमेंटिक आईडी जनरेशन को एकीकृत करता है, जिससे मल्टी-ग्रैनुलैरिटी कॉन्ट्रास्टिव लर्निंग और समरी-आधारित पुनर्निर्माण के माध्यम से बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी तस्वीर: "अनुवाद" की समस्या
कल्पना कीजिए कि आप एक रोबोट को लोगों को उत्पाद (products) सुझाने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। ऐसा करने के लिए, रोबोट को यह समझने की आवश्यकता है कि एक उत्पाद वास्तव में क्या है।
पुराना तरीका (दो-चरणीय पाइपलाइन):
पुराने तरीके को "टेलीफोन" के खेल की तरह समझें जो दो अलग-अलग लोगों द्वारा खेला जाता है जो आपस में बात नहीं करते।
- व्यक्ति A (एन्कोडर): एक उत्पाद (मान लीजिए, एक लाल चमड़े का जूता) को देखता है और कागज पर उसका एक लंबा, जटिल विवरण लिखता है। फिर वे उस विवरण को एक छोटे कोड में संक्षेप में लिखने की कोशिश करते हैं (जैसे "Shoe-Red-01")।
- व्यक्ति B (जेनरेटर): उस छोटे कोड ("Shoe-Red-01") को लेता है और अनुमान लगाने की कोशिश करता है कि उपयोगकर्ता आगे क्या चाहता है।
समस्या:
व्यक्ति A और व्यक्ति B के लक्ष्य अलग-अलग हैं। व्यक्ति A एक आदर्श सारांश लिखना चाहता है। व्यक्ति B अगले क्लिक की भविष्यवाणी करना चाहता है। क्योंकि वे अलग-अलग काम करते हैं, व्यक्ति A एक छोटा सा विवरण छोड़ सकता है जिसकी व्यक्ति B को वास्तव में आवश्यकता थी। इसके अलावा, हर बार जब व्यक्ति A कागज का सारांश बनाता है, तो वे थोड़ी जानकारी खो देते हैं (जैसे एक धुंधली फोटोकॉपी)। जब तक कोड व्यक्ति B तक पहुँचता है, जूते का मूल "वाइब" (vibe) थोड़ा धुंधला हो जाता है। इसे ही पेपर में सेमेंटिक डिग्रेडेशन (Semantic Degradation) और ऑब्जेक्टिव मिसअलाइनमेंट (Objective Misalignment) कहा गया है।
नया समाधान: UniSID (एक "ऑल-इन-वन" शेफ)
लेखक UniSID का प्रस्ताव देते हैं, जो खेल बदल देता है। "टेलीफोन" खेलने वाले दो लोगों के बजाय, वे एक विशेषज्ञ शेफ को काम पर रखते हैं जो सब कुछ एक साथ करता है।
UniSID कैसे काम करता है:
- कच्चा माल (Raw Ingredients): शेफ तुरंत वास्तविक उत्पाद डेटा देखता है: जूते की फोटो, टेक्स्ट विवरण, ब्रांड का नाम और कैटेगरी टैग (जैसे, "Men's Fashion")।
- एक साथ खाना बनाना (Simultaneous Cooking): पहले सारांश लिखने और फिर अनुमान लगाने के बजाय, शेफ "कोड" (सेमेंटिक आईडी) और "फ्लेवर प्रोफाइल" (एम्बेडिंग) को बिल्कुल एक ही समय में पकाता है।
- वे कच्चे माल को देखते हैं और सीधे निर्णय लेते हैं: "यह एक उच्च गुणवत्ता वाला, स्टाइलिश, काला चमड़े का जूटा है।"
- वे कोड जनरेट करते हैं और जूते की गहरी समझ को एक साथ विकसित करते हैं।
- परिणाम: चूंकि कोड सीधे कच्चे माल से बनाया गया है, इसलिए अनुवाद में कोई जानकारी नहीं खोती है। कोड जूते के सार को पूरी तरह से पकड़ लेता है।
गुप्त सामग्रियां (वे इसे बेहतर कैसे बनाते हैं)
यह सुनिश्चित करने के लिए कि यह "शेफ" केवल अंदाज़ा न लगाए, UniSID दो विशेष तकनीकों का उपयोग करता है:
1. "ज़ूम लेंस" रणनीति (मल्टी-ग्रैनुलैरिटी कॉन्ट्रास्टिव लर्निंग)
एक मानचित्र को देखने की कल्पना करें।
- स्तर 1 (ज़ूम आउट): आप "उत्तरी अमेरिका" देखते हैं।
- स्तर 2 (ज़ूम इन): आप "USA" देखते हैं।
- स्तर 3 (क्लोज अप): आप "न्यूयॉर्क सिटी" देखते हैं।
पुराने तरीके में, रोबोट "USA" और "कनाडा" के बीच भ्रमित हो सकता है क्योंकि स्तरों को एक साथ नहीं सिखाया गया था। UniSID रोबोट को यह समझने के लिए प्रशिक्षित करता है कि "न्यूयॉर्क" USA के अंदर है, जो उत्तरी अमेरिका के अंदर है। यह कोड को हर ज़ूम स्तर पर सुसंगत रहने के लिए मजबूर करता है, जिससे रोबोट को पता चलता है कि कोई उत्पाद कितना विशिष्ट या सामान्य है।
2. "छिपे हुए अर्थ" का जासूस (समरी-बेस्ड रिकंस्ट्रक्शन)
कभी-कभी, उत्पाद का विवरण शाब्दिक होता है, लेकिन वास्तविक अर्थ छिपा होता है।
- इनपुट: "स्टेनलेस स्टील कप, 500ml, हाइकिंग के लिए।"
- छिपा हुआ अर्थ: "यह एक साहसी, बाहरी जीवनशैली (outdoor lifestyle) के लिए है।"
UniSID के पास एक विशेष ट्रिक है। यह एक स्मार्ट AI से उत्पाद के "वाइब" (छिपे हुए अर्थ) का एक संक्षिप्त सारांश लिखने के लिए कहता है। फिर, यह रोबोट को चुनौती देता है: "क्या तुम अभी बनाए गए कोड को देखकर इस सारांश का अनुमान लगा सकते हो?"
यदि रोबोट कोड से "साहसिक जीवनशैली" का अनुमान नहीं लगा पाता है, तो वह जानता है कि कोड में कुछ महत्वपूर्ण कमी है। यह कोड को केवल तथ्यों को ही नहीं, बल्कि विज्ञापन की आत्मा को भी पकड़ने के लिए मजबूर करता है।
परिणाम: यह क्यों मायने रखता है
पेपर ने वास्तविक डेटा (Tencent के विज्ञापन सिस्टम से) का उपयोग करके इस नए "शेफ" (UniSID) का पुराने "टेलीफोन खिलाड़ियों" (RQ-VAE, RQ-KMeans) के खिलाफ परीक्षण किया।
- बेहतर कोड: UniSID द्वारा बनाए गए कोड (सेमेंटिक आईडी) समान उत्पादों को एक साथ समूहबद्ध करने में बहुत अधिक सटीक थे।
- बेहतर सिफारिशें: विज्ञापनों की सिफारिश करने के लिए उपयोग किए जाने पर, UniSID ने मौजूदा सर्वोत्तम तरीकों की तुलना में काफी अधिक क्लिक (4.62% तक बेहतर) प्राप्त किए।
- कोई धुंधलापन नहीं: "दो-चरणीय" अनुवाद को छोड़कर, सिस्टम उत्पादों के सूक्ष्म विवरणों को नहीं खो सका।
संक्षेप में
यह पेपर तर्क देता है कि उत्पादों को कंप्यूटर कोड में बदलने का वर्तमान तरीका एक फोटोकॉपी की फोटोकॉपी बनाने जैसा है—यह धुंधला हो जाता है और विवरण खो देता है। UniSID एक नई विधि है जो मूल दस्तावेज़ को देखती है और सीधे कोड लिखती है, जो एक एकल, एकीकृत प्रक्रिया का उपयोग करती है। यह यह सुनिश्चित करने के लिए एक "क्विज़" प्रणाली का भी उपयोग करता है कि कोड उत्पाद की सतही विशेषताओं के बजाय उसके छिपे हुए व्यक्तित्व को भी पकड़े। परिणाम एक स्मार्ट, अधिक सटीक विज्ञापन सिफारिश प्रणाली है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।