From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल बैंक में प्रवेश कर रहे हैं।
समस्या: दरवाजे पर "भूलने की बीमारी" (The "Amnesia" at the Door)
पुराने दिनों में, यदि आप बैंक की वेबसाइट (यानी "प्री-लॉगिन" क्षेत्र) पर क्रेडिट कार्ड देखने या लोन दरों की तुलना करने के लिए जाते थे, तो बैंक का कंप्यूटर सिस्टम आपको एक अजनबी के रूप में देखता था। आप ब्राउज़ करते, इधर-उधर क्लिक करते, और फिर अपना वास्तविक खाता देखने के लिए लॉग इन करते। जैसे ही आप लॉग इन करते, सिस्टम कहता, "नमस्ते! मैं देख सकता हूँ कि आपका एक चालू खाता (checking account) है," लेकिन वह यह पूरी तरह से भूल जाता कि आपने अभी 20 मिनट तक मॉर्टगेज दरों (mortgage rates) को देखने में बिताए थे। यह बिल्कुल वैसा ही है जैसे आप किसी दुकान में जाएँ, एक घंटे तक सामान देखें, और फिर कैशियर आपका स्वागत ऐसे करे जैसे वह आपको पहले कभी नहीं जानता हो।
बैंक चाहता था कि उसे याद रहे कि लॉग इन करने से पहले आप क्या देख रहे थे, ताकि लॉग इन करने के बाद आपको बेहतर सुझाव दिए जा सकें। लेकिन इसके सामने दो बड़ी बाधाएँ थीं:
- पहचान का अंतर (The Identity Gap): यह साबित करना कठिन है कि वेबसाइट ब्राउज़ करने वाला "अजनबी" वही व्यक्ति है जिसने अभी ऐप में लॉग इन किया है।
- "ब्लैक बॉक्स" की समस्या (The "Black Box" Issue): भले ही वे आपके क्लिक को ट्रैक कर सकें, लेकिन कंप्यूटर क्लिक गिनने में तो माहिर हैं, पर यह समझाने में बहुत खराब हैं कि आपने क्लिक क्यों किया। वे कह सकते हैं, "इस व्यक्ति ने 5 बार क्लिक किया," लेकिन वे यह नहीं कह सकते कि, "यह व्यक्ति विशेष रूप से कम ब्याज वाले ऑटो लोन की तलाश में है।"
समाधान: एक दो-भाग वाला सुपर-सिस्टम (The Solution: A Two-Part Super-System)
शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो एक स्मार्ट, याद रखने वाले 'कंसीयर्ज' (concierge) की तरह काम करता है। इसके दो मुख्य कार्य हैं, जो एक मस्तिष्क और एक अनुवादक (translator) की तरह मिलकर काम करते हैं।
भाग 1: "मस्तिष्क" (द सेशन एम्बेडिंग - The Session Embedding)
अपने ब्राउज़िंग इतिहास को एक लंबे, अव्यवस्थित कार्यों के प्रवाह के रूप में सोचें: "क्रेडिट कार्ड पर क्लिक किया," नीचे स्क्रॉल किया, "ब्याज दरें" पर माउस घुमाया, "Apply" पर क्लिक किया, फिर छोड़ दिया।
यह सिस्टम इस पूरे प्रवाह को एक साथ पढ़ने के लिए एक विशेष प्रकार के AI (ट्रांसफॉर्मर) का उपयोग करता है। केवल क्लिक गिनने के बजाय, यह आपके पूरे ब्राउज़िंग सत्र को एक एकल, संक्षिप्त "डिजिटल फिंगरप्रिंट" (जिसे सेशन एम्बेडिंग कहा जाता है) में बदल देता है।
- उपमा (The Analogy): कल्पना कीजिए कि एक लाइब्रेरियन आपकी पूरी खरीदारी सूची पढ़ता है और फिर आपको एक एकल, सटीक इंडेक्स कार्ड थमाता है जो सारांशित करता है कि आपको वास्तव में क्या चाहिए। यह कार्ड इतना विस्तृत है कि यदि आप इसे बाद में बैंक के रिकमेंडेशन इंजन को दिखाते हैं, तो इंजन को ठीक पता चल जाता है कि आपको क्या दिखाना है।
- परिणाम: जब आप लॉग इन करते हैं, तो बैंक इस "फिंगरप्रिंट" का उपयोग करके आपके मोबाइल ऐप के होमपेज पर टाइल्स को पुनर्व्यवस्थित करता है। शोध में पाया गया कि इससे बैंक के सुझाव बहुत अधिक सटीक हो गए (उनकी भविष्यवाणी करने की क्षमता में लगभग 2% का सुधार हुआ) और उनकी भविष्यवाणियों में "शोर" (noise) कम हो गया।
भाग 2: "अनुवादक" (द एलएलएम-डिस्टिल्ड टैक्सोनॉमी - The LLM-Distilled Taxonomy)
"फिंगरप्रिंट" (भाग 1 से) कंप्यूटर के लिए तो बहुत अच्छा है, लेकिन यह मनुष्यों के लिए बेकार है। एक बैंक मैनेजर संख्याओं की एक स्ट्रिंग को देखकर यह नहीं कह सकता कि, "आह, इस ग्राहक को कार लोन चाहिए।" उन्हें शब्दों की आवश्यकता होती है।
यहीं पर दूसरा भाग काम आता है:
- शिक्षक (The Teacher - LLM): उन्होंने हजारों ऐसे "फिंगरप्रिंट्स" को पढ़ने और मानव-पठनीय लेबल वाली एक डिक्शनरी लिखने के लिए एक शक्तिशाली लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किया। इसने पैटर्न को देखा और कहा, "ठीक है, इन क्लिकों का समूह 'क्रेडिट कार्ड प्री-अप्रूवल की तलाश' को दर्शाता है, और उस समूह का अर्थ है 'ट्रैवल रिवॉर्ड्स की जांच करना'।"
- छात्र (The Student - Distilled Classifier): शक्तिशाली LLM हर दिन लाखों लोगों के लिए चलाना धीमा और महंगा है। इसलिए, उन्होंने इस "शिक्षक" की नकल करने के लिए एक छोटे, सुपर-फास्ट "छात्र" मॉडल को प्रशिक्षित किया।
- उपमा (The Analogy): कल्पना कीजिए कि एक प्रतिभाशाली प्रोफेसर (LLM) 10,000 छात्रों की एक कक्षा को पढ़ा रहा है। प्रोफेसर बहुत व्यस्त है कि वह व्यक्तिगत रूप से हर एक पेपर को ग्रेड कर सके। इसलिए, प्रोफेसर एक आदर्श ग्रेडिंग रूब्रिक (grading rubric) लिखता है और एक तेज़, कुशल शिक्षण सहायक (distilled model) को प्रशिक्षित करता है जो उस रूब्रिक का उपयोग करके पेपर को ग्रेड करे। सहायक प्रोफेसर जितना सटीक तो नहीं है (वह 93% सटीक है), लेकिन वह हजारों गुना तेज़ी से काम करता है।
यह क्यों महत्वपूर्ण है (परिणाम - Why This Matters)
शोध पत्र दिखाता है कि यह दो-भाग वाला सिस्टम एक 'विन-विन' (win-win) स्थिति है:
- कंप्यूटर के लिए (मात्रात्मक/Quantitative): "फिंगरप्रिंट" (एम्बेडिंग) सबसे अच्छा भविष्यवक्ता है। इसने बैंक को पिछले किसी भी तरीके की तुलना में यह अनुमान लगाने में मदद की कि उपयोगकर्ता कौन से उत्पाद खरीदेंगे।
- मनुष्यों के लिए (गुणात्मक/Qualitative): "अनुवादक" (distilled labels) ने बैंक प्रबंधकों को स्पष्ट, पठनीय कारण दिए कि किसी उपयोगकर्ता को कोई चीज़ क्यों सुझाई गई। अब वे कह सकते हैं, "हमने इस उपयोगकर्ता को ट्रैवल डील दिखाई क्योंकि हमारे सिस्टम ने लॉग इन करने से पहले यह पता लगाया कि वे 'वेकेशन पैकेज की रिसर्च' कर रहे थे।"
- गति (Speed): पुराने तरीके में, जिसमें शक्तिशाली LLM का सीधे उपयोग किया जाता था, एक दिन के डेटा को प्रोसेस करने में घंटों लग जाते। नया "छात्र" मॉडल इसे सेकंडों में करता है, जिससे इसे रियल-टाइम में उपयोग करना संभव हो जाता है।
संक्षेप में
शोधकर्ताओं ने "अनाम वेब ब्राउज़िंग" और "प्रमाणित ऐप उपयोग" के बीच एक पुल बनाया है। उन्होंने एक ऐसा सिस्टम बनाया है जो याद रखता है कि लॉग इन करने से पहले आपने क्या देखा था, उस व्यवहार को कंप्यूटर के उपयोग के लिए एक गणितीय "फिंगरप्रिंट" में अनुवादित करता है, और साथ ही उसी फिंगरप्रिंट को मनुष्यों के समझने के लिए सरल अंग्रेजी लेबल में अनुवादित करता है। यह वित्तीय संस्थानों को आपको आपके खाते के बैलेंस के आधार पर नहीं, बल्कि आपके वास्तविक इरादे (intent) के आधार पर, लॉग इन करते ही व्यक्तिगत और प्रासंगिक सुझाव देने में सक्षम बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।