← नवीनतम पेपर
💬 NLP

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM एक नवीन फ्रेमवर्क है जिसे WeChat Pay में तैनात किया गया है जो एक कॉम्पैक्ट डिस्क्रीट वोकैबुलरी (compact discrete vocabulary), एक टू-स्टेज एलाइनमेंट प्रोजेक्टर और प्रीफिक्स-गाइडेड कैपेबिलिटी इंजेक्शन के माध्यम से लार्ज लैंग्वेज मॉडल्स को बिहेवियरल-सीक्वेंस मॉडलिंग के साथ उन्नत करता है, जिससे मॉडल की मूल भाषाई क्षमताओं को सुरक्षित रखते हुए मर्चेंट रिस्क कंट्रोल और रिकमेंडेशन बेंचमार्क में स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होते हैं।

मूल लेखक: Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक जासूस है जो शब्दों में लिखे सुरागों को पढ़ने में अविश्वसनीय रूप से चतुर है—जैसे कि डायरी का कोई अंश या कोई समाचार लेख। यह जासूस एक लार्ज लैंग्वेज मॉडल (LLM) है, एक प्रकार का कंप्यूटर मस्तिष्क जिसे लगभग उस सब पर प्रशिक्षित किया गया है जो मनुष्यों ने कभी लिखा है। यह व्यंग्य समझ सकता है, कहानियों का सारांश निकाल सकता है, और जटिल विचारों को किसी भी अन्य व्यक्ति से बेहतर समझा सकता है। लेकिन इस जासूस की एक कमजोरी है: यह क्रियाओं की एक लंबी सूची को नहीं पढ़ सकता, जैसे कि हर बार कॉफी खरीदने, पार्क जाने या स्क्रीन टैप करने का एक टाइमलाइन। इस सूची को "व्यवहार अनुक्रम" (behavioral sequence) कहा जाता है।

वास्तविक दुनिया में, विशेष रूप से ऑनलाइन भुगतान के स्थानों पर, सच्चाई अक्सर दोनों के मिश्रण में छिपी होती है। एक दुकान अपने विवरण (टेक्स्ट) में पूरी तरह से सामान्य दिख सकती है, लेकिन उसके लेनदेन का इतिहास (व्यवहार) दिखा सकता है कि वह केवल रात के 3 बजे विभिन्न प्रांतों में संचालित होती है, जो बुजुर्गों को निशाना बनाती है। यदि आप केवल विवरण पढ़ते हैं, तो आप खतरे को चूक जाते हैं। यदि आप केवल लेनदेन की सूची देखते हैं, तो आप संदर्भ को खो देते हैं। वैज्ञानिक जिस चुनौती का सामना कर रहे हैं वह इस शब्द-चतुर जासूस को यह सिखाना है कि वह सोचने की अपनी क्षमता को खोए बिना, समय के साथ होने वाली क्रियाओं के टाइमलाइन को भी समझ सके। यदि आप जासूस को लाखों टाइमलाइन याद करने के लिए मजबूर करते हैं, तो यह इतना भ्रमित हो सकता है कि वह एक साधारण वाक्य लिखना भी भूल जाए। यह शोध पत्र ठीक इसी समस्या पर प्रहार करता है: एक भाषा विशेषज्ञ को सोचने की अपनी क्षमता खोए बिना, समय में पैटर्न पहचानने की सुपरपावर कैसे दी जाए।


शोध पत्र की कहानी: जासूस को टाइमलाइन पढ़ना सिखाना

WeChat Pay और कुछ विश्वविद्यालयों के शोधकर्ताओं ने एक चतुर नया ढांचा तैयार किया जिसे SeqLLM कहा गया है। इसे हमारे शब्द-चतुर जासूस के लिए एक विशेष प्रशिक्षण शिविर के रूप में समझें। उनका लक्ष्य यह था कि जासूस एक मर्चेंट (व्यापारी) की प्रोफाइल (टेक्स्ट) और उनके लेनदेन के लंबे इतिहास (व्यवहार) को एक साथ देख सके ताकि धोखाधड़ी का पता लगाया जा सके।

पुराने तरीके के साथ समस्या
पहले, यदि आप चाहते थे कि एक भाषा मॉडल क्रियाओं की सूची को समझे, तो आप शायद उस सूची को एक कहानी के रूप में लिखने की कोशिश करते। "पहले, उपयोगकर्ता ने एक शर्ट खरीदी। फिर, उन्होंने जूते खरीदे..." लेकिन यह एक ऐसे उपन्यास को पढ़ने जैसा है जहाँ हर एक शब्द एक संख्या है; यह बहुत लंबा हो जाता है, और जासूस इससे अभिभूत हो जाता है।

एक अन्य तरीका यह था कि जासूस को क्रियाओं के लिए एक पूरी नई संख्या की भाषा सिखाई जाए। लेकिन इसका एक डरावना दुष्प्रभाव था: जैसे-जैसे जासूस इस नई भाषा को सीखता, वह अपनी पुरानी भाषा भूलने लगता। यह एक छात्र के नया विषय सीखने जैसा था कि वे अपनी मातृभाषा बोलना ही भूल गए। इसे "कैटास्ट्रॉफ़िक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है। शोध पत्र दिखाता है कि यदि आप मानक तरीकों का उपयोग करके इस तरह से मॉडल को सिखाने की कोशिश करते हैं, तो इसकी सामान्य भाषा समझने की क्षमता 0.78 के उच्च स्कोर से गिरकर एक भयानक 0.27 पर आ सकती है।

SeqLLM समाधान: तीन जादुई तरकीबें
लेखकों ने केवल समस्या पर अधिक डेटा नहीं डाला; उन्होंने तीन विशिष्ट भागों के साथ एक स्मार्ट सिस्टम बनाया:

  1. कॉम्पैक्ट वोकैबुलरी (संक्षिप्त शब्दावली - द शॉर्टहैंड): "मैंने दोपहर 2 बजे $200 की वस्तु खरीदी" लिखने के बजाय, उन्होंने एक विशेष संक्षिप्त कोड बनाया। उन्होंने हर क्रिया को छोटे, विशिष्ट टोकन में तोड़ दिया जैसे <Time:2PM>, <Amount:200>, और <Channel:QR>। यह जासूस को रेत के ढेर के बजाय लेगो (Lego) ब्रिक्स का एक सेट देने जैसा है। यह बहुत छोटा, साफ है, और उन शब्दों के साथ नहीं मिलता जो जासूस पहले से जानता है।
  2. अनुवादक (द ब्रिज): ये नए लेगो ब्रिक्स (टोकन) जासूस के लिए शुरू में अर्थहीन हैं। इसलिए, उन्होंने एक "प्रोजेक्टर" बनाया, जो एक अनुवादक की तरह है जो जासूस को सिखाता है कि प्रत्येक ब्रिक का क्या अर्थ है। उन्होंने केवल मॉडल पर ब्रिक्स नहीं फेंके; उन्होंने दो-चरणीय पाठ का उपयोग किया। पहले, उन्होंने मॉडल को ब्रिक्स को वापस सामान्य अंग्रेजी में अनुवाद करना सिखाया (उदाहरण के लिए, <Time:2PM> को "2 PM" में बदलना)। एक बार जब मॉडल अर्थ समझ गया, तो वे दूसरे चरण पर चले गए: तर्क (reasoning)। उन्होंने मॉडल से ब्रिक्स के पूरे अनुक्रम को देखने और पैटर्न समझाने के लिए कहा, जैसे "यह व्यक्ति केवल देर रात खरीदारी करता है।"
  3. गुप्त प्रीफिक्स (द ट्रेनिंग मास्क): यह सबसे महत्वपूर्ण तरकीब है। आमतौर पर, मॉडल को नया कौशल सिखाने के लिए, आप उसे उस कौशल पर लगातार अभ्यास कराते हैं, जिससे वह बाकी सब कुछ भूल जाता है। SeqLLM एक "प्रीफिक्स-गाइडेड" विधि का उपयोग करता है। कल्पना करें कि जासूस को हर कार्य से पहले एक विशिष्ट निर्देश कार्ड दिया जाता है, जैसे "अब, एक टाइमलाइन विश्लेषक के रूप में कार्य करें।" मॉडल केवल तभी टाइमलाइन कौशल सीखता है जब वह विशिष्ट कार्ड मौजूद होता है। जब कार्ड हटा दिया जाता है, तो मॉडल बस अपने सामान्य, स्मार्ट रूप में कार्य करता है। यह "टाइमलाइन लर्निंग" को फैलने और जासूस के सामान्य ज्ञान को खराब करने से रोकता है।

उन्होंने क्या पाया
परिणाम प्रभावशाली थे। जब उन्होंने इस नई पद्धति का परीक्षण किया:

  • कोई स्मृति हानि नहीं: मॉडल ने पुराने, भूलने वाले तरीकों की तरह ही एक अनुक्रम में अगली क्रिया की भविष्यवाणी करना सीखा (स्कोर 0.806 बनाम 0.804), लेकिन इसने अपने भाषा कौशल को बरकरार रखा (0.27 तक गिरने के बजाय 0.789 स्कोर किया)।
  • WeChat Pay में वास्तविक सफलता: उन्होंने जोखिम भरे मर्चेंट्स की जांच करने के लिए इस सिस्टम को प्रतिदिन लाखों मर्चेंट्स की जांच के लिए तैनात किया। अपने पिछले सर्वश्रेष्ठ सिस्टम की तुलना में, नए SeqLLM ने 97.5% शुद्धता (precision) (92.0% से ऊपर) के साथ जोखिम भरे मर्चेंट्स को पकड़ा। इससे भी बेहतर, निर्दोष मर्चेंट्स की गुस्से भरी अपीलों की संख्या 12% से घटकर लगभग 2% हो गई, और उन्होंने गलती से किसी भी दोषी मर्चेंट को नहीं छोड़ा।
  • बेहतर धोखाधड़ी का पता लगाना: जब उन्होंने एक अलग धोखाधड़ी डिटेक्टर की मदद करने के लिए नए सिस्टम की "समझ" का उपयोग किया, तो इसने शीर्ष-स्तरीय धोखाधड़ी का पता लगाने में 26.8 प्रतिशत अंक का सुधार किया। अरबों लेनदेन संसाधित करने वाले सिस्टम के लिए यह एक बहुत बड़ी छलांग है।
  • सामान्य प्रतिभा: उन्होंने मूवी और बुक रिकमेंडेशन पर भी परीक्षण किया। इसने सही अगली वस्तु खोजने में अन्य शीर्ष मॉडलों को 32% तक पछाड़ दिया, और यह सब करते हुए इसने प्रतिस्पर्धा की तुलना में 4.8 गुना कम कंप्यूटिंग पावर का उपयोग किया।

उन्होंने किसे खारिज किया
शोध पत्र स्पष्ट रूप से दिखाता है कि व्यवहार को एक लंबी कहानी के रूप में लिखना (serialization) काम नहीं करता; वास्तव में इसने सिस्टम को बदतर बना दिया, जिससे शुद्धता गिरकर 83% हो गई। उन्होंने यह भी साबित किया कि आप केवल अधिक भाषा डेटा जोड़कर भूलने की समस्या को "ठीक" नहीं कर सकते; एक बार जब मॉडल भूल जाता है, तो उसे वापस पाना कठिन होता है। एकमात्र तरीका जो काम आया वह था प्रीफिक्स-गाइडेड पद्धति का उपयोग करके भूलने से पहले ही उसे रोकना।

संक्षेप में, SeqLLM एक तरीका है जिससे आप एक भाषा विशेषज्ञ को समय में पैटर्न देखने के लिए एक नई जोड़ी आँखें दे सकते हैं, बिना उसके बोलने की क्षमता को खोए। यह डिजिटल दुनिया में मुसीबत पहचानने का एक स्मार्ट, तेज़ और अधिक सटीक तरीका है, जो यह साबित करता है कि आपको एक कौशल प्राप्त करने के लिए दूसरे का त्याग करने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →