← नवीनतम पेपर
🤖 AI

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

यह शोध पत्र AIR (एटॉमिक इंटेंट रीजनिंग) प्रस्तुत करता है, जो एक औद्योगिक-ग्रेड क्रॉस-डोमेन अनुशंसा ढांचा है जो कुआइशौ के वास्तविक दुनिया के परिनियोजन में महत्वपूर्ण अनुमान त्वरण और पर्याप्त GMV सुधार प्राप्त करने के लिए ऑफलाइन LLM इन्फरेंस और कुशल ऑनलाइन रिट्रीवल का लाभ उठाकर कंटेंट और ई-कॉमर्स के बीच के सिमेंटिक गैप को पाटता है।

मूल लेखक: Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय रूप से धीमे और महंगे व्यक्तिगत शॉपर हैं जिसका नाम "LLM" है। यह शॉपर मानवीय इच्छाओं को समझने में अत्यंत कुशल है। यदि आप उन्हें बताते हैं, "मैंने एक प्यारे बिल्ली का वीडियो देखा और फिर बिल्ली का खाना खरीदा," तो वे तुरंत यह निष्कर्ष निकाल सकते हैं, "आह, इस व्यक्ति को बिल्लियाँ पसंद हैं और शायद वे अब बिल्ली का पेड़ (cat tree) खरीदना चाहेंगे।"

लेकिन, एक समस्या है: यह शॉपर आपको उत्तर देने में 8 सेकंड लेता है। ऑनलाइन शॉपिंग की दुनिया में (जैसे कुआईशौ - Kuaishou, एक विशाल चीनी ऐप), आपको मिलीसेकंड में उत्तर चाहिए। यदि शॉपर बहुत धीमा है, तो ग्राहक स्टोर छोड़कर जा चुका होगा। साथ ही, हर उपयोगकर्ता के इंटरैक्शन के लिए इस शॉपर को काम पर रखना बहुत महंगा पड़ता है।

यह पेपर इस समस्या को हल करने के लिए AIR (Atomic Intent Reasoning) नामक एक नया सिस्टम पेश करता है। AIR को एक कुशल आर्किटेक्ट और लाइब्रेरियन के रूप में समझें जो ग्राहक के आने से पहले काम करता है, ताकि वास्तविक खरीदारी तुरंत हो सके।

AIR कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "प्री-गेम" तैयारी (ऑफलाइन चरण)

धीमे "LLM शॉपर" को रियल-टाइम में सोचने के लिए कहने के बजाय, AIR सारा भारी काम ऑफलाइन (जब कोई देख नहीं रहा होता) करता है।

  • एटॉमिक ब्रेकडाउन (Atomic Breakdown): सिस्टम उपयोगकर्ता के बिखरे हुए इतिहास (वीडियो देखना, विज्ञापनों पर क्लिक करना, चीजें खरीदना) को लेता है और LLM से इसे छोटे, स्पष्ट "इंटेंट एटम्स" (इच्छा के कणों) में तोड़ने के लिए कहता है।
    • उपमा: इसके बजाय कि यह कहे, "मैंने एक बिल्ली का वीडियो देखा, फिर एक कार का वीडियो देखा, फिर बिल्ली का खाना खरीदा," सिस्टम इसे विशिष्ट, लेबल वाले कार्डों में अनुवादित करता है: [Action: Watch] + [Object: Cat Video] = Intent: Cat Lover
  • लाइब्रेरी (The Library): इन "इंटेंट कार्डों" को एक विशाल, अत्यधिक व्यवस्थित लाइब्रेरी (Intent Tree) में व्यवस्थित किया जाता है और सुरक्षित रखा जाता है। यह भोजन को पहले से पकाने और फ्रीज करने जैसा है, ताकि जब ग्राहक ऑर्डर दे, तो आपको शून्य से खाना न बनाना पड़े।

2. "फ्लैश" सर्विस (ऑनलाइन चरण)

जब वास्तव में कोई उपयोगकर्ता ऐप पर आता है, तो सिस्टम धीमे LLM को नहीं बुलाता। इसके बजाय, यह एक सुपर-फास्ट लाइब्रेरियन की तरह काम करता है।

  • खोज (The Search): सिस्टम देखता है कि उपयोगकर्ता अभी क्या कर रहा है (उदाहरण के लिए, वे एक "बैडमिंटन" रैकेट देख रहे हैं)।
  • रिट्रीवल (The Retrieval): यह तुरंत लाइब्रेरी की ओर दौड़ता है और केवल उन "इंटेंट कार्डों" को निकाल लेता है जो बैडमिंटन से मेल खाते हैं। यह उन सभी चीजों को अनदेखा कर देता है जो प्रासंगिक नहीं हैं (जैसे पिछले महीने उपयोगकर्ता द्वारा देखे गए बिल्ली के वीडियो, जब तक कि वे प्रासंगिक न हों)।
  • असेंबली (The Assembly): यह उन प्रासंगिक कार्डों को जल्दी से एक साथ जोड़ता है ताकि उपयोगकर्ता की वर्तमान इच्छा की एक स्पष्ट तस्वीर बनाई जा सके।

3. "नॉइज़ फ़िल्टर" (शोर फिल्टर)

उपयोगकर्ता के व्यवहार का डेटा अक्सर अव्यवस्थित और विशाल होता है (जैसे एक लाइब्रेरी जिसमें लाखों किताबें हैं, जिनमें से अधिकांश वर्तमान ग्राहक के लिए अप्रासंगिक हैं)।

  • रूपक (The Metaphor): कल्पना करें कि आप घास के ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। पुराने तरीके में, आप पूरे घास के ढेर को देखते थे। AIR एक चुंबक (Target-Aware Retrieval) का उपयोग करता है जो केवल सुइयों (प्रासंगिक इच्छाओं) को खींचता है और घास (शोर/बेकार डेटा) को अनदेखा कर देता है।
  • यह सिस्टम को बिना भ्रमित हुए या धीमा हुए भारी मात्रा में डेटा को संभालने की अनुमति देता है।

4. परिणाम: गति और बुद्धिमत्ता

उपयोगकर्ता के डेटा को पहले से "सोचकर" और फिर तुरंत "निकालकर" (retrieving), AIR दो अद्भुत चीजें हासिल करता है:

  • गति: यह सीधे LLM को कॉल करने की तुलना में 400 गुना तेज़ है। यह 8 सेकंड से घटकर मात्र 20 मिलीसेकंड हो जाता है।
  • सटीकता: क्योंकि यह कार्यों के पीछे के अर्थ को समझने के लिए LLM के "दिमाग" का उपयोग करता है (न कि केवल संख्याओं का), यह पुराने सिस्टमों की तुलना में बेहतर भविष्यवाणी करता है कि उपयोगकर्ता क्या खरीदना चाहता है।

वास्तविक दुनिया का प्रमाण

लेखकों ने इसका परीक्षण कुआईशौ (Kuaishou) पर किया, जो करोड़ों उपयोगकर्ताओं वाला एक विशाल प्लेटफॉर्म है।

  • परीक्षण: उन्होंने एक वास्तविक दुनिया का प्रयोग (A/B टेस्ट) चलाया, जहाँ आधे उपयोगकर्ताओं को पुराना सिस्टम मिला और आधे को AIR मिला।
  • जीत: AIR समूह ने कंपनी के लिए 3.4% अधिक पैसा (GMV) कमाया। बड़े व्यवसाय की दुनिया में, यह एक बहुत बड़ी जीत है। इसने उन उपयोगकर्ताओं की भी मदद की जिनके पास बहुत कम इतिहास था ("कोल्ड स्टार्ट" की समस्या), क्योंकि इसने LLM द्वारा बनाए गए "इंटेंट कार्डों" के आधार पर उनकी रुचियों का अनुमान लगाया।

संक्षेप में:
AIR एक चतुर तरीका है जो कंपनियों को "सुपर-स्मार्ट" लार्ज लैंग्वेज मॉडल के दिमाग का उपयोग करने देता है, बिना उसकी "धीमी और महंगी" कीमत चुकाए। यह उपयोगकर्ता के डेटा को आसानी से पढ़े जाने वाले कार्डों में पहले से ही पचा लेता है, ताकि जब कोई क्लिक करे, तो सिस्टम पलक झपकते ही कह सके, "मुझे पता है कि आप क्या चाहते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →