← नवीनतम पेपर
💬 NLP

Thinking Broad, Acting Fast: Latent Reasoning Distillation from Multi-Perspective Chain-of-Thought for E-Commerce Relevance

यह शोध पत्र ई-कॉमर्स प्रासंगिकता मॉडलिंग के लिए एक नवीन ढांचे का प्रस्ताव करता है जो मल्टी-परस्पेक्टिव चेन-ऑफ-थॉट को डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन के साथ जोड़कर और परिष्कृत तर्क क्षमताओं की कुशल, कम-विलंबता वाले परिनियोजन को सक्षम करने के लिए लेटेंट रीजनिंग नॉलेज डिस्टिलेशन को पेश करके एकल-परिप्रेक्ष्य तर्क और उच्च अनुमान विलंबता की सीमाओं को संबोधित करता है।

मूल लेखक: Baopu Qiu, Hao Chen, Yuanrong Wu, Changtong Zan, Chao Wei, Weiru Zhang, Xiaoyi Zeng

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Baopu Qiu, Hao Chen, Yuanrong Wu, Changtong Zan, Chao Wei, Weiru Zhang, Xiaoyi Zeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Thinking Broad, Acting Fast" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "स्मार्ट लेकिन धीमा" बनाम "तेज़ लेकिन मूर्ख" की समस्या

कल्पना कीजिए कि आप एक विशाल ऑनलाइन स्टोर चला रहे हैं (जैसे Amazon या AliExpress)। हर दिन, लाखों लोग "dog pool" या "red dress" जैसे सर्च क्वेरी टाइप करते हैं। आपका काम उन्हें तुरंत उनके लिए एकदम सही उत्पाद दिखाना है।

  • पुराना तरीका: आपके पास तेज़, कुशल कर्मचारी हैं (पारंपरिक AI मॉडल)। वे सरल चीजों को मिलाने में माहिर हैं (जैसे, "लाल" का मिलान "लाल" से), लेकिन वे पेचीदा सवालों या लंबी, जटिल विवरणों से भ्रमित हो जाते हैं।
  • नया विचार (LLMs): आप इस काम में मदद के लिए एक प्रतिभाशाली, पीएचडी स्तर के प्रोफेसर (एक लार्ज लैंग्वेज मॉडल या LLM) को काम पर रखते हैं। यह प्रोफेसर बारीकियों, व्यंग्य और जटिल नियमों को समझने में अद्भुत है। हालाँकि, यह प्रोफेसर धीमा है। उन्हें सोचने और अपना तर्क लिखने में काफी समय लगता है। यदि आप उनसे हर ग्राहक के लिए हर एक उत्पाद की जाँच करने को कहें, तो वेबसाइट फ्रीज हो जाएगी, और ग्राहक चले जाएंगे।

लक्ष्य: पेपर का लक्ष्य उस धीमे प्रोफेसर की प्रतिभाशाली सोच को तेज़ कर्मचारियों को सिखाना है, ताकि कर्मचारी प्रोफेसर की तरह सोच सकें लेकिन प्रकाश की गति से काम कर सकें।


दो बड़ी समस्याएँ जिन्हें उन्होंने हल किया

लेखकों ने इसे हल करने के पिछले प्रयासों में दो मुख्य समस्याओं की पहचान की:

1. "एक-दृष्टिकोण" की अंधापन (The "One-View" Blind Spot)

उपमा: कल्पना कीजिए कि आप यह तय करने की कोशिश कर रहे हैं कि एक पुरानी कार खरीदना एक अच्छा सौदा है या नहीं।

  • एकल परिप्रेक्ष्य: आप केवल इंजन को देखते हैं। यदि इंजन अच्छा है, तो आप कहते हैं "खरीद लो!" आप यह देखना भूल जाते हैं कि टायर घिस चुके हैं या पेंट उखड़ रहा है।
  • पेपर का समाधान (बहु-परिप्रेक्ष्य): लेखकों ने महसूस किया कि ई-कॉमर्स जटिल है। आपको एक साथ तीन अलग-अलग कोणों से कार को देखने की आवश्यकता है:
    1. उपयोगकर्ता का इरादा (User Intent): "खरीददार वास्तव में क्या चाहता है?" (जैसे, "मुझे अपने कुत्ते के लिए एक पूल चाहिए, न कि बच्चों का टब।")
    2. संरचित विश्लेषण (Structured Analysis): "क्या विशिष्ट विवरण मेल खाते हैं?" (जैसे, "क्वेरी में 'आयताकार' लिखा है, लेकिन पूल 'गोल' है।")
    3. व्यावसायिक नियम (Business Rules): "क्या स्टोर के कुछ विशेष नियम हैं?" (जैसे, "यह एक एक्सेसरी है, मुख्य उत्पाद नहीं, इसलिए इसे शीर्ष परिणाम के रूप में नहीं दिखाया जाना चाहिए।")

पेपर का "टीचर" मॉडल केवल एक कोण नहीं चुनता; यह अंतिम निर्णय लेने के लिए इन तीनों पर नज़र रखता है।

2. "घोस्ट रीजनिंग" की समस्या (The "Ghost Reasoning" Problem)

उपमा: कल्पना कीजिए कि प्रोफेसर यह समझाने के लिए 5 पन्नों का विस्तृत निबंध लिखता है कि कोई उत्पाद एक अच्छा मिलान क्यों है। फिर आप इस निबंध से सीखने के लिए एक छात्र को काम पर रखते हैं।

  • पुराना तरीका: छात्र निबंध पढ़ता है, अंतिम उत्तर ("अच्छा मिलान") को याद करता है, और फिर निबंध को फेंक देता है। जब छात्र काम पर होता है, तो वह केवल उत्तर के आधार पर अनुमान लगाता है, यह भूल जाता है कि प्रोफेसर ने उसे कैसे समझा था।
  • पेपर का समाधान (लेटेंट रीजनिंग): लेखकों ने एक ऐसा तरीका बनाया जिससे छात्र निबंध को ज़ोर से लिखे बिना भी प्रोफेसर के तर्क को एक "मानसिक नोट" के रूप में रख सके। उन्होंने निबंध के तर्क को एक संक्षिप्त, अदृश्य "रीजनिंग वेक्टर" (reasoning vector) में संकुचित (distill) कर दिया जिसे छात्र अपने दिमाग में रखता है। यह छात्र को प्रोफेसर के गहरे तर्क को तुरंत उपयोग करने की अनुमति देता है, बिना धीमी लेखन प्रक्रिया के।

उन्होंने यह कैसे किया: ट्रेनिंग कैंप

यह प्रक्रिया तीन मुख्य चरणों में हुई:

  1. शिक्षक को स्मार्ट बनाना (MPCoT):
    उन्होंने एक शक्तिशाली AI (Qwen3-14B) लिया और उसे तीन अलग-अलग दृष्टिकोणों (User Intent, Structure, Rules) से उत्तर उत्पन्न करना सिखाया। उन्होंने इसे केवल अनुमान लगाने नहीं दिया; उन्होंने इसे अभ्यास कराया जब तक कि यह इन तीनों दृश्यों को पूरी तरह से जोड़ नहीं सकता था। उन्होंने DPO (Direct Preference Optimization) नामक तकनीक का भी उपयोग किया, जो एक कोच की तरह AI को बताता है: "जब 'User Intent' का दृश्य और 'Business Rules' का दृश्य आपस में टकराते हैं, तो यहाँ आपको किस पर भरोसा करना चाहिए।"

  2. छात्र सीखना (LRKD):
    उन्होंने एक बहुत छोटे, तेज़ AI (एक BERT मॉडल) को शिक्षक के उत्तर दिखाए। लेकिन केवल उन्हें अंतिम "हाँ/नहीं" दिखाने के बजाय, उन्होंने छात्र को उत्तर के पीछे के छिपे हुए तर्क को दिखाया। उन्होंने छात्र को एक विशेष "एक्सट्रैक्शन मॉड्यूल" (extraction module) रखने के लिए प्रशिक्षित किया जो इनपुट डेटा से तर्क के सार को निकाल सके, जो शिक्षक की विचार प्रक्रिया की नकल करता है।

  3. परिणाम:
    छात्र मॉडल अविश्वसनीय रूप से तेज़ (मिलीसेकंड में) हो गया लेकिन उसने शिक्षक की "स्मार्ट सोच" को बरकरार रखा।


वास्तविक दुनिया के परिणाम

उन्होंने परीक्षण के लिए एक वास्तविक ई-कॉमर्स प्लेटफॉर्म का उपयोग किया जो करोड़ों लोगों को सेवा दे रहा है।

  • ऑफलाइन टेस्ट: नया मॉडल पिछले मॉडलों की तुलना में लोगों को क्या चाहिए, इसका अनुमान लगाने में काफी अधिक सटीक था।
  • ऑनलाइन टेस्ट (लाइव टेस्ट): जब उन्होंने वास्तव में वेबसाइट को इस नए मॉडल का उपयोग करने के लिए स्विच किया:
    • राजस्व (Revenue) 1.42% बढ़ गया: लोग अधिक चीजें खरीद रहे थे क्योंकि उन्हें जो चाहिए था वह उन्हें तेज़ी से मिल गया।
    • क्लिक्स (Clicks) 0.48% बढ़ गए: लोगों ने विज्ञापनों पर अधिक क्लिक किए।
    • संतुष्टि बढ़ गई: उपयोगकर्ताओं को लगा कि खोज परिणाम उनकी ज़रूरतों के लिए अधिक प्रासंगिक थे।

एक वाक्य में सारांश

यह पेपर एक तेज़, छोटे AI को एक धीमे, स्मार्ट विशेषज्ञ की तरह सोचना सिखाता है, जिसमें विशेषज्ञ समस्याओं को कई कोणों से देखता है और फिर उस जटिल तर्क को एक छोटे, अदृश्य "दिमागी नोट" में संकुचित कर देता है जिसे तेज़ AI तुरंत उपयोग कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →