← नवीनतम पेपर
💬 NLP

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

यह शोध पत्र एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो क्रॉस-डोमेन संकेतों से रुचि-संचालित खोज क्वेरी उत्पन्न करने के लिए बड़े भाषा मॉडलों का लाभ उठाता है, और स्केलेबल, उच्च-प्रदर्शन वाली क्रॉस-डोमेन समाचार अनुशंसा प्राप्त करने के लिए GRPO-आधारित नीति अनुकूलन और ऑन-पॉलिसी डिस्टिलेशन का उपयोग करता है।

मूल लेखक: Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लाखों किताबों वाली एक विशाल, अस्त-व्यस्त लाइब्रेरी में कदम रखते हैं। आप वहां पहले कभी नहीं गए हैं और आप लाइब्रेरियन को भी नहीं जानते। आप एक ऐसी किताब ढूंढना चाहते हैं जो आपको पसंद आए, लेकिन आप किसी विशिष्ट शीर्षक के बारे में नहीं पूछ सकते क्योंकि आप अभी तक यह नहीं जानते कि वहां क्या-क्या मौजूद है।

यह बिल्कुल वही समस्या है जिसका सामना न्यूज़ रिकमेंडेशन (समाचार अनुशंसा) सिस्टम हर दिन करते हैं। उन्हें यह अनुमान लगाना होता है कि आप क्या पढ़ना चाहते हैं, और इसके लिए वे आपके बिखरे हुए और अस्त-व्यस्त इतिहास का उपयोग करते हैं: आपने क्या क्लिक किया, आपने क्या खोजा, और आपने अन्य वेबसाइटों पर क्या देखा।

यह शोध पत्र (paper) इस पहेली को सुलझाने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके एक नया, अधिक स्मार्ट तरीका बताता है। यह इस कहानी की तरह है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. समस्या: "शोर वाला" (Noisy) उपयोगकर्ता

एक उपयोगकर्ता के डिजिटल इतिहास को सुरागों के एक अस्त-व्यस्त बॉक्स की तरह समझें।

  • कुछ सुराग सोने जैसे हैं: "मैंने अंतरिक्ष अन्वेषण के बारे में एक कहानी पर क्लिक किया।"
  • कुछ सुराग कचरा हैं: "मैंने अपने फोन नंबर को देखते समय गलती से एक लिंक पर क्लिक कर दिया," या "मैंने केवल समय देखने के लिए 'मौसम' सर्च किया।"

पुराने सिस्टम केवल इस बात को गिनकर अनुमान लगाने की कोशिश करते थे कि आपने समान चीजों पर कितनी बार क्लिक किया। लेकिन वे अक्सर "कचरा" सुरागों से भ्रमित हो जाते थे और आपकी गहरी, छिपी हुई रुचियों (जैसे 19वीं सदी की कविता के प्रति आपका गुप्त प्रेम) को पहचानने में विफल रहते थे, क्योंकि वे केवल सतही पैटर्न पर बहुत अधिक ध्यान केंद्रित करते थे।

2. समाधान: "सुपर-शरलॉक" शिक्षक

लेखकों ने एक लार्ज लैंग्वेज मॉडल (LLM) बनाया है—आइए इसे "सुपर-शरलॉक" कहें।

केवल क्लिक गिनने के बजाय, यह सुपर-शरलॉक आपके सुरागों के अस्त-व्यस्त बॉक्स को देखता है और यह समझने के लिए तर्क (reasoning) का उपयोग करता है कि आप वास्तव में कौन हैं।

  • कार्य: AI का काम उन सर्च क्वेरीज़ (खोज प्रश्नों) की एक सूची लिखना है जो आप टाइप करेंगे यदि आप अपना आदर्श समाचार लेख खोजने की कोशिश कर रहे हों।
  • जादू: यदि आपने कुछ टेक लेखों और एक इतिहास ब्लॉग पर क्लिक किया है, तो सुपर-शरलॉक केवल "टेक" नहीं कहेगा। वह तर्क दे सकता है, "आह, इस व्यक्ति को आर्टिफिशियल इंटेलिजेंस के इतिहास में रुचि है," और एक विशिष्ट क्वेरी जनरेट कर सकता है जैसे "AI विकास का इतिहास।"

3. प्रशिक्षण: "गेम शो" (रीइन्फोर्समेंट लर्निंग)

आप एक सुपर-शरलॉक को इसमें कुशल कैसे बना सकते हैं? आप उसे केवल एक पाठ्यपुस्तक का उत्तर नहीं दे सकते क्योंकि ऐसा कोई उत्तर मौजूद ही नहीं है। इसके बजाय, उन्होंने रीइन्फोर्समेंट लर्निंग (विशेष रूप से GRPO) नामक एक विधि का उपयोग किया।

एक गेम शो की कल्पना करें जहाँ AI 5 अलग-अलग सर्च क्वेरी की सूचियाँ बनाता है।

  • जज (निर्णायक): पांच अलग-अलग "जज" (रिवॉर्ड्स) प्रत्येक सूची को स्कोर देते हैं:
    1. लाइब्रेरियन: क्या इस क्वेरी ने वास्तव में प्रासंगिक लेख खोजे?
    2. ब्रॉडकास्टर: क्या यह सूची उन सभी विभिन्न विषयों को कवर करती है जिनमें उपयोगकर्ता की रुचि है?
    3. विशिष्टता (Specifics): क्या क्वेरी बहुत अस्पष्ट (जैसे "न्यूज़") है या पर्याप्त विशिष्ट (जैसे "SpaceX रॉकेट लॉन्च विवरण") है?
    4. विविधता: क्या AI ने बस एक ही चीज़ को पाँच बार दोहराया, या इसमें विविधता है?
    5. नियम का पालन करने वाला: क्या AI ने फॉर्मेटिंग नियमों का पालन किया?

AI इस खेल को हजारों बार खेलता है, अच्छी सूचियों के लिए अंक प्राप्त करता है और खराब सूचियों के लिए अंक खोता है। समय के साथ, वह उपयोगकर्ता की रुचियों का अनुमान लगाने के लिए "परफेक्ट रणनीति" सीख जाता है।

4. समस्या: "भारी" शिक्षक

यहाँ एक पेच है: सुपर-शरलॉक बहुत विशाल (heavy) है। यह एक प्रतिभाशाली प्रोफेसर की तरह है जो पहेली को पूरी तरह से हल कर सकता है, लेकिन उसे सोचने में 10 सेकंड लगते हैं और उसे कमरे में रखने के लिए भारी खर्च आता है। एक वास्तविक न्यूज़ ऐप में, आपको मिलीसेकंड में उत्तर चाहिए, और आपके पास लाखों उपयोगकर्ता हैं। आप हर एक उपयोगकर्ता के लिए प्रोफेसर रखने का खर्च नहीं उठा सकते।

5. समाधान: "चेला" (डिस्टिलेशन)

यहीं पर शोध पत्र का दूसरा बड़ा विचार आता है: डिस्टिलेशन (Distillation)

लेखकों ने "भारी" सुपर-शरलॉक (शिक्षक) को लिया और एक छोटे, तेज़ चेले (Apprentice/Student) को प्रशिक्षित किया।

  • उन्होंने चेले को केवल अंतिम उत्तर नहीं दिए। उन्होंने चेले को समस्याओं के माध्यम से सोचने की प्रक्रिया को देखते रहने दिया।
  • चेला शिक्षक की तर्क प्रक्रिया की नकल करना सीखता है, लेकिन वह इसे बहुत तेज़ी से और बहुत छोटे मस्तिष्क के साथ करता है।

परिणाम: चेला शिक्षक से 60 गुना छोटा है लेकिन फिर भी शिक्षक की 90% प्रतिभा बनाए रखता है। अब, न्यूज़ ऐप इस तेज़, सस्ते चेले का उपयोग करके पलक झपकते ही यह अनुमान लगा सकता है कि आप क्या पढ़ना चाहते हैं।

6. प्रमाण: क्या यह काम करता है?

उन्होंने एक बड़े न्यूज़ प्लेटफॉर्म पर वास्तविक दुनिया में इसका परीक्षण किया।

  • ऑफलाइन टेस्ट: नए सिस्टम ने पुराने सभी तरीकों की तुलना में बेहतर लेख खोजे।
  • "कोल्ड स्टार्ट" की जीत: यह नए उपयोगकर्ताओं (जिनका कोई इतिहास नहीं है) की मदद करने में विशेष रूप से अच्छा था। क्योंकि सिस्टम उपयोगकर्ता द्वारा की गई अन्य चीजों (जैसे Google पर किसी विशिष्ट विषय को खोजना) के बारे में तर्क कर सकता था, इसलिए यह एक भी समाचार लेख पर क्लिक करने से पहले ही उनकी समाचार रुचियों का अनुमान लगा सकता था।
  • वास्तविक जीवन: जब उन्होंने इसे वास्तविक उपयोगकर्ताओं के लिए चालू किया, तो अधिक लोग साइट पर वापस आए (DAU) और उन्होंने अधिक लेखों पर क्लिक किया (CTR)।

सारांश उपमा (Analogy)

  • पुराना तरीका: एक रोबोट जो गिनता है कि आपने कितनी बार लाल कारों को देखा और मान लेता है कि आपको केवल लाल कारें ही पसंद हैं।
  • नया तरीका (शिक्षक): एक जासूस जो आपकी लाल कारों की तस्वीरें, "तेज़ इंजन" के लिए आपकी खोज और रेसिंग ट्रैक पर जाने के आपके इतिहास को देखता है, और फिर निष्कर्ष निकालता है: "इस व्यक्ति को हाई-स्पीड स्पोर्ट्स कारें पसंद हैं।"
  • नवाचार: उन्होंने एक प्रतिभाशाली जासूस को प्रशिक्षित किया, फिर एक छोटे, सुपर-फास्ट इंटर्न को वही काम करने के लिए प्रशिक्षित किया ताकि कंपनी हर ग्राहक के लिए एक को नियुक्त करने का खर्च उठा सके।

यह शोध पत्र एक बड़ी उपलब्धि है क्योंकि यह साबित करता है कि तर्क (reasoning) (आपने क्यों क्लिक किया इसके बारे में गहराई से सोचना) केवल पैटर्न मैचिंग (क्लिक गिनना) से बेहतर है, और यह दिखाता है कि उस भारी सोच को वास्तविक दुनिया के लिए तेज़ कैसे बनाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →