← नवीनतम पेपर
🤖 machine learning

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

यह शोध पत्र PageLLM को प्रस्तुत करता है, जो एक मल्टी-ग्रेन्ड रिवॉर्ड फ्रेमवर्क है जो पूरे-पेज खोज और अनुशंसा के लिए मोटे तौर पर पेज-स्तरीय सुसंगतता (coherence) और सूक्ष्म स्तर पर आइटम-स्तरीय प्लेसमेंट को एक साथ अनुकूलित करने के लिए निहित उपयोगकर्ता फीडबैक का लाभ उठाता है, जिससे महंगी मानवीय एनोटेशन की आवश्यकता के बिना रैंकिंग मेट्रिक्स और उत्पादन व्यावसायिक KPIs में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे डिजिटल डिपार्टमेंट स्टोर के मैनेजर हैं। हर बार जब कोई ग्राहक अंदर आता है, तो आपके पास उन्हें दिखाने के लिए उत्पादों का एक बहुत बड़ा गोदाम होता है। आपका काम केवल कुछ अच्छे आइटम चुनना नहीं है; आपको उनके लिए एक पूरा शॉपिंग पेज व्यवस्थित करना है।

यही होल-पेज ऑप्टिमाइज़ेशन (WPO) की चुनौती है। केवल सही जूते दिखाना ही काफी नहीं है; आपको यह भी तय करना है कि:

  • आपको पेज पर जूतों को कहाँ रखना चाहिए?
  • क्या आपको उन्हें मोजों के बगल में दिखाना चाहिए या एक टेंट के बगल में?
  • क्या आप बहुत अधिक लाल जूते दिखा रहे हैं और पर्याप्त नीले जूते नहीं दिखा रहे हैं?
  • क्या पेज बहुत ज्यादा भरा हुआ है, या यह उबाऊ रूप से दोहराव वाला है?

लंबे समय तक, कंप्यूटर इसमें संघर्ष करते रहे क्योंकि वे पूरे चित्र को समझने के लिए बहुत "मूर्ख" थे, या उन्हें हर सिंगल पेज लेआउट को मैन्युअल रूप से ग्रेड करने के लिए महंगे मानव प्रबंधकों की आवश्यकता होती थी।

यहाँ PageLLM आता है, एक नई प्रणाली जो एक "सुपर-इंटेलिजेंट असिस्टेंट" (एक लार्ज लैंग्वेज मॉडल) का उपयोग करती है ताकि ये पेज स्वचालित रूप से डिज़ाइन किए जा सकें। लेकिन इसमें एक पेच है, लेखकों ने पाया कि AI को केवल यह कहना कि "एक अच्छा पेज बनाओ" काम नहीं करता है। यह एक शेफ को यह बताने जैसा है कि "एक स्वादिष्ट भोजन बनाओ," बिना यह निर्दिष्ट किए कि उसे स्टेक के स्वाद (व्यक्तिगत आइटम) पर ध्यान केंद्रित करना चाहिए या पूरे मेनू के संतुलन (पेज लेआउट) पर।

यहाँ बताया गया है कि PageLLM इसे कैसे हल करता है, सरल उपमाओं का उपयोग करके:

1. समस्या: "अंधा" शेफ

AI का उपयोग करने के पिछले प्रयासों में दो बड़ी समस्याएं थीं:

  • "मानव ग्रेडिंग" की बाधा: AI को सिखाने के लिए, आपको आमतौर पर इंसानों की आवश्यकता होती है जो दो अलग-अलग पेजों को देखें और कहें, "मुझे पेज A, पेज B से बेहतर लगा।" करोड़ों उपयोगकर्ताओं के लिए यह करना बहुत महंगा और धीमा है।
  • "सिंगल-ग्रेन" की गलती: अधिकांश AI सिस्टम केवल एक ही तरीके से समस्या को देखते थे।
    • कुछ केवल व्यक्तिगत वस्तुओं को देखते थे (जैसे, "क्या उपयोगकर्ता ने इस विशिष्ट जूते पर क्लिक किया?")। यह एक ऐसे शेफ की तरह है जिसे केवल इस बात की परवाह है कि स्टेक पका है या नहीं, जबकि सूप ठंडा है और सलाद मुरझाया हुआ है।
    • अन्य केवल पूरे पेज को देखते थे (जैसे, "क्या यह पेज विविध है?")। यह एक ऐसे शेफ की तरह है जिसे मेनू के संतुलन की परवाह है लेकिन वह यह ध्यान नहीं देता कि स्टेक जल गया है।

2. समाधान: "दो-आंखों वाला" रिवॉर्ड सिस्टम

लेखकों ने महसूस किया कि AI को सिखाने के लिए, आपको दो अलग-अलग प्रकार के फीडबैक की आवश्यकता है जो एक साथ काम कर रहे हों, जैसे कि दो आंखों वाला एक शेफ: एक आंख विवरणों के लिए, दूसरी बड़ी तस्वीर के लिए।

उन्होंने PageLLM नामक एक प्रणाली बनाई जो "इम्प्लिसिट फीडबैक" (जो उपयोगकर्ता वास्तव में करते हैं, जैसे क्लिक और खरीदारी) का उपयोग करती है, न कि मनुष्यों से पेज को ग्रेड करने के लिए पूछने के लिए। उन्होंने इस बिखरे हुए डेटा को चार प्रकार के "प्रशिक्षण परिदृश्यों" में बदल दिया:

  1. प्रासंगिकता (Relevance): वे आइटम दिखाना जिन्हें उपयोगकर्ता निश्चित रूप से नहीं चाहता है।
  2. रैंकिंग (Ranking): यह देखने के लिए आइटमों का क्रम बदलना कि क्या उपयोगकर्ता को इस बात से फर्क पड़ता है कि कौन सा पहले है।
  3. विविधता (Diversity): केवल एक ही प्रकार के आइटमों (जैसे, केवल लाल जूते) वाला पेज दिखाना ताकि AI को सिखाया जा सके कि विविधता अच्छी होती है।
  4. पुनरावृत्ति (Redundancy): यह सिखाने के लिए कि बहुत अधिक समान आइटमों को एक साथ क्लस्टर करना गलत है, बहुत सारे समान आइटम दिखाना।

3. जादू का नुस्खा: "कोर्स" और "फाइन" रिवॉर्ड्स

यह मुख्य नवाचार है। PageLLM एक ही डेटा पर दो अलग-अलग रिवॉर्ड हेड्स (सोचिए कि ये दो अलग-अलग जज हैं) को प्रशिक्षित करता है:

  • जज A (पेज-लेवल कोच): यह जज एक साथ पूरे शॉपिंग पेज को देखता है। वे पूछते हैं, "क्या यह एक संतुलित, सुसंगत सूची है? क्या यह विभिन्न श्रेणियों को कवर करता है?" वे यह पहचानने में माहिर हैं कि क्या पूरा मेनू उबाऊ या दोहराव वाला है।
  • जज B (आइटम-लेवल कोच): यह जज व्यक्तिगत वस्तुओं और उनकी स्थिति को देखता है। वे पूछते, "क्या इस आइटम को स्थिति 5 से 2 में बदलने से उपयोगकर्ता ने अधिक क्लिक किया?" वे उन सूक्ष्म, महत्वपूर्ण विवरणों को पकड़ने में माहिर हैं जिन्हें बड़ी तस्वीर मिस कर देती है।

दोनों क्यों?
पेपर में पाया गया कि यदि आप केवल जज A का उपयोग करते हैं, तो AI एक सुंदर दिखने वाला पेज बनाता है लेकिन उन विशिष्ट वस्तुओं को मिस कर देता है जिन्हें उपयोगकर्ता खरीदना चाहता है। यदि आप केवल जज B का उपयोग करते हैं, तो AI बेहतरीन आइटम चुनता है लेकिन उन्हें एक अस्त-व्यस्त, भ्रमित करने वाले तरीके से व्यवस्थित करता है।

  • परिणाम: जब आप दोनों जजों को मिलाते हैं, तो यह केवल एक जज का उपयोग करने की तुलना में आइटमों को सही ढंग से रैंक करने में 46.8% बेहतर हो जाता है। यह एक कंडक्टर (जज A) को सुनिश्चित करने जैसा है कि ऑर्केस्ट्रा एक साथ बज रहा है, जबकि एक सोलोइस्ट कोच (जज B) यह सुनिश्चित करता है कि प्रत्येक वायलिन वादक सही नोट बजाए।

4. वास्तविक दुनिया का प्रमाण

टीम ने इसे केवल लैब में टेस्ट नहीं किया; उन्होंने इसे 10 मिलियन उपयोगकर्ताओं के साथ एक वास्तविक ई-कॉमर्स साइट पर आज़माया।

  • परिणाम: इस प्रणाली ने स्टोर की कुल बिक्री (GMV) में 0.44% और क्लिक की संख्या में 0.14% की वृद्धि की।
  • यह क्यों मायने रखता है: लाखों ग्राहकों वाले व्यवसाय में, ऐसा छोटा प्रतिशत दसहजारों अतिरिक्त बिक्री में बदल जाता है।

5. "लेजी" डिप्लॉयमेंट बोनस

इस प्रणाली का एक चतुर साइड इफेक्ट यह है कि इसे लागू करना आसान है। क्योंकि "पेज-लेवल कोच" (जज A) पूरी लिस्ट को देखने में इतना अच्छा है, इसलिए कंपनी पूरी तरह से फुल AI चलाने के लिए अपने शक्तिशाली सर्वरों (GPUs) को अपग्रेड करने के दौरान, अपने मौजूदा, धीमे कंप्यूटर सर्वरों (CPUs) पर केवल उस हिस्से का उपयोग कर सकती है। यह मेनू के स्केच का उपयोग करने जैसा है, इससे पहले कि आपके पास हाई-डेफिनिशन फोटो तैयार हो।

सारांश

PageLLM ऑनलाइन शॉपिंग पेजों को व्यवस्थित करने का एक नया तरीका है। मनुष्यों से हर पेज को ग्रेड करने के लिए कहने के बजाय, यह AI को पेज लेआउट के "बुरे उदाहरण" (बहुत अधिक दोहराव, गलत क्रम, विविधता की कमी) दिखाकर सिखाता है। यह दो अलग-अलग फीडबैक लूप का उपयोग करता है—एक बड़ी तस्वीर के लिए और दूसरा सूक्ष्म विवरणों के लिए—यह सुनिश्चित करने के लिए कि AI ऐसे पेज बनाए जो तार्किक रूप से संतुलित भी हों और उपयोगकर्ता जो क्लिक करना चाहता है उसके लिए बिल्कुल सही समय पर भी हों। परिणाम एक स्मार्ट, अधिक लाभदायक शॉपिंग अनुभव है जिसके लिए मानव ग्रेडर्स की टीम की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →