← नवीनतम पेपर
💻 computer science

SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation

SAPO (Step-Aligned Policy Optimization) वैश्विक परिणाम पुरस्कारों (global outcome rewards) को स्टेप-अलाइन्ड, ग्रुप-रिलेटिव एडवांटेज से बदलकर जनरेटिव रिकमेंडेशन को बेहतर बनाता है, जो व्यक्तिगत रीजनिंग स्टेप्स और उनके संबंधित सिमेंटिक आइडेंटिफायर टोकन्स को क्रेडिट असाइन करता है, जिससे बड़े-कैटलॉग वाले परिदृश्यों में प्रशिक्षण को स्थिर करने और प्रदर्शन में सुधार करने में मदद मिलती है जहाँ सटीक-मैच फीडबैक अपर्याप्त होता है।

मूल लेखक: Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अनाड़ी रोबोट को सिखाने की कोशिश कर रहे हैं कि किसी खरीदार के लिए अगला सटीक आइटम कैसे सुझाया जाए। "जेनरेटिव रिकमेंडेशन" (Generative Recommendation) की दुनिया में, रोबोट केवल एक सूची से आइटम नहीं चुनता; उसे उस आइटम का नाम अक्षर-दर-अक्षर (या टोकन-दर-टोकन) लिखना होता है, जैसे कि किसी पहेली को सुलझाना हो।

इसे प्रबंधनीय बनाने के लिए, आइटम्स को साधारण नामों जैसे कि "Shoe" के बजाय सिमेंटिक आइडेंटिफायर (SIDs) दिए जाते हैं, जो एक तीन-भाग वाले पते के कोड की तरह होते हैं:

  1. व्यापक श्रेणी (जैसे, "Electronics")
  2. विशिष्ट प्रकार (जैसे, "Headphones")
  3. सटीक मॉडल (जैसे, "Sony WH-1000XM5")

रोबोट को चरण-दर-चरण सोचने के लिए प्रशिक्षित किया जाता है, जहाँ वह कोड के प्रत्येक भाग को लिखने से पहले उसका थोड़ा तर्क (reasoning) लिखता है।

समस्या: "सब-या-कुछ-नहीं" वाला ग्रेड (The "All-or-Nothing" Grade)

यह शोध पत्र पहचानता है कि पहले इन रोबोटों को कैसे प्रशिक्षित किया जाता था, उसमें एक बड़ी खामी थी।

कल्प_ना कीजिए कि एक छात्र तीन प्रश्नों वाली परीक्षा दे रहा है।

  • प्रश्न 1: फ्रांस की राजधानी क्या है? (उत्तर: पेरिस)
  • प्रश्न 2: जर्मनी की राजधानी क्या है? (उत्तर: बर्लिन)
  • प्रश्न 3: इटली की राजधानी क्या है? (उत्तर: रोम)

यदि छात्र प्रश्न 1 और 2 सही करता है लेकिन प्रश्न 3 में गलती कर देता है (रोम के बजाय "लंदन" लिख देता है), तो पुराने ज़माने का शिक्षक जो आउटकम-रिवॉर्ड (Outcome-Reward) का उपयोग करता है, वह पूरे टेस्ट को देखकर कहेगा: "तुमने शून्य प्राप्त किया। तुम फेल हो गए।"

फिर शिक्षक कहता है: "तुमने जो कुछ भी लिखा, उसे बदलने की ज़रूरत है।"

  • छात्र सोचता है: "ओह नहीं, इसका मतलब है कि मैं पेरिस और बर्लिन के बारे में भी गलत था!"
  • इसलिए, वह पेरिस और बर्लिन के सही उत्तरों को भी भूल जाता है क्योंकि उसने अंत में एक छोटी सी गलती कर दी थी।

हमारे शब्दों में, इसे एक्शन-ग्रैनुलैरिटी मिसमैच (Action-Granularity Mismatch) कहा जाता है। रोबोट को पूरे आइटम कोड के लिए एक एकल "पास/फेल" स्कोर मिलता है, भले ही उसने कोड के पहले दो भाग बिल्कुल सही लिखे हों। यह रोबोट को भ्रमित करता है, जिससे उसका प्रशिक्षण अस्थिर हो जाता है और वह अच्छे तर्क को भूल जाता है क्योंकि उसने अंत में एक छोटी सी गलती की थी।

समाधान: SAPO (स्टेप-अलाइन्ड पॉलिसी ऑप्टिमाइज़ेशन)

लेखकों ने एक नया तरीका प्रस्तावित किया है जिसे SAPO कहा जाता है। पूरे टेस्ट को एक साथ ग्रेड करने के बजाय, SAPO एक सख्त लेकिन निष्पक्ष ट्यूटर की तरह काम करता है जो प्रत्येक चरण (step) को व्यक्तिगत रूप से ग्रेड करता है।

यहाँ बताया गया है कि हमारा उदाहरण उपयोग करते हुए SAPO कैसे काम करता है:

  1. "स्टेप" की अवधारणा: रोबोट के काम को तीन अलग-अलग "चरणों" में विभाजित किया गया है।

    • चरण 1: व्यापक श्रेणी के बारे में सोचना + पहला कोड भाग लिखना।
    • चरण 2: विशिष्ट प्रकार के बारे में सोचना + दूसरा कोड भाग लिखना।
    • चरण 3: सटीक मॉडल के बारे में सोचना + तीसरा कोड भाग लिखना।
  2. निष्पक्ष ग्रेडिंग: यदि रोबोट चरण 1 और चरण 2 सही करता है लेकिन चरण 3 में विफल रहता है, तो SAPO कहता है:

    • "चरण 1 पर शानदार काम! इसे जारी रखें।" (सकारात्मक रिवॉर्ड)
    • "चरण 2 पर अच्छा काम! इसे जारी रखें।" (सकारात्मक रिवॉर्ड)
    • "आपने चरण 3 में गलती की। फिर से प्रयास करें।" (नकारात्मक रिवॉर्ड)
  3. परिणाम: रोबोट यह सीख जाता है कि उसके पहले दो भागों के लिए उसका तर्क वास्तव में सही था। उसे केवल अंतिम भाग को ठीक करने की आवश्यकता है। उसे अच्छी चीज़ों को फिर से सीखने या भूलने की ज़रूरत नहीं है।

यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने वास्तविक दुनिया के डेटा (जैसे ऑफिस सप्लाई, वीडियो गेम और औद्योगिक उपकरणों के लिए अमेज़न समीक्षाएं) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • स्थिरता (Stability): रोबोट प्रशिक्षण के दौरान पागल (oscillating) नहीं होता है। वह जो पहले से जानता है उसे भूलता नहीं है।
  • बेहतर सिफारिशें (Better Recommendations): क्योंकि रोबोट अपने विशिष्ट गलतियों से सीखता है न कि पूरे उत्तर के लिए दंडित होता है, इसलिए वह सही आइटम चुनने में बहुत बेहतर हो जाता है।
  • दक्षता (Efficiency): यह विशेष रूप से तब प्रभावी होता है जब "परफेक्ट मैच" दुर्लभ हो। पुराने तरीके में, यदि रोबोट 99% सही था, तो उसे शून्य क्रेडिट मिलता था। SAPO के साथ, उसे 99% के लिए क्रेडिट मिलता है और वह 1% से सीखता है।

बड़ी तस्वीर (The Big Picture)

यह शोध पत्र तर्क देता है कि जब कोई कार्य परतों (layers) में बनाया जाता है (जैसे कि एक पदानुक्रमित कोड या चरण-दर-चरण तर्क प्रक्रिया), तो प्रशिक्षण पद्धति को उन परतों का सम्मान करना चाहिए। आपको एक छात्र को उसके निष्कर्ष में हुई टाइपो (typo) के लिए दंडित नहीं करना चाहिए यदि उसका थीसिस स्टेटमेंट शानदार था।

SAPO केवल वह तरीका है जो यह सुनिश्चित करता है कि रोबोट को उन हिस्सों के लिए श्रेय मिले जो उसने सही किए हैं, ताकि वह अपनी ऊर्जा केवल उन हिस्सों को ठीक करने पर केंद्रित कर सके जो उसने गलत किए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →