← नवीनतम पेपर
🤖 machine learning

Skip-Connected Policy Optimization for Implicit Advantage

यह शोध पत्र स्किप-कनेक्टेड पॉलिसी ऑप्टिमाइजेशन (SKPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो डेंस रिवॉर्ड सेटिंग्स में उच्च-विचलन एडवांटेज एस्टीमेशन समस्याओं को हल करने के लिए एक स्किप कनेक्शन के साथ रीजनिंग को अपस्ट्रीम और डाउनस्ट्रीम चरणों में विभाजित करता है, जिससे गणितीय और सामान्य रीजनिंग बेंचमार्क पर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Skip-Connected Policy Optimization for Implicit Advantage" (SKPO) के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: AI तर्क करने का "अनुमान लगाने वाला खेल" (The Guessing Game)

कल्पना कीजिए कि आप एक छात्र (एक AI) को एक जटिल गणित का सवाल हल करना सिखा रहे हैं।

  • पुराना तरीका (GRPO): आप छात्र को शुरू से अंत तक पूरा समाधान लिखने देते हैं। यदि वे अंतिम उत्तर सही पाते हैं, तो आप उन्हें एक 'गोल्ड स्टार' देते हैं। यदि वे गलत होते हैं, तो आप उन्हें एक 'लाल X' देते हैं।
    • दोष: छात्र को यह नहीं पता होता कि कौन सा कदम अच्छा था या बुरा। क्या उन्होंने पहली ही पंक्ति में गलती की? या बस आखिरी गणना में? उन्हें केवल अनुमान लगाना पड़ता है।
  • "बारीक-स्तर" (Fine-Grained) का सपना: आदर्श रूप से, आप चाहेंगे कि आप हर एक वाक्य को ग्रेड दें। "चरण 3 पर बहुत अच्छा काम किया! लेकिन चरण 5 गलत था।"
    • वास्तविकता की जाँच: इसे करने के लिए, आपको छात्र से समाधान को 100 बार लिखने के लिए कहना होगा, चरण 5 पर रुकना होगा, और देखना होगा कि वहां से वे कितनी बार सही उत्तर तक पहुँचते हैं। इसमें बहुत समय लगता है और कंप्यूटर पावर का एक बड़ा हिस्सा खर्च होता है। यदि आप इसे पर्याप्त बार नहीं करते हैं, तो आपकी ग्रेडिंग केवल 'रैंडम नॉइज़' (शोर) होगी और छात्र भ्रमित हो जाएगा, जिससे वह उस स्थिति से भी बदतर सीखेगा जब आपने केवल अंतिम उत्तर को ग्रेड दिया होता।

पेपर की खोज: सीमित कंप्यूटर पावर के साथ हर एक चरण को ग्रेड करने की कोशिश करना वास्तव में केवल अंतिम उत्तर को ग्रेड देने से भी बुरा है, क्योंकि वे "ग्रेड" बहुत शोर भरे (noisy) होते हैं और अक्सर गलत होते हैं।


समाधान: SKPO (एक "स्मार्ट कोच" रणनीति)

लेखकों ने एक नई विधि प्रस्तावित की है जिसे SKPO (Skip-Connected Policy Optimization) कहा जाता है। इसे दो चरणों वाली कोचिंग रणनीति के रूप में सोचें जो बिना भारी लागत के दोनों दुनियाओं का सर्वश्रेष्ठ लाभ उठाती है।

चरण 1: "स्केच" (Upstream)

छात्र को पूरा निबंध लिखने के लिए कहने के बजाय, आप उनसे केवल पहला आधा हिस्सा (रूपरेखा या सेटअप) लिखने के लिए कहते हैं।

  • ट्रिक: आप इस आधे हिस्से को तुरंत ग्रेड नहीं करते हैं। इसके बजाय, आप उस आधे हिस्से को लेते हैं, और आप छात्र से उस स्केच के आधार पर कहानी को 8 अलग-अलग तरीकों से पूरा करने के लिए कहते हैं।
  • पुरस्कार (Reward): यदि उन 8 में से 6 अंत सही हैं, तो आप जानते हैं कि स्केच अच्छा था! आप स्केच को "अच्छा काम किया" का पुरस्कार देते हैं। यदि केवल 1 सही है, तो स्केच कमजोर था।
  • यह क्यों काम करता है: आप एक "डेंस" (dense) रिवॉर्ड (कहानी के बीच में एक ग्रेड) प्राप्त करते हैं, बिना कहानी के हर एक शब्द को ग्रेड दिए।

चरण 2: "फिनिश" (Downstream)

अब, छात्र उसी स्केच को लेता है और पूर्ण समाधान लिखता है।

  • "स्किप कनेक्शन" (जादुई सामग्री): यह सबसे महत्वपूर्ण हिस्सा है। जब छात्र दूसरा आधा हिस्सा लिखना शुरू करता है, तो उन्हें उस स्केच को छोड़ने (skip) की अनुमति होती है जिसे उन्होंने अभी लिखा है और यदि वे चाहें तो सीधे मूल समस्या पर वापस जा सकते हैं।
    • उपमा: कल्पना कीजिए कि छात्र एक कहानी लिख रहा है। उन्होंने एक बेहतरीन शुरुआती पैराग्राफ (स्केच) लिखा। लेकिन फिर उन्हें एहसास होता है, "रुको, मेरा शुरुआती पैराग्राफ मुझे एक उबाऊ अंत की ओर ले जा रहा है।"
    • एक सामान्य सिस्टम में, वे उस शुरुआती पैराग्राफ के साथ बंधे हुए हैं।
    • SKPO में, छात्र के पास एक "जादुई इरेज़र" (magic eraser) है। वे अपने शुरुआती पैराग्राफ को देख सकते हैं, तय कर सकते हैं कि यह बुरा है, और कह सकते हैं, "दरअसल, चलिए इसे छोड़ देते हैं और मूल प्रॉम्प्ट से नए सिरे से शुरू करते हैं।"
    • यह क्यों मायने रखता है: यह AI को एक खराब विचार प्रक्रिया में "फँसने" से रोकता है। यह स्केच के अच्छे हिस्सों से सीखते हुए भी नए विचारों को खोजने की स्वतंत्रता बनाए रखता है।

इंजीनियरिंग का जादू: इसे तेज़ करना

आमतौर पर, इस दो-चरणीय प्रक्रिया में दोगुना समय लगेगा (आधा लिखें, रुकें, पूरा लिखें)। लेखकों ने एक चतुर इंजीनियरिंग ट्रिक (जिसे "KV Cache rewriting" कहा जाता है) बनाई है जो कंप्यूटर को दोनों चरणों को एक ही पास (single pass) में करने देती है। यह एक ऐसे शेफ की तरह है जो रसोई की गति को धीमा किए बिना सब्जियां काटने और सूप पकाने का काम एक साथ कर सकता है।


यह एक बड़ी बात क्यों है? (The "Implicit Advantage")

पेपर ने एक आश्चर्यजनक साइड इफेक्ट पाया। भले ही AI को स्पष्ट रूप से "बेहतर मध्य चरण" लिखने के लिए नहीं कहा गया था, लेकिन SKPO के साथ प्रशिक्षित AI ने स्वचालित रूप से उच्च गुणवत्ता वाले मध्य चरण लिखना शुरू कर दिया।

  • उपमा: दो धावकों की कल्पना करें।
    • धावक A (पुराना तरीका) तेज़ दौड़ता है लेकिन ट्रैक के बीच में बहुत लड़खड़ाता है क्योंकि उसे पता नहीं होता कि कहाँ कदम रखना है।
    • धावक B (SKPO) बीच में अधिक सहज, आत्मविश्वासी कदम उठाना सीखता है, भले ही केवल फिनिश लाइन ही मायने रखती हो।
  • परिणाम: SKPO गणित के परीक्षणों, कोडिंग कार्यों और सामान्य तर्क (reasoning) में वर्तमान अत्याधुनिक (state-of-the-art) विधियों को पछाड़ देता है। यह केवल सही उत्तर प्राप्त करने के बारे में नहीं है; यह एक स्मार्ट और अधिक तार्किक पथ के माध्यम से वहां पहुँचने के बारे में है।

एक वाक्य में सारांश

SKPO AI को बेहतर तर्क चरण लिखना सिखाता है, इसे एक "ड्राफ्ट" चरण देकर जिसे इस आधार पर ग्रेड किया जाता है कि वह समाधान तक कितनी अच्छी तरह ले जाता है, जबकि AI को उस ड्राफ्ट को छोड़ने की स्वतंत्रता भी देता है यदि वह एक डेड एंड (बंद रास्ता) साबित हो जाए—और यह सब प्रशिक्षण प्रक्रिया को धीमा किए बिना किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →