← नवीनतम पेपर
🤖 machine learning

Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation

यह शोध पत्र एंकोर्ड रेसिडुअल ऑन-पॉलिसी डिस्टिलेशन (AR-OPD) प्रस्तुत करता है, जो एक डुअल-व्यू फ्रेमवर्क है जो स्थानीय रूप से सुलभ तर्क (locally reachable reasoning) को भविष्य-सशर्त ओरेकल संकेतों (future-conditioned oracle signals) से अलग करके विशेषाधिकार प्राप्त ऑन-पॉलिसी डिस्टिलेशन में सुधार करता है ताकि पश्चदृष्टि पूर्वाग्रह (hindsight bias) को रोका जा सके और दीर्घकालिक तर्क प्रदर्शन को बढ़ाया जा सके।

मूल लेखक: Wenhao Zhang

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक "जादुई चीट शीट" के साथ छात्र को पढ़ाना

कल्पना कीजिए कि आप एक छात्र (AI मॉडल) को एक बहुत कठिन गणित का सवाल हल करना सिखा रहे हैं। आपके पास एक "शिक्षक" (Teacher) है जो एक विशेषज्ञ है।

पारंपरिक शिक्षण में, शिक्षक समस्या को चरण-दर-चरण हल करता है, और छात्र हर कदम की नकल करने की कोशिश करता है। इसे ऑन-पॉलिसी डिस्टिलेशन (On-Policy Distillation) कहा जाता है। यह अच्छा काम करता है, लेकिन कभी-कभी शिक्षक इतना बुद्धिमान होता है कि छात्र उसका साथ देने की कोशिश में भ्रमित हो जाता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नई विधि विकसित की जिसे प्रिविलेज्ड OPD (Privileged OPD) कहा गया। इस संस्करण में, शिक्षक को एक "जादुई चीट शीट" (जिसे प्रिविलेजेड इंफॉर्मेशन या ओरेकल ट्रेसेस कहा जाता है) मिलती है, जो शिक्षक द्वारा लिखना शुरू करने से पहले ही अंतिम उत्तर और वहां तक पहुँचने का सही रास्ता दिखा देती है। इसके बाद शिक्षक इस चीट शीट को देखते हुए समाधान लिखता है, और छात्र शिक्षक की नकल करने की कोशिश करता है।

समस्या: पेपर का तर्क है कि यह "जादुई चीट शीट" एक जाल बनाती है। क्योंकि शिक्षक तुरंत अंतिम उत्तर देख लेता है, इसलिए वे कठिन सोच वाले चरणों को छोड़ सकते हैं और सीधे निष्कर्ष पर पहुँच सकते हैं। जब छात्र शिक्षक की नकल करने की कोशिश करता है, तो वह एक ऐसे "शॉर्टकट" को सीख रहा होता है जिसका उसके लिए कोई अर्थ नहीं है क्योंकि उसके पास वह चीट शीट नहीं है। यह वैसा ही है जैसे शिक्षक गणित समझाने से पहले ही कागज पर अंतिम उत्तर लिख दे, और छात्र बिना तर्क समझे बस उत्तर को रट ले।

समाधान: AR-OPD (एंकर्ड रेसिडुअल गाइडेंस)

लेखकों ने इस समस्या को ठीक करने के लिए एक नई विधि प्रस्तावित की जिसे AR-OPD (Anchored Residual Guidance) कहा जाता है। उन्होंने महसूस किया कि आपको छात्र को शिक्षक की पूरी "चीट शीट" वाली दृष्टि की नकल करने के लिए मजबूर नहीं करना चाहिए। इसके बजाय, आपको शिक्षण को दो भागों में विभाजित करना चाहिए:

  1. द एंकर (सुरक्षित आधार - The Anchor):
    कल्पना कीजिए कि शिक्षक को एक "आंशिक चीट शीट" (Partial Cheat Sheet) दी जाती है। यह समस्या का आधा हिस्सा और सेटअप दिखाती है, लेकिन यह अंतिम उत्तर को छिपा देती है। शिक्षक इस आंशिक दृश्य के आधार पर एक समाधान लिखता है। यह समाधान वास्तविक और छात्र के लिए सुलभ (reachable) है क्योंकि यह भविष्य को जानने पर निर्भर नहीं है। यह एंकर है। यह छात्र को उस तर्क में बनाए रखता है जिसका वे वास्तव में पालन कर सकते हैं।

  2. द रेसिडुअल (कोमल संकेत - The Residual):
    अब, शिक्षक पूरी चीट शीट (अंतिम उत्तर के साथ) को देखता है और देखता है कि "परफेक्ट पाथ" (सही रास्ता) "पार्शियल पाथ" (आंशिक रास्ते) से कैसे भिन्न है। छात्र को पूरी चीज़ की नकल करने के लिए मजबूर करने के बजाय, शिक्षक उस अंतर को—यानी उस "अतिरिक्त अंतर्दृष्टि" को कि उत्तर किस दिशा में जा रहा है—एक छोटे, नियंत्रित नज (nudge/संकेत) के रूप में छात्र को देता है।

उपमा (Analogy):
इसे एक हाइकिंग गाइड की तरह समझें।

  • पुरानी विधि (पूर्ण अनुकरण - Full Imitation): गाइड आपको एक नक्शा देता है जिसमें मंजिल और सही रास्ता दिखाया गया है, लेकिन उस रास्ते में एक ऐसा पुल भी शामिल है जो अभी तक बना ही नहीं है। आप उस पर चलने की कोशिश करते हैं, खाई में गिर जाते हैं, और भ्रमित हो जाते हैं।
  • AR-OPD: गाइड पहले आपको उस रास्ते का नक्शा दिखाता है जिस पर आप वर्तमान में चल रहे हैं (एंकर)। फिर, वे फुसफुसाते हैं, "वैसे, यदि आप इस दिशा में चलते रहे, तो आप अंततः शिखर तक पहुँच जाएंगे" (रेसिडुअल)। आप उस सुरक्षित रास्ते का पालन करते हैं जिसे आप देख सकते हैं, लेकिन आपको धीरे से सही मंजिल की ओर निर्देशित किया जाता है।

यह बेहतर क्यों काम करता है

पेपर का परीक्षण गणित, कोडिंग, विज्ञान और चिकित्सा संबंधी प्रश्नों पर किया गया। यहाँ उन्हें क्या मिला:

  • कम "जादुई" शॉर्टकट: पुरानी विधि ने AI को "हैलुसिनेट" (भ्रमित होना) करने या स्टेप्स छोड़ने के लिए मजबूर किया क्योंकि वह एक ऐसे भविष्य की नकल करने की कोशिश कर रहा था जिसे वह देख नहीं सकता था। AR-OPD ने इन "शॉर्टकट" त्रुटियों को 21.7% कम कर दिया।
  • लंबे कार्यों में बेहतर प्रदर्शन: जब समस्याएँ बहुत लंबी (768 टोकन से अधिक, जो एक लंबे निबंध की तरह है) हो गईं, तो पुरानी विधि विफल होने लगी क्योंकि "चीट शीट" बहुत ध्यान भटकाने वाली हो गई थी। AR-OPlet AR-OPD स्थिर रहा और पुराने तरीके की तुलना में इन लंबे कार्यों पर 7.2 अंक बेहतर प्रदर्शन किया।
  • कुल स्कोर: AR-OPD ने पिछले सर्वश्रेष्ठ तरीकों को स्पष्ट अंतर से पीछे छोड़ दिया (यह "फुल प्रिविलेज्ड" विधि से लगभग 2.3 अंक बेहतर और मानक प्रशिक्षण से 7.9 अंक बेहतर था)।

मुख्य निष्कर्ष

पेपर का दावा है कि उत्तर को बहुत जल्दी जान लेना वास्तव में सीखने में बाधा डाल सकता है यदि आप छात्र को आँख बंद करके उसकी नकल करने के लिए मजबूर करते हैं।

शिक्षण को एक "सुरक्षित, सुलभ आधार" (जो छात्र अभी समझ सकता है) और एक "नियंत्रित संकेत" (भविष्य के बारे में अतिरिक्त ज्ञान) में विभाजित करके, AI बिना "जादुई" शॉर्टकट में खोए, चरण-दर-चरण तर्क करना सीखता है। यह एक जादू के खेल को रटने और वास्तव में यह सीखने के बीच का अंतर है कि वह जादू कैसे काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →