← नवीनतम पेपर
💬 NLP

Geometric Self-Distillation for Reasoning Generalization

यह शोध पत्र GeoSD को प्रस्तुत करता है, जो एक ज्यामितीय स्व-डिस्टिलेशन (geometric self-distillation) ढांचा है जो मानक ऑन-पॉलिसी डिस्टिलेशन के कारण होने वाले आउट-ऑफ-डिस्ट्रीब्यूशन रीजनिंग ड्रिफ्ट (out-of-distribution reasoning drift) को कम करने के लिए हेलिंगर लॉस (Hellinger loss) और एक प्रॉक्सिमल फिशर-राओ पेनल्टी (proximal Fisher-Rao penalty) को नेचुरल-ग्रेडिएंट अपडेट्स के साथ जोड़ता है, जिससे विभिन्न मॉडल स्केल्स में जनरलाइजेशन में महत्वपूर्ण सुधार करते हुए इन-डिस्ट्रीब्यूशन प्रदर्शन को संरक्षित किया जा सके।

मूल लेखक: Josip Jukić, Ivan Titov

प्रकाशित 2026-07-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Josip Jukić, Ivan Titov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Geometric Self-Distillation for Reasoning Generalization" (GEOSD) का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

मुख्य विचार: "अति-आत्मविश्वासी शिक्षक" की समस्या (The Overconfident Tutor Problem)

कल्पना कीजिए कि आप जटिल गणित के सवाल हल करना सीख रहे हैं। आपके पास एक ट्यूटर (शिक्षक) है जो अविश्वसनीय रूप से बुद्धिमान है, लेकिन उसके पास एक गुप्त लाभ है: ट्यूटर उत्तर कुंजी (answer key) देख सकता है जबकि आप अभी भी उसे समझने की कोशिश कर रहे हैं।

AI की दुनिया में, इसे Privileged Context Self-Distillation कहा जाता है। AI (छात्र) एक समस्या को हल करने की कोशिश करता है, और वही AI (शिक्षक के रूप में) समस्या के साथ-साथ पूरे समाधान को देखकर छात्र का मार्गदर्शन करता है।

समस्या:
चूंकि ट्यूटर उत्तर देख सकता है, इसलिए वह अगले कदम के बारे में बहुत आश्वस्त (confident) होता है, भले ही छात्र ने अभी तक तर्क (logic) को समझा न हो।

  • पुराना तरीका (Standard Training): छात्र अंधाधुंध ट्यूटर की नकल करता है। यदि ट्यूटर कहता है, "यह कदम उठाओ!" तो वह 100% आत्मविश्वास के साथ कहता है, और छात्र घबराकर अपने मस्तिष्क को उस बात से सहमत होने के लिए मजबूर कर देता है, भले ही उसे समझ न आए कि ऐसा क्यों है।
  • परिणाम: छात्र एक "तोता" बन जाता है। वह उन विशिष्ट समस्याओं को हल करने में बहुत अच्छा हो जाता है जिनका उसने अभ्यास किया है (In-Distribution), लेकिन यदि आप उसे किसी नए प्रकार की समस्या देते हैं (Out-of-Distribution), तो वह बुरी तरह विफल हो जाता है। उसने तर्क सीखने के बजाय उत्तर कुंजी को रट लिया है। वह आत्मविश्वास के साथ गलत (confidently wrong) हो जाता है।

समाधान: GEOSD (ज्यामितीय दृष्टिकोण - The "Geometric" Approach)

लेखक GEOSD (Geometric Self-Distillation) पेश करते हैं। केवल "मेरी नकल करो" कहने के बजाय, GEOSD एक बुद्धिमान कोच की तरह काम करता है जो सीखने की ज्यामिति (geometry) को समझता है। यह दो मुख्य तरकीबों का उपयोग करता है ताकि छात्र को बुरी आदतों में बहने से रोका जा सके।

तरकीब 1: "ओवरलैप" फ़िल्टर (हाथ मिलाना - The Handshake)

रूपक (Metaphor): कल्पना कीजिए कि छात्र और ट्यूटर हाथ मिला रहे हैं।

  • मानक प्रशिक्षण (Standard Training): ट्यूटर छात्र का हाथ पूरी ताकत से खींचता है, चाहे छात्र ने हाथ पकड़ा हो या नहीं। यदि ट्यूटर मजबूत है और छात्र कमजोर है, तो छात्र रास्ते से भटक जाता है।
  • GEOSD: खिंचाव इस बात के अनुपात में होता है कि वे पहले से ही कितनी मजबूती से हाथ पकड़े हुए हैं।
    • यदि छात्र पहले से ही ट्यूटर से सहमत है (वे "ओवरलैप" कर रहे हैं), तो ट्यूटर उस सहमति को मजबूत करने के लिए धीरे से खींचता है।
    • यदि छात्र भ्रमित है और ट्यूटर के विचार का समर्थन बहुत कम कर रहा है, तो ट्यूटर अपनी पकड़ को नरम कर देता है। वह छात्र को उस विश्वास को अपनाने के लिए मजबूर नहीं करता जिसे छात्र अभी तक सहारा नहीं दे सकता।

यह क्यों मदद करता है: यह छात्र को उन कदमों पर ट्यूटर के "अति-आत्मविश्वास" की अंधाधुंध नकल करने से रोकता है जिन्हें वह अभी तक समझ नहीं पाया है।

तरकीब 2: "एंकर वाली रस्सी" (सुरक्षा रेखा - The Anchored Rope)

रूपक: कल्पना कीजिए कि छात्र एक रस्सी पर चल रहा है (tightrope), और एक नया नृत्य सीखने की कोशिश कर रहा है।

  • मानक प्रशिक्षण: छात्र ट्यूटर से मेल खाने के लिए बड़े, उन्मत्त कदम उठाता है। समय के साथ, वह अपने मूल संतुलन से इतना दूर चला जाता है कि जब संगीत बदलता है (नई समस्याएं आती हैं), तो वह गिर जाता है।
  • GEOSD: छात्र एक हालिया चेकपॉइंट (कुछ मिनट पहले का अपना ही एक "सुरक्षित संस्करण") से एक लचीली रस्सी द्वारा बंधा हुआ है।
    • ट्यूटर अभी भी छात्र को आगे खींच सकता है, लेकिन रस्सी उसे बहुत दूर या बहुत तेजी से भटकने से रोकती है।
    • यह सुनिश्चित करता है कि छात्र अपने मूल संतुलन को खोए बिना नए स्टेप्स सीखे।

यह क्यों मदद करता है: यह "भटकाव" (drift) को रोकता है। छात्र अपने मूल स्वरूप को पूरी तरह से भूले बिना सुधार करता है, जिससे वह नई, अनदेखी समस्याओं को संभालने के लिए पर्याप्त लचीला बना रहता है।

असली मंत्र: "ज्यामिति" बनाम "सीधी रेखाएं" (Geometry vs. Straight Lines)

शोध पत्र "Hellinger loss" और "Fisher–Rao distance" जैसे भारी गणितीय शब्दों का उपयोग करता है। इसका सरल संस्करण यहाँ है:

  • सामान्य प्रशिक्षण (Euclidean): सीखने को एक सपाट ग्रिड पर चलने की तरह मानता है। आप एक निश्चित मात्रा में "बाएँ" या "दाएँ" चलते हैं। लेकिन AI में, थोड़ा सा "बाएँ" खिसकने से मॉडल का व्यवहार बहुत अधिक बदल सकता है, जबकि बहुत अधिक "दाएँ" जाने से कोई बदलाव नहीं हो सकता।
  • GEOSD (Geometric): सीखने को एक गोले (sphere) पर चलने की तरह मानता है।
    • कल्पना कीजिए कि AI के अनुमान (predictions) एक गेंद पर बिंदु हैं।
    • GEOSD दूरी को इस आधार पर मापता है कि एक बिंदु से दूसरे बिंदु तक जाने के लिए आपको गेंद की सतह के साथ कितनी दूर चलना होगा।
    • यह सुनिश्चित करता है कि AI द्वारा उठाया गया हर कदम इस आधार पर मापा जाए कि वह वास्तव में AI के व्यवहार को कितना बदलता है, न कि केवल यह कि वह कंप्यूटर कोड को कितना बदलता है।

परिणाम: क्या हुआ?

लेखकों ने विभिन्न आकार के AI मॉडल (छोटे से लेकर विशाल तक) का उपयोग करके गणितीय समस्याओं (जैसे AIME और AMC प्रतियोगिताएं) पर इसका परीक्षण किया।

  1. पुराने तरीके: मॉडल अभ्यास वाली समस्याओं में बेहतर हुए लेकिन नई, कठिन समस्याओं में बदतर हो गए। वे अति-आत्मविश्वासी और कठोर हो गए।
  2. GEOSD: मॉडल अभ्यास वाली समस्याओं में बेहतर हुए और नई, कठिन समस्याओं में भी काफी बेहतर प्रदर्शन किया (औसतन 5.7% से 8.6% का सुधार)।
  3. "क्यों": जब पुराने तरीके विफल हुए, तो वे वैकल्पिक उत्तरों से "द्रव्यमान (mass)" को निकाल रहे थे। उन्होंने AI को एक गलत उत्तर को 100% आत्मविश्वास के साथ चुनने के लिए मजबूर कर दिया। GEOSD ने अन्य विकल्पों को जीवित रखा, जिससे AI अनिश्चित और लचीला बना रह सका, जो नई समस्याओं को हल करने के लिए महत्वपूर्ण है।

सारांश रूपक (Summary Analogy)

  • मानक प्रशिक्षण (Standard Training) एक छात्र द्वारा स्क्रिप्ट रटने जैसा है। यदि दृश्य बदलता है, तो वह जम जाता है।
  • GEOSD एक छात्र द्वारा अभिनय के सिद्धांतों को सीखने जैसा है। वे निर्देशक (ट्यूटर) को सुनते हैं, लेकिन केवल तभी निर्देश को अपनाते हैं जब वे उसे अपने स्वयं के प्रदर्शन में महसूस कर सकें। वे अपने मूल अंदाज (Anchor) से जुड़े रहते हैं ताकि वे किसी भी नए दृश्य के अनुकूल हो सकें।

शोध पत्र यह निष्कर्ष निकालता है कि AI को तर्क करने में स्मार्ट बनाने के लिए, हमें केवल उसे "उत्तर कुंजी" की नकल करने के लिए मजबूर नहीं करना चाहिए। हमें इसे धीरे से मार्गदर्शन करना चाहिए, इसके वर्तमान ज्ञान का सम्मान करना चाहिए और इसे इसके मूल तर्क से जोड़े रखना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →