← नवीनतम पेपर
🤖 AI

Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning

यह शोध पत्र Semi-CoT को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) शिक्षण ढांचा है जो सिमेंटिक एंट्रॉपी फ़िल्टरिंग के माध्यम से उच्च-परिशुद्धता वाले छद्म तर्क श्रृंखलाओं (pseudo reasoning chains) को उत्पन्न करने के लिए अनलेबल प्रश्नों का लाभ उठाता है, जो विविध गणितीय बेंचमार्क में प्रदर्शन लाभ को अधिकतम करने के लिए चयन और प्रशिक्षण रणनीतियों में सुधार की आवश्यकता पर प्रकाश डालते हुए प्रभावी प्रशिक्षण संकेतों के रूप में उनकी क्षमता को प्रदर्शित करता है।

मूल लेखक: Hongyang He, Jiuming Liu, Victor Sanchez

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyang He, Jiuming Liu, Victor Sanchez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (AI) है जो गणित की समस्याओं को हल करने में बहुत अच्छा है लेकिन कभी-कभी अटक जाता है या छोटी-मोटी गलतियाँ कर देता है। आमतौर पर, जब आप उससे कोई कठिन प्रश्न पूछते हैं, तो वह ज़ोर से सोचता है, अपने चरणों को लिखता है, और फिर आपको उत्तर देता है। एक बार जब वह समाप्त कर लेता है, तो आप उसके "सोचने के नोट्स" (thinking notes) को फेंक देते हैं और केवल अंतिम उत्तर रखते हैं।

यह शोध पत्र एक सरल लेकिन शक्तिशाली प्रश्न पूछता है: क्या होगा यदि हम उन सोचने के नोट्स को फेंक न दें? क्या होगा यदि हम उन "सोचने के नोट्स" का उपयोग उन प्रश्नों को सीखने के लिए कर सकें जिन्हें उसने पहले नहीं देखा है?

यहाँ उनके विचार का विवरण दिया गया है, जिसे Semi-CoT कहा जाता है, कुछ रोज़मर्रा के उदाहरणों का उपयोग करके।

1. समस्या: बर्बाद होती सोच (Wasted Thinking)

वर्तमान में, AI मॉडल "चेन-ऑफ-थॉट" (CoT) का उपयोग एक बार के करतब की तरह करते हैं। जब आप कोई प्रश्न पूछते हैं, तो AI एक चरण-दर-चरण तर्क पथ (reasoning path) बनाता है, उसे हल करता है, और फिर उस पथ को भूल जाता है।

  • शोध पत्र का अंतर्दृष्टि (Insight): लेखकों ने देखा कि इंटरनेट पर लाखों गणित के प्रश्न तैर रहे हैं जिनमें न तो उत्तर हैं और न ही स्पष्टीकरण। ये "अनलेबल" (unlabeled) प्रश्न हैं।
  • लक्ष्य: इन प्रश्नों को अनदेखा करने के बजाय, आइए AI से उन्हें हल करने के लिए कहें, उसे अपना तर्क लिखने के लिए कहें, और फिर उन तर्क चरणों का उपयोग भविष्य के प्रश्नों के लिए "स्टडी गाइड" के रूप में करें।

2. खतरा: "आत्मविश्वासी मूर्ख" (The "Confident Fool")

यहाँ एक बड़ा जोखिम है। यदि आप AI को ऐसा प्रश्न हल करने के लिए कहते हैं जिसे वह नहीं जानता, तो वह आत्मविश्वास के साथ एक बेहतरीन दिखने वाला स्पष्टीकरण लिख सकता है जो गलत उत्तर की ओर ले जाता है। यह एक ऐसे छात्र की तरह है जो उस किताब के बारे में एक सुंदर निबंध लिखता है जिसे उसने कभी पढ़ा ही नहीं। यदि आप उस निबंध का उपयोग उसे सिखाने के लिए करते हैं, तो आप उसे केवल आत्मविश्वास के साथ गलत होने के लिए सिखा रहे हैं।

3. समाधान: "समूह सहमति" फ़िल्टर (The "Group Consensus" Filter)

इसे ठीक करने के लिए, लेखकों ने Semi-CoT नामक एक सुरक्षा जाल बनाया। यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

  • चरण 1: "कई सिरों" वाला दृष्टिकोण (The "Many Heads" Approach)।
    प्रत्येक अनलेबल प्रश्न के लिए, AI इसे केवल एक बार हल नहीं करता है। यह इसे कई बार हल करता है (जैसे एक ही छात्र को एक ही समस्या को लगातार पाँच बार हल करने के लिए कहना)।
  • चरण 2: "मतदान" की जाँच (The "Voting" Check)।
    सिस्टम उन पाँच प्रयासों के अंतिम उत्तरों को देखता है।
    • परिदृश्य A: AI कहता है "5," "5," "5," "5," और "5।" सभी सहमत हैं। यह एक लो-एन्ट्रॉपी (कम भ्रम वाला) परिणाम है। सिस्टम सोचता है, "ठीक है, यह तर्क शायद विश्वसनीय है।"
    • परिदृश्य B: AI कहता है "5," "12," "3," "5," और "9।" सभी भ्रमित हैं। यह हाई-एन्ट्रॉपी (उच्च भ्रम वाला) परिणाम है। सिस्टम सोचता है, "नहीं, यह बहुत अस्त-व्यस्त है। इसे फेंक दो।"
  • चरण 3: "स्टडी बैंक" (The "Study Bank")।
    सिस्टम केवल उन तर्क चरणों को रखता है जहाँ AI सुसंगत (consistent) था (परिदृश्य A)। यह उच्च-गुणवत्ता वाले "सोचने के नोट्स" को एक विशेष स्यूडो रीजनिंग बैंक (Pseudo Reasoning Bank) में रखता है।
  • चरण 4: "टेस्ट टाइम" बूस्ट (The "Test Time" Boost)।
    जब AI के सामने एक नया टेस्ट प्रश्न आता है, तो वह केवल अनुमान नहीं लगाता। वह अपने स्यूडो रीजनिंग बैंक में देखता है, एक समान समस्या ढूँढता है जिसे उसने पहले हल किया था, और उस पिछले "सोचने के नोट" का उपयोग नए प्रश्न को हल करने के लिए संकेत के रूप में करता है।

4. परिणाम: एक मिला-जुला अनुभव (A Mixed Bag)

लेखकों ने चार अलग-अलग गणितीय डेटासेट (जैसे AQuA, SVAMP, GSM8K, और MultiArith) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • अच्छी खबर: "ग्रुप कंसेंसस" फ़िल्टर ने अच्छे तर्क खोजने में अविश्वसनीय रूप से अच्छा काम किया। उनके द्वारा परीक्षण किए गए डेटासेट में, AI का "नकली" तर्क वास्तव में 91% से 100% बार सही था। यह साबित करता है कि अनलेबल प्रश्न उपयोगी अध्ययन सामग्री प्रदान कर सकते हैं।
  • बुरी खबर: केवल अच्छी अध्ययन सामग्री होने का मतलब यह गारंटी नहीं है कि टेस्ट स्कोर बेहतर होंगे।
    • कुछ टेस्ट (SVAMP और GSM8K) पर, AI थोड़ा बेहतर हुआ (लगभग 1-2% सुधार)।
    • एक टेस्ट (AQuA) पर, AI का प्रदर्शन वास्तव में बिगड़ गया। क्यों? क्योंकि जो "स्टडी गाइड" उसने चुना, वह नए प्रश्न के लिए अप्रासंगिक था। यह केक बनाने की रेसिपी पढ़ने जैसा है जब आप ब्रेड बनाने की कोशिश कर रहे हों। भले ही रेसिपी एकदम सही हो, फिर भी वह आपकी मदद नहीं करती।
    • दूसरे टेस्ट (MultiArith) पर, सभी पहले से ही 100% प्राप्त कर रहे थे, इसलिए सुधार की कोई गुंजाइश नहीं थी।

5. मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र एक बहुत ही महत्वपूर्ण सबक के साथ समाप्त होता है: विश्वसनीयता (Reliability) और प्रासंगिकता (Relevance) एक समान नहीं हैं।

  • विश्वसनीयता (Reliability): क्या AI ने अभ्यास वाले प्रश्न को सही ढंग से हल किया? (हाँ, एन्ट्रॉपी फ़िल्टर ने यह सुनिश्चित किया)।
  • प्रासंगिकता (Relevance): क्या वह अभ्यास वाला प्रश्न वास्तव में नए प्रश्न के लिए उपयोगी है? (हमेशा नहीं)।

लेखकों ने पाया कि केवल रैंडम "अच्छे" उदाहरण चुनना हमेशा मददगार नहीं होता है। उन्होंने एक सरल कीवर्ड सर्च (TF-IDF) का उपयोग करके प्रासंगिक उदाहरण खोजने की कोशिश की, लेकिन यह रैंडम चुनने से बेहतर काम नहीं कर सका।

संक्षेप में: यह शोध पत्र सिद्ध करता है कि हम यह जाँचकर कि क्या AI खुद से सहमत है, अनलेबल प्रश्नों को उच्च-गुणवत्ता वाली "स्टडी गाइड" में बदल सकते हैं। हालाँकि, AI को स्मार्ट बनाने के लिए, हमें केवल अच्छे गाइड एकत्र करने से कहीं अधिक करने की आवश्यकता है; हमें विशिष्ट प्रश्न के लिए सही गाइड चुनने में बेहतर होना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →