Enhancing LLM Metacognition via Cognitive Pairwise Training
यह शोध पत्र कॉग्निटिव पेयरवाइज़ ट्रेनिंग (CPT) को प्रस्तुत करता है, जो एक मिड-ट्रेनिंग अलाइनमेंट पद्धति है जो मॉडलों को विश्वसनीय और त्रुटिपूर्ण रीजनिंग ट्रेसेस के बीच अंतर करना सिखाकर LLM मेटाकॉग्निशन और रीजनिंग विश्वसनीयता को बढ़ाती है, जिससे यह रीजनिंग सटीकता और उचित परहेज (abstention) दोनों में मानक SFT+RL पाइपलाइनों से बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अति-आत्मविश्वासी छात्र को एक कठिन गणित की परीक्षा देने के लिए प्रशिक्षित कर रहे हैं।
समस्या: "आत्मविश्वासी गलत" छात्र
वर्तमान में, जब हम बड़े भाषा मॉडलों (LLMs) को कठिन समस्याओं को हल करना सिखाते हैं, तो हम 'रीइन्फोर्समेंट लर्निंग' (RL) नामक एक विधि का उपयोग करते हैं। यह एक छात्र को हर बार सही उत्तर देने पर 'गोल्ड स्टार' देने जैसा है।
- दोष: छात्र उस गोल्ड स्टार को पाने के लिए इतना पागल हो जाता है कि वह अपने काम की जाँच करना बंद कर देता है। यदि उसे उत्तर नहीं पता होता, तो वह बस आत्मविश्वास के साथ अनुमान लगाने लगता है और बेहतर होने की उम्मीद करता है। वे उन समस्याओं को हल करने में तो माहिर हो जाते हैं जिन्हें वे हल कर सकते हैं, लेकिन यह स्वीकार करने में बहुत खराब हो जाते हैं कि वे नहीं कर सकते। उच्च-जोखम वाली स्थितियों (जैसे चिकित्सा या कानूनी सलाह) में, यह "आत्मविश्वासी अनुमान लगाना" खतरनाक है।
पुराना समाधान: "मुझे नहीं पता" को एक स्क्रिप्ट की तरह सिखाना
पिछले प्रयासों को इस तरह सिखाने जैसा था जैसे छात्र को एक स्क्रिप्ट रटवा दी जाए: "यदि प्रश्न अजीब लगे, तो कहें 'मुझे नहीं पता'।"
- दोष: छात्र उस स्क्रिप्ट को याद कर लेता है। यदि आप उससे ऐसा प्रश्न पूछते हैं जो अजीब दिखता है लेकिन वास्तव में उसका एक उत्तर है, तो भी वह कह सकता है कि "मुझे नहीं पता।" या, यदि आप उससे ऐसा प्रश्न पूछते हैं जो सामान्य दिखता है लेकिन वास्तव में एक चाल (trick) है, तो वह उस स्क्रिप्ट को अनदेखा कर सकता है और फिर से अनुमान लगा सकता है। उन्होंने वास्तव में अपनी स्वयं की सोच की गुणवत्ता का आकलन करना नहीं सीखा है; उन्होंने केवल एक नियम का पालन करना सीखा है।
नया समाधान: कॉग्निटिव पेयरवाइज ट्रेनिंग (CPT)
लेखक इस नए प्रशिक्षण चरण का प्रस्ताव करते हैं जिसे कॉग्निटitive पेयरवाइज ट्रेनिंग (CPT) कहा जाता है।
इसे अंतिम परीक्षा से पहले एक "टेस्ट-टेस्ट वर्कशॉप" के रूप में समझें।
- सेटअप: केवल छात्र को समस्या हल करने के लिए कहने के बजाय, शिक्षक उन्हें एक ही समस्या के दो अलग-अलग समाधान देते हैं।
- समाधान A: एक तार्किक, चरण-दर-चरण मार्ग जो समझ में आता है।
- समाधान B: एक मार्ग जो भव्य दिखता है लेकिन उसमें एक छिपा हुआ तार्किक दोष या एक भाग्यशाली अनुमान है।
- कार्य: छात्र से समस्या हल करने के लिए नहीं कहा जाता है। उनसे एक जज (न्यायाधीश) के रूप में कार्य करने के लिए कहा जाता है। उन्हें दोनों रास्तों की तुलना करनी होगी और कहना होगा, "समाधान A बेहतर है क्योंकि यह तार्किक है," या "समाधान B त्रुटिपूर्ण है क्योंकि इसने एक चरण छोड़ दिया है।"
- परिणाम: इस "जज" की भूमिका का हजारों बार अभ्यास करके, छात्र एक मानसिक फिल्टर (mental filter) को आत्मसात कर लेता है। वे पहचानना सीख जाते हैं कि "अच्छी सोच" वास्तव में कैसी दिखती है, न कि केवल यह कि कब "मुझे नहीं पता" कहना है।
यह क्यों काम करता है (रूपक/Metaphor)
- पुराना तरीका: आप एक गार्ड डॉग को सिखाते हैं कि केवल एक विशिष्ट सीटी बजने पर ही भौंकना है। यदि चोर सीटी नहीं बजाता, तो कुत्ता शांत रहता है।
- CPT तरीका: आप गार्ड डॉग को अजनबी की गंध सूँघना सिखाते हैं। अब, कुत्ते को सीटी की जरूरत नहीं है; वह बस गंध से ही दोस्त और अजनबी के बीच अंतर कर सकता है।
परिणाम
इस पद्धति का परीक्षण विभिन्न आकारों के मॉडलों (छोटे से लेकर बहुत बड़े तक) पर किया गया और पाया गया कि:
- बेहतर गणित: मॉडल वास्तव में कठिन गणितीय समस्याओं को हल करने में बेहतर हो गए, न कि केवल सतर्क होने के कारण खराब हुए।
- बेहतर ईमानदारी: जब मॉडलों को ऐसे प्रश्न मिले जिनका वे उत्तर नहीं दे सकते थे, तो वे एक आत्मविश्वासपूर्ण लेकिन गलत उत्तर बनाने के बजाय, "मुझे नहीं पता" कहने की अधिक संभावना रखते थे।
- लचीलापन (Resilience): यहाँ तक कि जब मॉडलों को और तेज़ और सटीक होने के लिए और अधिक प्रशिक्षित (Reinforcement Learning चरण) किया गया, तब भी उन्होंने अपनी सोच को परखने की इस नई क्षमता को नहीं खोया। इस "टेस्ट-टेस्ट वर्कशॉप" के दौरान उन्होंने जो "मानसिक फिल्टर" बनाया था, वह मजबूत बना रहा।
सारांश में
AI को यह सिखाने के बजाय कि अनिश्चित होने पर क्या कहना है, यह विधि AI को यह सिखाती है कि अपनी सोच के बारे में कैसे सोचना है। यह AI को उत्तर रटने वाले छात्र से बदलकर एक ऐसे छात्र में बदल देती है जो अपनी तर्क प्रक्रिया की गुणवत्ता को समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।