Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
यह शोध पत्र टेस्ट-टाइम स्केलिंग के लिए एक हल्का, प्रोब-आधारित तरीका प्रस्तावित करता है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स की आंतरिक अवस्थाओं का विश्लेषण करके मल्टी-स्टेप रीजनिंग को सत्यापित करता है, जिससे बिना किसी महंगी एनोटेशन के, बहुत बड़े प्रोसेस रिवॉर्ड मॉडल्स के तुलनीय या उनसे बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणितीय समस्या या कोई पेचीदा तर्क वाला सवाल। आप मदद के लिए एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से पूछते हैं। AI अपने विचारों को ज़ोर से लिखना शुरू करता है, उत्तर तक पहुँचने के लिए विचारों की एक लंबी श्रृंखला लिखता है।
कभी-कभी, AI सही होता है। लेकिन अक्सर, यह अपनी सोच के बीच में ही गलत मोड़ ले लेता है। यदि यह शुरुआत में एक भी गलती कर देता है, तो पूरा उत्तर गलत हो जाता है, भले ही बाकी की सोच कितनी भी अच्छी क्यों न लगे।
पुराना तरीका: एक विशाल सुपरवाइजर को काम पर रखना
इसे ठीक करने के लिए, शोधकर्ताओं ने एक "सुपरवाइजर" (जिसे प्रोसेस रिवॉर्ड मॉडल, या PRM कहा जाता है) को काम पर रखा। इस सुपरवाइजर को एक विशाल, महंगे और धीमे सुरक्षा गार्ड के रूप में समझें जो AI के बगल में खड़ा रहता है। हर बार जब AI अपनी सोच में एक नया वाक्य लिखता है, तो गार्ड रुक जाता है, उसे पढ़ता है, तथ्यों का एक विशाल विश्वकोश (एन्साइक्लोपीडिया) चेक करता है, और तय करता है, "क्या यह वाक्य समझदारी भरा है या बेवकूफी भरा?"
समस्या: यह गार्ड बहुत बड़ा है। इसे काम पर रखना महंगा है, इसमें बहुत अधिक कंप्यूटर मेमोरी लगती है (जैसे साइकिल की लेन में टैंक फिट करने की कोशिश करना), और यह सब कुछ धीमा कर देता है। यह एक अकेले छात्र के काम की जाँच करने के लिए 100 लोगों की टीम को काम पर रखने जैसा है।
नया तरीका: ReProbe (एक "आंतरिक अंतर्ज्ञान")
यह शोध पत्र एक नई विधि पेश करता है जिसे ReProbe कहा जाता है। एक विशाल बाहरी गार्ड को काम पर रखने के बजाय, ReProbe AI को अपने स्वयं के "अंतर्ज्ञान" (gut feeling) को सुनने के लिए सिखाने जैसा है।
यहाँ उपमा (analogy) दी गई है:
- AI एक परीक्षा देने वाला छात्र है।
- पुराना तरीका (PRM) एक शिक्षक है जो कमरे में घूम रहा है, हर डेस्क पर रुक रहा है, छात्र के काम को पढ़ रहा है, और एक भारी किताब के साथ उसे ग्रेड दे रहा है।
- नया तरीका (ReProbe) छात्र के सिर से जुड़ा एक छोटा, सुपर-फास्ट उपकरण है। यह कागज पर लिखे शब्दों को नहीं पढ़ता; इसके बजाय, यह छात्र के "मस्तिष्क तरंगों" (आंतरिक विद्युत संकेतों) की निगरानी करता है जब वह सोच रहा होता है।
यह कैसे काम करता है
- मस्तिष्क तरंगों को सुनना: जब AI सोचता है, तो वह अदृश्य आंतरिक संकेत उत्पन्न करता है (जैसे मस्तिष्क में बिजली के आवेग)। ReProbe एक छोटा, हल्का उपकरण है जो इन संकेतों को सुनता है।
- "आत्मविश्वास" का मीटर: ReProbe यह पहचानना सीखता है कि AI कब आत्मविश्वासी और सही होता है, और कब वह भ्रमित होता है या गलती करने वाला होता है। यह एक झूठ पकड़ने वाले यंत्र (lie detector) की तरह है जो जानता है कि AI खुद से कब "झूठ" बोल रहा है।
- तत्काल फीडबैक: क्योंकि ReProbe बहुत छोटा है (यह पुराने तरीके के विशाल सर्वर की तुलना में एक छोटे चिप की तरह है), यह AI के काम की तुरंत जाँच कर सकता है। यह कहता है, "हे, यह कदम थोड़ा डगमगा रहा है," या "यह कदम ठोस लग रहा है।"
यह एक बड़ी बात क्यों है
- यह सस्ता और तेज़ है: ReProbe बहुत छोटा है। यह पुराने "विशाल गार्ड" तरीके की तुलना में 1% से भी कम कंप्यूटर पावर का उपयोग करता है। यह एक टैंक को साइकिल से बदलने जैसा है।
- यह नई स्थितियों में स्मार्ट है: पुराने गार्ड केवल विशिष्ट विषयों (जैसे गणित) पर प्रशिक्षित थे। यदि आप उनसे यात्रा की योजना बनाने के लिए पूछते, तो वे भ्रमित हो जाते। ReProbe, हालांकि, AI के "एहसास" को पढ़ना सीखता है, इसलिए यह गणित, योजना बनाने और सामान्य प्रश्नों पर भी अच्छी तरह काम करता है।
- इसे शिक्षक की आवश्यकता नहीं है: आप ReProbe को AI को अपना काम स्वयं चेक करने (सेल्फ-सुपरवाइज्ड) देकर प्रशिक्षित कर सकते हैं, इसलिए आपको हजारों पेपर ग्रेड करने के लिए मनुष्यों को भुगतान करने की आवश्यकता नहीं है।
परिणाम
ReProbe का उपयोग करके, AI किसी समस्या को हल करने के लिए कई अलग-अलग रास्तों को तलाश सकता है। यदि वह ऐसे रास्ते पर चलना शुरू करता है जहाँ उसका "अंतर्ज्ञान" (जिसकी निगरानी ReProbe द्वारा की जाती है) कहता है कि "यह गलत है," तो वह तुरंत पीछे हट जाता है और एक अलग रास्ता आज़माता है। यह AI को बिना किसी महंगे, धीमे, विशाल कंप्यूटर की निगरानी के कठिन समस्याओं को हल करने में बहुत बेहतर बनाता है।
संक्षेप में: ReProbe AI को एक आत्म-जागरूक विचारक में बदल देता है जो जानता है कि वह कब गलती कर रहा है, और इसके लिए वह एक विशाल, धीमे सुपरवाइजर के बजाय एक छोटे, कुशल उपकरण का उपयोग करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।