Latent Reasoning with Supervised Thinking States
यह शोध पत्र "थिंकिंग स्टेट्स" (Thinking States) का प्रस्ताव करता है, जो इनपुट प्रोसेसिंग चरण के दौरान लेटेंट थॉट टोकन (latent thought tokens) को उत्पन्न और एम्बेड करके तर्क दक्षता और प्रदर्शन में सुधार करता है, जिससे पारंपरिक चेन-ऑफ-थॉट (Chain-of-Thought) की तुलना में समानांतर योग्य प्रशिक्षण और कम इन्फरेंस विलंबता (inference latency) संभव होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट में एक शेफ हैं। आपके पास एक जटिल, बहु-चरणीय रेसिपी को संभालने के दो तरीके हैं:
तरीका 1: "चेन-ऑफ-थॉट" (CoT) का तरीका
हर बार जब आप एक छोटा कदम पूरा करते हैं—जैसे कि एक प्याज काटना—आप रुकते हैं, एक विशाल ब्लैकबोर्ड उठाते हैं, और ठीक वही लिखते हैं जो आपने अभी किया है: "मैंने अब एक प्याज काट लिया है। यह बारीक कटा हुआ है। मैं अगले चरण के लिए तैयार हूँ।" आप हर एक सामग्री के लिए ऐसा करते हैं। जब तक आप मुख्य व्यंजन तक पहुँचते हैं, आपका किचन बड़े-बड़े ब्लैकबोर्डों से भर जाता है, आपके पास जगह कम होने लगती है, और आप लिखने के चक्कर में बहुत धीमे हो जाते हैं। AI इसी तरह काम करता है: यह स्मार्ट तो है, लेकिन यह "बड़बोला" और धीमा है क्योंकि इसे अपने पूरे आंतरिक संवाद को टाइप करना पड़ता है।
तरीका 2: "थिंकिंग स्टेट्स" (Thinking States) का तरीका (पेपर का तरीका)
ब्लैकबोर्ड पर सब कुछ लिखने के बजाय, आप अपने दिमाग में एक मानसिक नोटपैड का उपयोग करते हैं। जैसे ही आप प्याज काटते हैं, आप अपने दिमाग में अपने काम का एक संक्षिप्त "स्टेट" (अवस्था) तैयार करते हैं: "प्याज: कटा हुआ।" आप इसे लिखने के लिए सबको नहीं बताते; आप बस उस "स्टेट" को अपने मन में रखते हैं और इसका उपयोग अपने अगले कदम को निर्देशित करने के लिए करते हैं। आप अधिक तेज़ी से काम करते हैं, आपका किचन साफ रहता है, लेकिन आप अभी भी उसी उच्च-स्तरीय तर्क (reasoning) का प्रदर्शन कर रहे होते हैं।
यह पेपर वास्तव में किस बारे में है?
शोधकर्ताओं ने एक ऐसा तरीका बनाया है जिससे AI बिना अपनी हर सोच को "बोलने" के "सोच" सके।
वर्तमान में, यदि आप चाहते हैं कि कोई AI कठिन गणित की समस्या हल करे, तो आपको उसे अपना "काम दिखाने" (show its work) के लिए कहना पड़ता है। यह AI को स्मार्ट तो बनाता है, लेकिन यह इसे अविश्वसनीय रूप से धीमा और महंगा भी बना देता है क्योंकि यह तर्क को प्रोसेस करने के लिए सैकड़ों अतिरिक्त शब्द उत्पन्न करता है।
लेखक "थिंकिंग स्टेट्स" (Thinking States) का प्रस्ताव देते हैं। यह कैसे काम करता है इसे तीन सरल चरणों में समझें:
- चंकिंग (The Chunking): पूरे वाक्य को पढ़ने और फिर सोचने के बजाय, AI टेक्स्ट को छोटे "चंक्स" (जैसे भोजन के टुकड़े) में पढ़ता है।
- मानसिक सारांश (The Mental Summary): प्रत्येक चंक के बाद, AI का एक छोटा, विशिष्ट हिस्सा प्राकृतिक भाषा में एक त्वरित "विचार" उत्पन्न करता है। लेकिन—यही असली जादू है—यह उन शब्दों को चैट में टाइप नहीं करता है। इसके बजाय, यह उन विचारों को एक गणितीय "सारांश" (एक स्टेट) में संकुचित (compress) कर देता है और उस सारांश को अगले चंक को पढ़ने से पहले सीधे अपने "मस्तिष्क" में इंजेक्ट कर देता है।
- स्पीड बूस्ट (The Speed Boost): क्योंकि AI लंबे पैराग्राफ प्रिंट करने में समय बर्बाद नहीं कर रहा है, इसलिए यह जानकारी को बहुत तेज़ी से प्रोसेस कर सकता है। यह किसी व्यक्ति द्वारा अपनी पूरी विचार प्रक्रिया को ज़ोर से समझाने और किसी व्यक्ति द्वारा केवल सिर हिलाकर अगले चरण पर आगे बढ़ने के बीच के अंतर जैसा है।
यह एक बड़ी बात क्यों है?
- यह एक "स्मार्ट शॉर्टकट" है: अपने परीक्षणों में, AI "बड़बोले" संस्करण (CoT) जितना ही स्मार्ट था, लेकिन बहुत तेज़ था। कुछ कार्यों पर, जैसे कि एक क्रम में सिक्कों को उछालने की संख्या को ट्रैक करना, यह लंबे समय तक याद रखने (long-term memory) के मामले में "बड़बोले" संस्करण से भी बेहतर था।
- इसे सिखाना आसान है: आमतौर पर, AI को "गुप्त रूप से सोचने" के लिए सिखाना बेहद कठिन होता है क्योंकि आप सुधार करने के लिए उसकी सोच को देख नहीं सकते। शोधकर्ताओं ने मौजूदा "काम दिखाने वाले" डेटा का उपयोग करके AI के "गुप्त विचारों" को प्रशिक्षित करने का एक चतुर तरीका खोजा, जिससे उनकी प्रशिक्षण प्रक्रिया बहुत तेज़ और अधिक कुशल हो गई।
- यह कुशल है: यह "बोज" (clutter) की समस्या को हल करता है। AI को गहरे तर्क (reasoning) के लाभ मिलते हैं, लेकिन बिना किसी लंबे, अनावश्यक टेक्स्ट के।
निष्कर्ष (The Bottom Line)
यह पेपर AI को एक कुशल आंतरिक संवाद (inner monologue) रखना सिखा रहा है। यह मॉडल को अपने दिमाग में अपने तर्क का एक "चल रहा हिसाब" (running tally) रखने की अनुमति देता है, जिससे यह अपने ही शब्दों में खोए बिना तेज़, सुव्यवस्थित और जटिल समस्याओं को संभालने में अधिक सक्षम बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।