← नवीनतम पेपर
💬 NLP

Latent Reasoning with Supervised Thinking States

यह शोध पत्र "थिंकिंग स्टेट्स" (Thinking States) का प्रस्ताव करता है, जो इनपुट प्रोसेसिंग चरण के दौरान लेटेंट थॉट टोकन (latent thought tokens) को उत्पन्न और एम्बेड करके तर्क दक्षता और प्रदर्शन में सुधार करता है, जिससे पारंपरिक चेन-ऑफ-थॉट (Chain-of-Thought) की तुलना में समानांतर योग्य प्रशिक्षण और कम इन्फरेंस विलंबता (inference latency) संभव होती है।

मूल लेखक: Ido Amos, Avi Caciularu, Mor Geva, Amir Globerson, Jonathan Herzig, Lior Shani, Idan Szpektor

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ido Amos, Avi Caciularu, Mor Geva, Amir Globerson, Jonathan Herzig, Lior Shani, Idan Szpektor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट में एक शेफ हैं। आपके पास एक जटिल, बहु-चरणीय रेसिपी को संभालने के दो तरीके हैं:

तरीका 1: "चेन-ऑफ-थॉट" (CoT) का तरीका
हर बार जब आप एक छोटा कदम पूरा करते हैं—जैसे कि एक प्याज काटना—आप रुकते हैं, एक विशाल ब्लैकबोर्ड उठाते हैं, और ठीक वही लिखते हैं जो आपने अभी किया है: "मैंने अब एक प्याज काट लिया है। यह बारीक कटा हुआ है। मैं अगले चरण के लिए तैयार हूँ।" आप हर एक सामग्री के लिए ऐसा करते हैं। जब तक आप मुख्य व्यंजन तक पहुँचते हैं, आपका किचन बड़े-बड़े ब्लैकबोर्डों से भर जाता है, आपके पास जगह कम होने लगती है, और आप लिखने के चक्कर में बहुत धीमे हो जाते हैं। AI इसी तरह काम करता है: यह स्मार्ट तो है, लेकिन यह "बड़बोला" और धीमा है क्योंकि इसे अपने पूरे आंतरिक संवाद को टाइप करना पड़ता है।

तरीका 2: "थिंकिंग स्टेट्स" (Thinking States) का तरीका (पेपर का तरीका)
ब्लैकबोर्ड पर सब कुछ लिखने के बजाय, आप अपने दिमाग में एक मानसिक नोटपैड का उपयोग करते हैं। जैसे ही आप प्याज काटते हैं, आप अपने दिमाग में अपने काम का एक संक्षिप्त "स्टेट" (अवस्था) तैयार करते हैं: "प्याज: कटा हुआ।" आप इसे लिखने के लिए सबको नहीं बताते; आप बस उस "स्टेट" को अपने मन में रखते हैं और इसका उपयोग अपने अगले कदम को निर्देशित करने के लिए करते हैं। आप अधिक तेज़ी से काम करते हैं, आपका किचन साफ रहता है, लेकिन आप अभी भी उसी उच्च-स्तरीय तर्क (reasoning) का प्रदर्शन कर रहे होते हैं।


यह पेपर वास्तव में किस बारे में है?

शोधकर्ताओं ने एक ऐसा तरीका बनाया है जिससे AI बिना अपनी हर सोच को "बोलने" के "सोच" सके।

वर्तमान में, यदि आप चाहते हैं कि कोई AI कठिन गणित की समस्या हल करे, तो आपको उसे अपना "काम दिखाने" (show its work) के लिए कहना पड़ता है। यह AI को स्मार्ट तो बनाता है, लेकिन यह इसे अविश्वसनीय रूप से धीमा और महंगा भी बना देता है क्योंकि यह तर्क को प्रोसेस करने के लिए सैकड़ों अतिरिक्त शब्द उत्पन्न करता है।

लेखक "थिंकिंग स्टेट्स" (Thinking States) का प्रस्ताव देते हैं। यह कैसे काम करता है इसे तीन सरल चरणों में समझें:

  1. चंकिंग (The Chunking): पूरे वाक्य को पढ़ने और फिर सोचने के बजाय, AI टेक्स्ट को छोटे "चंक्स" (जैसे भोजन के टुकड़े) में पढ़ता है।
  2. मानसिक सारांश (The Mental Summary): प्रत्येक चंक के बाद, AI का एक छोटा, विशिष्ट हिस्सा प्राकृतिक भाषा में एक त्वरित "विचार" उत्पन्न करता है। लेकिन—यही असली जादू है—यह उन शब्दों को चैट में टाइप नहीं करता है। इसके बजाय, यह उन विचारों को एक गणितीय "सारांश" (एक स्टेट) में संकुचित (compress) कर देता है और उस सारांश को अगले चंक को पढ़ने से पहले सीधे अपने "मस्तिष्क" में इंजेक्ट कर देता है।
  3. स्पीड बूस्ट (The Speed Boost): क्योंकि AI लंबे पैराग्राफ प्रिंट करने में समय बर्बाद नहीं कर रहा है, इसलिए यह जानकारी को बहुत तेज़ी से प्रोसेस कर सकता है। यह किसी व्यक्ति द्वारा अपनी पूरी विचार प्रक्रिया को ज़ोर से समझाने और किसी व्यक्ति द्वारा केवल सिर हिलाकर अगले चरण पर आगे बढ़ने के बीच के अंतर जैसा है।

यह एक बड़ी बात क्यों है?

  • यह एक "स्मार्ट शॉर्टकट" है: अपने परीक्षणों में, AI "बड़बोले" संस्करण (CoT) जितना ही स्मार्ट था, लेकिन बहुत तेज़ था। कुछ कार्यों पर, जैसे कि एक क्रम में सिक्कों को उछालने की संख्या को ट्रैक करना, यह लंबे समय तक याद रखने (long-term memory) के मामले में "बड़बोले" संस्करण से भी बेहतर था।
  • इसे सिखाना आसान है: आमतौर पर, AI को "गुप्त रूप से सोचने" के लिए सिखाना बेहद कठिन होता है क्योंकि आप सुधार करने के लिए उसकी सोच को देख नहीं सकते। शोधकर्ताओं ने मौजूदा "काम दिखाने वाले" डेटा का उपयोग करके AI के "गुप्त विचारों" को प्रशिक्षित करने का एक चतुर तरीका खोजा, जिससे उनकी प्रशिक्षण प्रक्रिया बहुत तेज़ और अधिक कुशल हो गई।
  • यह कुशल है: यह "बोज" (clutter) की समस्या को हल करता है। AI को गहरे तर्क (reasoning) के लाभ मिलते हैं, लेकिन बिना किसी लंबे, अनावश्यक टेक्स्ट के।

निष्कर्ष (The Bottom Line)

यह पेपर AI को एक कुशल आंतरिक संवाद (inner monologue) रखना सिखा रहा है। यह मॉडल को अपने दिमाग में अपने तर्क का एक "चल रहा हिसाब" (running tally) रखने की अनुमति देता है, जिससे यह अपने ही शब्दों में खोए बिना तेज़, सुव्यवस्थित और जटिल समस्याओं को संभालने में अधिक सक्षम बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →