When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
यह शोध पत्र साइड-बाय-साइड (SxS) इंटरलीव्ड रीजनिंग (Interleaved Reasoning) का परिचय देता है, जो एक ऐसा ढांचा है जो लार्ज लैंग्वेज मॉडल्स को जनरेशन के दौरान कंटेंट प्रकटीकरण के समय को गतिशील रूप से नियंत्रित करने में सक्षम बनाता है ताकि विचार-विमर्श के समय और समयपूर्व प्रतिबद्धता के बीच के संतुलन को सुधारा जा सके, जिससे विभिन्न बेंचमार्क पर सटीकता-विलंबता (accuracy-latency) प्रदर्शन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बेहद सतर्क दोस्त से एक जटिल पहेली सुलझाने में मदद मांग रहे हैं।
पुराना तरीका: "साइलेंस टैक्स" (Silence Tax)
वर्तमान में लार्ज लैंग्वेज मॉडल्स (LLMs) जिस तरह से काम करते हैं, उसमें आपके दोस्त को ज़ोर से सोचना पड़ता है। लेकिन यहाँ एक पेच है: जैसे ही वे कोई शब्द बोलते हैं, वह शब्द सार्वजनिक (public) हो जाता है। वे उसे वापस नहीं ले सकते।
- यदि वे गहराई से सोचने के लिए चुप रहते हैं, तो आप अजीब सी खामोशी में इंतज़ार करते रह जाते हैं (यह है "साइलेंस टैक्स")।
- यदि वे विनम्रता दिखाने के लिए तुरंत बोलना शुरू कर देते हैं, तो वे कुछ गलत या अधूरा बोल सकते हैं। क्योंकि वे पहले ही बोल चुके हैं, इसलिए अब वे उस विचार के प्रति "प्रतिबद्ध" (committed) हो गए हैं, जिससे बाद में अपना रास्ता सुधारना उनके लिए कठिन हो सकता है। उन्हें केवल इसलिए एक कमजोर नींव पर काम बनाना पड़ता है क्योंकि उन्होंने बहुत जल्दी बोल दिया था।
नया विचार: साइड-बाय-साइड (SxS) रीजनिंग
यह पेपर AI के बात करने का एक नया तरीका पेश करता है, जिसे साइड-बाय-साइड (SxS) इंटरलीव्ड रीजनिंग (Interleaved Reasoning) कहा जाता है।
इसे एक सीक्रेट इंग्रीडिएंट (गुप्त सामग्री) वाले लाइव कुकिंग शो की तरह समझें।
- "थिंक" मोड (निजी/Private): शेफ (AI) किचन में है, सामग्री काट रहा है, चख रहा है और मिला रहा है। आप इस हिस्से को नहीं देख सकते। यह उनका निजी कार्यक्षेत्र है।
- "स्पीक" मोड (सार्वजनिक/Public): शेफ काउंटर पर आता है और आपसे कहता है, "मैं अब नमक डाल रहा हूँ।"
- जादुई नियम: शेफ को तभी बाहर आने और बोलने की अनुमति है जब वे पहले ही डिश को चख चुके हों और उन्हें 100% यकीन हो कि नमक डालना सही कदम है। वे खाली समय भरने के लिए केवल अंदाज़े नहीं चिल्लाते।
यह कैसे काम करता है ("एंटेलमेंट" ट्रिक)
यह पेपर AI को एक विशिष्ट नियम सिखाता है: "तब तक न बोलें जब तक आपकी सोच उस बात का समर्थन न करे जो आप कहने जा रहे हैं।"
- शेफ को प्रशिक्षित करना: शोधकर्ताओं ने हजारों उदाहरण लिए जहाँ एक AI ने किसी समस्या को हल किया। उन्होंने एक "सुपरवाइजर" (एक अन्य AI) का उपयोग करके जाँच की: "क्या यह विशिष्ट विचार चरण (thought step) वास्तव में इस विशिष्ट उत्तर चरण (answer step) को सिद्ध करता है?"
- इंटरलीव्ड डांस (Interleaved Dance): उन्होंने एक नया प्रशिक्षण प्रारूप बनाया जहाँ AI "सोचने" (निजी) और "बोलने" (सार्वजनिक) के बीच बार-बार स्विच करने का अभ्यास करता है।
- सोचें: "मुझे क्षेत्रफल (area) की गणना करने की आवश्यकता है।" (निजी)
- सोचें: "फॉर्मूला लंबाई गुना चौड़ाई है।" (निजी)
- बोलें: "क्षेत्रफल 50 है।" (सार्वजनिक, क्योंकि सोच ने अभी इसे सिद्ध कर दिया है)।
- सोचें: "रुको, मुझे यूनिट्स (इकाइयों) को दोबारा चेक करने दो।" (निजी)
- बोलें: "तो, 50 वर्ग मीटर।" (सार्वजनिक)।
परिणाम: दोनों दुनियाओं का सर्वश्रेष्ठ संगम
पेपर ने गणित की समस्याओं (AIME25) और विज्ञान के प्रश्नों (GPQA-Diamond) पर दो अलग-अलग आकार के AI मॉडल्स का परीक्षण किया।
- तेज़ अपडेट: 20,000 टोकन (एक बहुत लंबा समय) तक अंतिम उत्तर का इंतज़ार करने के बजाय, AI अब उत्तर के छोटे, सत्यापित हिस्से बहुत पहले ही दे देता है। यह एक ऐसे प्रोग्रेस बार की तरह है जो वास्तव में आगे बढ़ता है, बजाय उस घूमते हुए पहिए (spinning wheel) के।
- कोई "फिलर" नहीं: क्योंकि AI को केवल तभी बोलने के लिए प्रशिक्षित किया गया है जब उसके पास प्रमाण हो, इसलिए वह सन्नाटे को भरने के लिए बकवास नहीं करता।
- सटीकता बनी रहती है: कभी-कभी, AI को जल्दी बोलने के लिए मजबूर करने से वह कम बुद्धिमान हो जाता है। लेकिन क्योंकि यह विधि दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करती है (पहले मोड में स्विच करना सीखना, फिर यह सुनिश्चित करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करना कि उत्तर अभी भी सही है), AI स्मार्ट बना रहता है।
- "पारेटो" जीत (Pareto Win): पेपर का दावा है कि यह एक बेहतर संतुलन (एक "पारेटो ट्रेड-ऑफ") बनाता है। आप अंतिम उत्तर की गुणवत्ता से समझौता किए बिना तेज़, अधिक बार अपडेट प्राप्त करते हैं।
सारांश में
यह पेपर AI को एक आत्मविश्वासी, सत्यापित वक्ता बनने की शिक्षा देकर "साइलेंस टैक्स" को हल करता है। यह मॉडल को काम करते समय अपना "सोचने वाला हैट" पहने रहने की अनुमति देता है, और वह केवल तभी अपना हैट उतारकर समाधान का एक हिस्सा साझा करता है जब उसे पता हो कि वह हिस्सा ठोस है। यह बातचीत को तेज़ और अधिक रिस्पॉन्सिव बनाता है, बिना AI को सन्नाटा भरने के लिए अनुमान लगाने या झूठ बोलने के लिए मजबूर किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।