← नवीनतम पेपर
💬 NLP

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

यह शोध पत्र RAD (रूटिंग एग्रीमेंट डिकोडिंग) प्रस्तुत करता है, जो एक नवीन इन्फरेंस रणनीति है जो उच्च गुणवत्ता वाले रीजनिंग ट्रेजेक्टरीज (तर्क पथों) का चयन करने के लिए समान टोकन के विशिष्ट मिक्स्चर-ऑफ-एक्सपर्ट्स रूटिंग पैटर्न का लाभ उठाती है, जो उत्तर स्ट्रिंग पार्सिंग या वोटिंग पर निर्भर किए बिना किया जाता है, जिससे कोड और एजेंटिक कार्यों के लिए प्रभावी pass@1 चयन सक्षम होता है जहाँ पारंपरिक मेजॉरिटी वोटिंग विफल हो जाती है।

मूल लेखक: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य प्रश्न: क्या एक "Hello" हमेशा एक जैसा ही "Hello" होता है?

कल्पना कीजिए कि आप 100 अलग-अलग गायकों (एक बड़े AI मॉडल के अंदर के "विशेषज्ञों" या "Experts") के एक समूह को सुन रहे हैं। जब वह समूह "Hello" शब्द गाता है, तो आप मान सकते हैं कि वे सभी इसे बिल्कुल एक ही तरह से, एक ही गायन तकनीक और भावनाओं के साथ गा रहे हैं।

पेपर यह पूछता है: यदि AI दो अलग-अलग स्थितियों में बिल्कुल एक ही शब्द (टोकन) आउटपुट करता है, तो क्या इसका मतलब यह है कि उस शब्द को बनाने वाली आंतरिक "मशीनरी" भी एक ही थी?

उत्तर: नहीं।

भले ही AI बिल्कुल एक ही शब्द (जैसे "Hello" या "The answer is 42") लिखता है, लेकिन उस शब्द को उत्पन्न करने वाले विशेषज्ञों (experts) का विशिष्ट समूह पूरी तरह से अलग हो सकता है, जो इस बात पर निर्भर करता है कि संदर्भ (context) क्या है। एक "Hello" उन विशेषज्ञों के समूह द्वारा गाया जा सकता है जो गणित के बारे में सोच रहे हैं, जबकि दूसरा "Hello" उन विशेषज्ञों द्वारा गाया जा सकता है जो कोडिंग के बारे में सोच रहे हैं। शब्द वही है, लेकिन आंतरिक अवस्था (internal state) अलग है।

समस्या: हम सही उत्तर कैसे चुनें?

आमतौर पर, जब हम चाहते हैं कि एक AI किसी कठिन समस्या को हल करे (जैसे गणित की पहेली या कोडिंग बग), तो हम उसे 64 अलग-अलग बार प्रयास करने (64 "rollouts") के लिए कहते हैं। फिर, हम अंतिम उत्तरों को देखते हैं। यदि 50 उत्तर "42" कहते हैं और 14 उत्तर "43" कहते हैं, तो हम "42" को चुनते हैं क्योंकि यह बहुमत का वोट है।

चुनौती: यह "अंतिम उत्तर पर मतदान करना" गणित के लिए बहुत अच्छा काम करता है (जहाँ उत्तर एक स्पष्ट संख्या होती है)। लेकिन यह निम्नलिखित के लिए विफल हो जाता है:

  1. कोड (Code): दो प्रोग्राम बिल्कुल एक ही काम कर सकते हैं लेकिन वे दिखने में पूरी तरह अलग हो सकते हैं (अलग वेरिएबल नाम, अलग फॉर्मेटिंग)। आप केवल यह नहीं गिन सकते कि "print" शब्द कितनी बार आया है।
  2. एजेंट्स (Agents): कभी-कभी AI किसी सॉफ़्टवेयर बग को ठीक करने की कोशिश कर रहा होता है। यहाँ "उत्तर" कोड का एक पैच होता है। कोई एक एकल "सही स्ट्रिंग" नहीं होती जिस पर वोट किया जा सके; हर प्रयास के लिए कोड अद्वितीय होता है।

हमें अंतिम उत्तरों को पढ़े या तुलना किए बिना सबसे अच्छे प्रयास को चुनने का एक तरीका चाहिए।

समाधान: RAD (रूटिंग एग्रीमेंट डिकोडिंग)

लेखकों ने AI के भीतर छिपे एक गुप्त संकेत की खोज की: राउटर (Router)

AI को हजारों विशिष्ट श्रमिकों (विशेषज्ञों) वाले एक विशाल कार्यालय भवन के रूप में सोचें। कोई भी कार्य करने से पहले, एक राउटर (मैनेजर) यह तय करता है कि किस टीम को काम सौंपा जाएगा।

  • खोज: पेपर ने पाया कि जब AI अपने उत्तर की शुरुआत लिखने वाला होता है (जैसे गणित में \boxed{ प्रतीक या कोडिंग में ट्रिपल बैकटिक्स ```), तो राउटर का निर्णय पैटर्न उत्तर की गुणवत्ता के बारे में बहुत कुछ प्रकट करता है।
  • उपमा: कल्पना कीजिए कि आप एक स्पोर्ट्स टूर्नामेंट में जीतने वाली टीम का अनुमान लगाने की कोशिश कर रहे हैं। अंतिम स्कोर (जिसे आप अभी देख नहीं सकते) का इंतजार करने के बजाय, आप देखते हैं कि कोच ने खेल शुरू करने के लिए किन खिलाड़ियों को चुना है
    • यदि कोच 50 अलग-अलग मैचों के लिए एक ही "ड्रीम टीम" की लाइनअप चुनता है, तो उन मैचों का परिणाम भी संभवतः एक जैसा ही होगा।
    • यदि कोच रैंडम और बेमेल लाइनअप चुनते हैं, तो परिणाम चारों ओर बिखरे होंगे।

RAD इस प्रकार काम करता है:

  1. यह एक समस्या के 64 अलग-अलग प्रयास उत्पन्न करता है।
  2. यह अंतिम उत्तरों को पूरी तरह से अनदेखा कर देता है। यह उन्हें पढ़ता भी नहीं है।
  3. यह राउटर की लाइनअप (किन विशेषज्ञों को चुना गया था) को देखता है, ठीक उसी क्षण जब उत्तर शुरू होता है।
  4. यह पूछता है: "किन 64 प्रयासों में सबसे समान लाइनअप थे?"
  5. यह उस प्रयास को चुनता है जो समान लाइनअप के सबसे बड़े समूह से संबंधित है।

यदि 50 प्रयास उत्तर शुरू करते समय एक ही "विशेषज्ञ टीम" का उपयोग करते हैं, तो RAD मानता है कि वह समूह सबसे अधिक आश्वस्त है और उसके सही होने की संभावना अधिक है, भले ही उसे वास्तविक उत्तर पता न हो।

यह एक बड़ी बात क्यों है?

  1. यह वहां काम करता है जहां वोटिंग विफल हो जाती है: कोडिंग कार्यों पर, जहाँ आप शब्दों को गिनकर मुकाबला नहीं कर सकते, RAD फिर भी काम करता है। यह सबसे अच्छे कोड पैच को चुनता है—कोड को देखकर नहीं, बल्कि उस "आंतरिक टीम" को देखकर जिसने उसे लिखा है।
  2. यह तेज़ और सरल है: इसे कोड का अर्थ समझने की आवश्यकता नहीं है। यह बस आंतरिक "स्विच" के पैटर्न को देखता है।
  3. यह कोई जादुई सत्य डिटेक्टर नहीं है: पेपर इस बारे में ईमानदार है। यदि 50 लोग एक ही गलत उत्तर पर सहमत होते हैं (एक "डेंस गलत बेसिन"), तो RAD उस गलत उत्तर को भी चुनेगा। यह सबसे लोकप्रिय मार्ग चुनता है, न कि अनिवार्य रूप से सत्य मार्ग। यह एक "कंसेंसस सिग्नल" (आम सहमति का संकेत) है, न कि "ट्रुथ वेरीफायर" (सत्य का सत्यापनकर्ता)।

एक वाक्य में सारांश

यह पेपर दिखाता है कि भले ही एक AI एक ही शब्द को दो बार कहे, लेकिन आंतरिक "टीम" जो उसे कह रही है वह अलग हो सकती है; उत्तर की शुरुआत में सबसे सुसंगत "टीम लाइनअप" से आने वाले उत्तर को चुनकर, हम अंतिम उत्तर को पढ़े बिना ही सबसे अच्छे परिणाम को चुन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →