← नवीनतम पेपर
💬 NLP

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

यह शोध पत्र लोकल ब्रांच रूटिंग (LBR) को प्रस्तुत करता है, जो एक टोकन-स्तरीय टेस्ट-टाइम स्केलिंग फ्रेमवर्क है जो स्थानीय लुकअहेड पेड़ों का विस्तार करके और इष्टतम शाखाओं को चुनने के लिए एक हल्के राउटर का उपयोग करके भाषा मॉडल की तर्क क्षमता को कुशलतापूर्वक बढ़ाता है, जिससे एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) सक्षम होती है और गणितीय तर्क कार्यों पर मौजूदा डिस्क्रीट चेन-ऑफ-थॉट और सॉफ्ट-टोकन बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "लोकल ब्रांच रूटिंग" (Local Branch Routing) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: बहुत धीरे सोचना या बहुत संकीर्ण रूप से सोचना

कल्पना कीजिए कि आप एक बहुत कठिन गणित की समस्या हल करने की कोशिश कर रहे हैं या किसी जटिल यात्रा की योजना बना रहे हैं। आपके पास एक स्मार्ट असिस्टेंट (AI) आपकी मदद कर रहा है।

वर्तमान में, AI असिस्टेंट आमतौर पर दो तरीकों से काम करते हैं:

  1. "एक-पथ" वाला यात्री (The "One-Path" Walker): वे कदम-दर-कदम सोचते हैं, और जो पहला विचार उनके दिमाग में आता है, उसी के प्रति प्रतिबद्ध हो जाते हैं। यदि वे शुरुआत में गलत मोड़ ले लेते हैं, तो वे फंस सकते हैं, क्योंकि उन्होंने अन्य विकल्पों को कभी देखा ही नहीं।
  2. "पूर्ण-मानचित्र" अन्वेषक (The "Full-Map" Explorer): वे एक साथ हर संभावित समाधान पथ को लिखने, उन सभी की जांच करने और सबसे अच्छा चुनने की कोशिश करते हैं। यह बहुत सटीक है, लेकिन यह एक लाइब्रेरी में एक वाक्य खोजने के लिए हर किताब पढ़ने की कोशिश करने जैसा है—इसमें बहुत अधिक समय और कंप्यूटिंग शक्ति लगती है।

इस पेपर के लेखकों ने एक "गोल्डिलॉक्स" (Goldilocks) समाधान ढूंढना चाहा: एक ऐसा तरीका जिससे वे एक बेहतर विकल्प बनाने के लिए कुछ अलग संभावनाओं को देख सकें, बिना सब कुछ जाँचने के बोझ तले दबे।

समाधान: लोकल ब्रांच रूटिंग (LBR)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे लोकल ब्रांच रूटिंग (LBR) कहा जाता है। इसे "आगे देखो, फिर निर्णय लो" रणनीति के रूप में समझें।

यह कैसे काम करता है, इसे एक हाइकर (पगडंडी चुनने वाले) के उदाहरण का उपयोग करते हुए चरण-दर-चरण समझें:

1. "आगे देखना" (पेड़ का विस्तार करना - Growing the Tree)

अगला शब्द (या पगडंडी का निशान) चुनने के बजाय, AI रुकता है। वह अगले कुछ शब्दों (या पगडंडी के निशानों) की कल्पना ऐसे करता है जैसे वे वास्तविक हों।

  • पेपर का शब्द: Expands a small local lookahead tree.
  • उदाहरण: कल्पना कीजिए कि आप सड़क के एक मोड़ पर खड़े हैं। केवल एक रास्ता चुनने के बजाय, आप मन में जल्दी से पथ A में 3 कदम चलते हैं, पथ B में 3 कदम चलते हैं, और पथ C में 3 कदम चलते हैं। आप अभी इनमें से किसी के लिए भी प्रतिबद्ध नहीं हैं; आप बस यह देखने के लिए उन्हें अपने मन में "चलते" हैं कि ज़मीन कैसी दिखती है।

2. "राउटर" (निर्णय लेने वाला - The Decision Maker)

एक बार जब AI ने ये छोटे रास्ते "चल" लिए होते हैं, तो वह परिणामों को देखता है। वह पूछता है: "इनमें से कौन सा छोटा रास्ता सबसे अधिक आशाजनक लग रहा है?"

  • पेपर का शब्द: Uses a lightweight router to select the depth-1 subtree.
  • उदाहरण: एक स्मार्ट गाइड (राउटर) आपके द्वारा खोजे गए इलाके को देखता है। हो सकता है कि पथ A एक चट्टान की ओर जाता हो, पथ B एक दलदल की ओर, लेकिन पथ C एक सुंदर घास के मैदान की ओर जाता हो। गाइड पथ C की ओर इशारा करता है और कहता है, "ठीक है, अब हम आधिकारिक तौर पर इसी पर चलते हैं।"

3. "छंटाई और स्थानांतरण" (आगे बढ़ना - The "Prune and Shift")

AI आधिकारिक तौर पर पथ C का पहला कदम लिख देता है। वह पथ A और पथ B के विचारों को हटा देता है (छंटाई/Pruning)। फिर, वह अपना शुरुआती बिंदु उस पहले कदम के अंत में ले जाता है और प्रक्रिया को दोहराता है: फिर से आगे देखता है, अगला सबसे अच्छा कदम चुनता है, और आगे बढ़ता है।

  • पेपर का शब्द: Prune–shift–grows decoding process.
  • उदाहरण: आप घास के मैदान वाले पथ पर पहला कदम उठाते हैं। अब आप एक नई जगह पर हैं। आप फिर से आगे देखते हैं, अगला सबसे अच्छा कदम चुनते हैं, और चलते रहते हैं।

यह अन्य विधियों से बेहतर क्यों है?

पेपर इसकी तुलना सोचने के दो अन्य सामान्य तरीकों से करता है:

  • "डिस्क्रीट चेन-ऑफ़-थॉट" (एक-पथ वाला यात्री) के मुकाबले:

    • समस्या: एक-पथ वाले यात्री को यह तय करना होता है कि उसे किस दिशा में जाना है, इससे पहले कि वह देखे कि रास्ता कैसा दिखता है। यह दरवाजा खोलने से पहले ही दरवाजा चुनने जैसा है।
    • LBR का लाभ: LBR निर्णय लेने से पहले दरवाजा खोलता है (रास्ता देखता है)। पेपर दिखाता है कि कुछ कदम चलने के बाद के "हिडन स्टेट्स" (रास्ते की मानसिक तस्वीर) में मूल्यवान सुराग होते हैं जो बेहतर निर्णय लेने में मदद करते हैं।
  • "सॉफ्ट-टोकन ब्रांचिंग" (धुंधला मिश्रण - The Blurry Mixture) के मुकाबले:

    • समस्या: कुछ विधियाँ सभी रास्तों को एक "धुंधले" औसत में मिलाकर एक साथ देखने की कोशिश करती हैं। यह एक ऐसी फोटो देखने जैसा है जहाँ तीनों रास्ते एक-दूसरे के ऊपर आरोपित (superimposed) हैं। आप किसी भी एक पथ के विवरण को स्पष्ट रूप से नहीं देख सकते।
    • LBR का लाभ: LBR रास्तों को डिस्क्रीट (अलग और स्पष्ट) रखता है। यह पथ A, फिर पथ B, और फिर पथ C पर चलता है, और उनकी अलग-अलग तुलना करता है। पेपर ने पाया कि रास्तों को अलग रखने से AI विशिष्ट विवरण (जैसे चट्टान या घास का मैदान) देख पाता है जो "धुंधले" मिश्रण में खो जाते हैं।

परिणाम: उन्होंने क्या पाया?

लेखकों ने दो प्रकार के कार्यों पर इसका परीक्षण किया:

  1. सिंथेटिक प्लानिंग (एक बनाया गया खेल): उन्होंने एक पहेली बनाई जहाँ AI को एक ग्राफ के माध्यम से नेविगेट करना था। उन्होंने पाया कि LBR इसे हल करने में बहुत बेहतर था क्योंकि यह सही मोड़ लेने के लिए छोटे रास्तों पर चलकर मिले "सुरागों" का उपयोग कर सका।
  2. गणितीय तर्क (वास्तविक गणित की समस्याएँ): उन्होंने कठिन गणित बेंचमार्क (जैसे प्रतियोगिताओं में उपयोग किए जाने वाले) पर LBR का परीक्षण किया।
    • परिणाम: LBR ने मानक "एक-पथ" विधि और "धुंधले मिश्रण" विधि की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
    • दक्षता (Efficiency): इसने यह सब बिना हर संभव समाधान की जांच किए किया। इसने केवल कुछ स्थानीय विकल्पों की जांच की, एक स्मार्ट चुनाव किया, और आगे बढ़ गया।

निचोड़ (The Bottom Line)

लोकल ब्रांच रूटिंग एक AI को एक "टॉर्च" देने जैसा है जो उसे निर्णय लेने से पहले कुछ कदम आगे झांकने की अनुमति देती है। यह पूरे भविष्य को देखने की कोशिश नहीं करता (जो बहुत महंगा है), लेकिन यह अंधेरे में अंदाज़ा भी नहीं लगाता। कुछ छोटी संभावनाओं को देखकर, उनकी स्पष्ट तुलना करके और सबसे अच्छे को चुनकर, AI कठिन तर्क संबंधी समस्याओं को हल करने में अधिक स्मार्ट और सटीक हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →