← नवीनतम पेपर
💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

यह शोध पत्र बजट-गाइडेड एमसीटीएस (BG-MCTS) का प्रस्ताव करता है, जो एक ट्री-सर्च डिकोडिंग एल्गोरिदम है जो गणितीय और भौतिकी तर्क कार्यों में बजट-अज्ञेयवादी बेसलाइनों से बेहतर प्रदर्शन करने के लिए शेष टोकन बजट के साथ अन्वेषण (exploration) और परिशोधन (refinement) रणनीतियों को गतिशील रूप से संरेखित करता है।

मूल लेखक: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत ही कठिन पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन आपका एक सख्त नियम है: आप घड़ी खत्म होने से पहले केवल एक निश्चित संख्या में प्रश्न पूछ सकते हैं। यह बिल्कुल वही चुनौती है जिसका सामना एलएलएम (LLMs) गणित या भौतिकी जैसे जटिल समस्याओं को हल करते समय करते हैं। उनका एक "टोकन बजट" होता है—शब्दों या चरणों की एक सीमा।

यह शोध पत्र एक नई विधि पेश करता है जिसे BG-MCTS (बजट-गाइडेड मोंटे कार्लो ट्री सर्च) कहा जाता है, ताकि ये एआई जासूस उस सख्त समय सीमा के भीतर समस्याओं को बेहतर ढंग से हल कर सकें।

यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "एक ही ढर्रे पर चलने वाला" जासूस

वर्तमान में, अधिकांश एआई खोज विधियाँ एक ऐसे जासूस की तरह कार्य करती हैं जिनका योजना कितना भी समय बचा हो, एक समान रहता है।

  • पुराना तरीका: जासूस दिन का पहला आधा हिस्सा 100 अलग-अलग लोगों से सुराग मांगकर बिता देता है (व्यापक अन्वेषण)। फिर, आखिरी 10 मिनट में, उसे एहसास होता है कि उसके पास सबसे आशाजनक सुरागों का पीछा करने के लिए समय नहीं बचा है। वह ठीक उसी समय जांच की एक नई लाइन शुरू कर सकता है जब घड़ी शून्य पर पहुँचने वाली होती है, जिससे मामला अनसुलझा रह जाता है। या, वे बहुत जल्दी रुक सकते हैं, जिससे उनकी शिफ्ट के आखिरी 10 मिनट बर्बाद हो जाते हैं।
  • समस्या: मौजूदा विधियाँ समय सीमा (टोकन बजट) को केवल एक "स्टॉप साइन" (रुकने का संकेत) के रूप में देखती हैं। वे यह नहीं बदलतीं कि बचा हुआ समय कितना है।

समाधान: "स्मार्ट जासूस" (BG-MCTS)

लेखक एक ऐसे जासूस का प्रस्ताव देते हैं जो लगातार अपनी घड़ी देखता है और बचा हुआ समय देखकर अपनी रणनीति बदलता है। वे इसे बजट-गाइडेड MCTS कहते हैं।

खोज प्रक्रिया को एक जड़ से बढ़ते हुए पेड़ के रूप में देखें:

  1. प्रारंभिक चरण (ढेर सारा समय बचा है): जब जासूस के पास 100% समय होता है, तो वह एक व्यापक जाल फेंकने वाले मछुआरे की तरह कार्य करता है। वह एक विस्तृत जाल डालता है, कई उथले रास्तों की खोज करता है ताकि यह देखा जा सके कि मछलियाँ कहाँ हो सकती हैं। वह अभी गहराई में नहीं उतरता; वह बस पूरे समुद्र को देखना चाहता है।
  2. अंतिम चरण (समय समाप्त हो रहा है): जैसे-जैसे घड़ी पीछे चलती है (मान लीजिए, बजट का 25% शेष है), जासूस व्यापक जाल फेंकना बंद कर देता है। इसके बजाय, वह पहले मिले सबसे आशाजनक दो या तीन स्थानों को चुनता है और गहराई तक जाता है। वह जांच की नई लाइनें शुरू करना बंद कर देता है और पूरी तरह से सबसे अच्छे सुरागों पर ध्यान केंद्रित करता है ताकि जांच पूरी की जा सके।

एआई इसे कैसे करता है

शोध पत्र में दो विशिष्ट तरकीबों का वर्णन किया गया है जिनका उपयोग एआई इस कार्य को पूरा करने के लिए करता है:

  • "टाइम-चेक" स्कोर: जब एआई तय करता है कि अगला रास्ता कौन सा होगा, तो वह एक फॉर्मूले का उपयोग करता है जो बचे हुए बजट को देखता है।
    • यदि बहुत सारा बजट है, तो फॉर्मूला नए, अनछुए रास्तों को आज़माने के लिए प्रोत्साहित करता है।
    • यदि बजट कम है, तो फॉर्मूला नए रास्ते शुरू करने को दंडित करता है और उन रास्तों में गहराई तक जाने को पुरस्कृत करता है जो पहले से ही अच्छे दिख रहे हैं।
  • "न्यू ब्रांच" स्विच: एआई के पास एक विशेष स्विच है जो यह तय करता है कि पेड़ पर एक नई शाखा विकसित करनी है या केवल एक मौजूदा शाखा में गहराई तक जाना है।
    • जब समय प्रचुर मात्रा में होता है, तो स्विच "नई शाखाएं उगाएं" (Grow New Branches) पर सेट होता है।
    • जब समय समाप्त हो रहा होता है, तो स्विच "गहराई में जाएं" (Go Deeper) पर बदल जाता है, जिससे एआई को एक नई शाखा शुरू करने में अपने अंतिम कुछ सेकंड बर्बाद करने से रोका जा सके जिसे वह पूरा नहीं कर पाएगा।

परिणाम

शोधकर्ताओं ने कठिन गणित और भौतिकी की समस्याओं पर अन्य विधियों के मुकाबले इस "स्मार्ट जासूस" का परीक्षण किया। उन्होंने पाया कि:

  • बेहतर सटीकता: एआई ने समान टोकन सीमा के भीतर अधिक समस्याओं को सही ढंग से हल किया।
  • कोई समय बर्बाद नहीं: अन्य विधियों के विपरीत, जो शायद बहुत जल्दी रुक सकती हैं या अंत में बहुत अधिक नए रास्ते शुरू कर सकती हैं, BG-MCTS ने पूरे बजट का कुशलतापूर्वक उपयोग किया। इसने शुरुआत में व्यापक रूप से खोज की और अंत में मजबूती से काम पूरा किया।
  • लगातार प्रदर्शन: यह विभिन्न प्रकार के एआई मॉडल और विभिन्न प्रकार की समस्याओं की कठिनाई के बीच भी अच्छी तरह से काम करता है।

मुख्य बात

शोध पत्र का दावा है कि एआई की खोज रणनीति को "बचा हुआ बजट" के प्रति जागरूक बनाकर, हम अधिक कंप्यूटिंग पावर की आवश्यकता के बिना बेहतर उत्तर प्राप्त कर सकते हैं। यह एक धावक को सिखाने जैसा है कि न केवल तेज़ दौड़ना है, बल्कि यह भी जानना है कि कब स्प्रिंट (तेज़ दौड़) करना है और कब ऊर्जा बचाकर रखनी है ताकि वह सर्वोत्तम संभव समय के साथ फिनिश लाइन पार कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →