← नवीनतम पेपर
📊 statistics

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

यह शोध पत्र अनुकूलनशील टेस्ट-टाइम कंप्यूट आवंटन के लिए एक नवीन बैंडिट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो समाधान योग्य चुनौतीपूर्ण उदाहरणों पर संसाधनों को प्राथमिकता देने के लिए क्वेरी की कठिनाई का गतिशील रूप से अनुमान लगाता है, जिससे गणित और कोड बेंचमार्क पर समान आवंटन की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Bowen Zuo, Yinglun Zhu

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Zuo, Yinglun Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रसोई चला रहे एक हेड शेफ हैं। आपके पास सामग्री (आपके कंप्यूटर की प्रोसेसिंग पावर, या "कंप्यूट") की एक सीमित मात्रा है और आपके पास पूरा करने के लिए ऑर्डर (उपयोगकर्ताओं के प्रश्न) की एक सूची है।

अतीत में, अधिकांश शेफ एक "एक ही आकार सबके लिए" (one-size-fits-all) वाला दृष्टिकोण अपनाते थे। वे हर एक ऑर्डर को बिल्कुल समान मात्रा में सामग्री देते थे, चाहे वह व्यंजन कितना भी सरल या जटिल क्यों न हो।

  • यदि किसी ने ग्रिल्ड चीज़ सैंडविच का ऑर्डर दिया (एक आसान गणित का सवाल), तो शेफ उस पर 30 मिनट खर्च करता और प्रीमियम ट्रफल्स का उपयोग करता।
  • यदि किसी ने 10-कोर्स गोर्मे फूड फेस्ट का ऑर्डर दिया (एक कठिन कोडिंग समस्या), तो वह भी केवल 30 मिनट ही खर्च करता और उसी मात्रा में सामग्री का उपयोग करता।

परिणाम? ग्रिल्ड चीज़ या तो बहुत ज्यादा पक गया और संसाधनों की बर्बादी हुई, जबकि गोर्मे फूड फेस्ट अधूरा रह गया और उसे पर्याप्त ध्यान नहीं मिल पाया क्योंकि उसे पर्याप्त सामग्री नहीं मिली।

नई रणनीति: "स्मार्ट वेटर"

यह पेपर रसोई चलाने का एक नया तरीका पेश करता है, जिसे लेखक स्ट्रैटेजिक स्केलिंग (Strategic Scaling) कहते हैं। एक कठोर नियम के बजाय, वे एक स्मार्ट वेटर (जो "बैंडिट लर्निंग" पर आधारित एक एल्गोरिदम है) का प्रस्ताव देते हैं जो आते हुए ऑर्डर्स को देखता है और यह तय करता है कि प्रत्येक ऑर्डर पर कितनी मेहनत खर्च करनी है।

यहाँ बताया गया है कि स्मार्ट वेटर कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "बैंडिट" गेम (अलग-अलग स्लॉट्स आज़माना)

कल्पना कीजिए कि रसोई में स्लॉट मशीनों की एक पंक्ति है (प्रत्येक प्रश्न के लिए एक)।

  • पुराना तरीका: आप हर मशीन का लीवर ठीक 10 बार खींचते हैं, चाहे वह "हारने वाली" मशीन हो या "जीतने वाली" मशीन।
  • नया तरीका: आप लीवर को कुछ बार खींचते हैं। यदि कोई मशीन "हारने वाली" लग रही है (जवाब स्पष्ट रूप से गलत है या सवाल शेफ के लिए बहुत कठिन है), तो आप तुरंत उसे खींचना बंद कर देते हैं। यदि कोई मशीन "जीतने वाली" लग रही है (शेफ सही उत्तर के करीब पहुँच रहा है), तो आप उस सटीक परिणाम को पाने के लिए लीवर खींचना जारी रखते हैं।

2. स्मार्ट वेटर के दो नियम

एल्गोरिदम समय और पैसा बचाने के लिए दो मुख्य तरकीबों का उपयोग करता है:

  • "ईज़ी आउट" नियम (उन्मूलन/Elimination):
    यदि शेफ एक सरल प्रश्न (जैसे, "2+2 क्या है?") को जल्दी हल कर लेता है और एक परफेक्ट स्कोर प्राप्त करता है, तो स्मार्ट वेटर कहता है, "बहुत बढ़िया! हमारा काम हो गया। आइए यहाँ सामग्री बर्बाद करना बंद करें और अगले ऑर्डर पर चलें।" यह आसान कार्यों पर भारी मात्रा में संसाधनों को बचाने में मदद करता है।

  • "कोशिश करते रहो" नियम (एक्सप्लोरेशन/Exploration):
    यदि शेफ एक कठिन प्रश्न पर संघर्ष कर रहा है, तो स्मार्ट वेटर उसे सामग्री खिलाना जारी रखता है। लेकिन वह स्मार्ट तरीके से चुनता है कि किन कठिन प्रश्नों को सामग्री देनी है।

    • एन्ट्रॉपी ट्रिक (The Entropy Trick): पेपर में पाया गया कि जब एक शेफ एक असंभव समस्या पर फँसा होता है, तो वह अक्सर बकवास या निरर्थक बातें (कम विविधता) उगलने लगता है। लेकिन जब वह एक कठिन समस्या को हल करने के करीब होता है, तो वह कई अलग-अलग रचनात्मक दृष्टिकोणों का प्रयास करता है (उच्च विविधता)। स्मार्ट वेटर इस "रचनात्मक अराजकता" (creative chaos) को सुनता है। यदि कोई प्रश्न विविध और दिलचस्प प्रयास उत्पन्न कर रहा है, तो वेटर सोचता है, "यह हल करने योग्य है! इसे खिलाना जारी रखें!" यदि प्रयास केवल एक जैसा निरर्थक शोर है, तो वेटर रुक जाता है, जिससे बेहतर अवसरों के लिए संसाधन बच जाते हैं।

परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने कठिन गणित और कोडिंग परीक्षणों (जैसे MATH-500 और AIME प्रतियोगिताएं) पर इस "स्मार्ट वेटर" का परीक्षण किया।

  • पुराना तरीका (यूनिफॉर्म): एक निश्चित स्कोर प्राप्त करने के लिए, उन्हें भारी मात्रा में कंप्यूटर पावर की आवश्यकता थी।
  • नया तरीका (स्ट्रैटेजिक): उन्होंने काफी कम पावर का उपयोग करके वही या बेहतर स्कोर प्राप्त किए।

संख्याओं में उपमा:
कल्पना कीजिए कि आपको 100 पहेलियाँ सुलझानी हैं।

  • यूनिफॉर्म रणनीति: आप हर पहेली पर 1 घंटा बिताते हैं। कुल समय: 100 घंटे। आप 80 को हल करते हैं।
  • स्मार्ट वेटर रणनीति: आप आसान पहेलियों पर 5 मिनट, मध्यम वाली पर 30 मिनट और वास्तव में कठिन वाली पर 2 घंटे बिताते हैं। कुल समय: 100 घंटे। लेकिन क्योंकि आपने आसान पहेलियों पर समय बर्बाद नहीं किया, इसलिए आपके पास कठिन पहेलियों को सुलझाने के लिए अतिरिक्त समय था। आप अंत में 90 को हल करते हैं।

निचोड़

यह पेपर हमें सिखाता है कि सभी प्रश्न एक समान नहीं होते। एक स्मार्ट, अनुकूलन योग्य प्रणाली का उपयोग करके जो एक जुआरी की तरह काम करती है जो सबसे अच्छी स्लॉट मशीन खोजने की कोशिश कर रहा है, हम अपने AI मॉडल को बिना बड़े, अधिक महंगे कंप्यूटर बनाए बहुत स्मार्ट बना सकते हैं। हम बस उन चीजों पर अपनी "बौद्धिक शक्ति" (brain power) बर्बाद करना बंद कर देते हैं जो या तो बहुत आसान हैं या असंभव हैं, और इसे वहां केंद्रित करते हैं जहां यह वास्तव में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →