← नवीनतम पेपर
🤖 machine learning

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

यह शोध पत्र **CostAda** को प्रस्तुत करता है, जो एक लागत-कैलिब्रेटेड अनुकूलन नियंत्रक (cost-calibrated adaptive controller) है जो गुणवत्ता लाभ और टोकन लागत के अनुपात के आधार पर खोज संसाधनों को गतिशील रूप से आवंटित करके LLM डिस्कवरी को अनुकूलित करता है, जिससे मौजूदा विधियों की तुलना में काफी कम बजट के साथ बेहतर या समकक्ष परिणाम प्राप्त होते हैं।

मूल लेखक: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि प्रतिभाशाली जासूसों की एक टीम अविश्वसनीय रूप से जटिल पहेलियों को सुलझाने की कोशिश कर रही है। उनके पास "सोचने वाले टोकन" (thinking tokens) की एक सीमित आपूर्ति है—एक जादुई मुद्रा जो उन्हें लिखा गया हर शब्द, खोजा गया हर सुराग और परीक्षण की गई हर परिकल्पना के लिए भुगतान करती है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये टोकन नए वैज्ञानिक फार्मूले खोजने, बेहतर एल्गोरिदम डिजाइन करने या सटीक कंप्यूटर कोड लिखने के लिए बड़े भाषा मॉडल (LLMs) का उपयोग करने की वास्तविक लागत हैं। लंबे समय तक, "नियंत्रक" (इन जासूस टीमों के प्रबंधक) केवल एक ही चीज़ की परवाह करते थे: क्या स्कोर बढ़ा? यदि एक जासूस ने एक छोटा सुराग सुलझाया या एक विशाल रहस्य, और दोनों से स्कोर में समान वृद्धि हुई, तो प्रबंधक ने दोनों को बिल्कुल एक जैसा माना। लेकिन यहाँ एक पेच था: छोटा सुराग सुलझाने में एक टोकन खर्च हुआ, जबकि विशाल रहस्य को सुलझाने में छह टोकन लगे। यदि प्रबंधक महंगे कदमों के लिए भुगतान करना जारी रखता क्योंकि स्कोर बढ़ रहा था, तो टीम सर्वोत्तम समाधान खोजने से बहुत पहले ही अपना सारा पैसा खत्म कर देती। बड़ा सवाल वैज्ञानिकों के लिए यह है: आप एक ऐसी टीम का प्रबंधन कैसे करते हैं जब हर कदम की लागत अलग-अलग होती है, और आपके पास भीतर रहने के लिए एक सख्त बजट होता है?

यह शोध पत्र एक नया, अधिक स्मार्ट प्रबंधक पेश करता है जिसे CostAda कहा जाता है। शोधकर्ताओं ने पाया कि पुराने तरीके से प्रबंधन करना—यह अनदेखा करना कि एक कदम की वास्तव में कितनी लागत आई—तबाही का नुस्खा था। उन्होंने गणितीय रूप से सिद्ध किया कि यदि आप मूल्य टैग के आधार पर अपने क्रेडिट को समायोजित नहीं करते हैं, तो जैसे-जैसे खोज अधिक जटिल होती जाती है, आपकी प्रगति लगभग शून्य हो सकती है। CostAda खेल बदल देता है क्योंकि यह "पैसे के बदले मिलने वाले लाभ" (bang for the buck) को देखता है। यह पूछता है: "क्या यह स्कोर सुधार अभी खर्च किए गए टोकनों के लायक है?" यदि कोई कदम महंगा है, तो CostAda अगले कदम को मंजूरी देने से पहले एक बड़े इनाम की मांग करता है। यह शेष बजट पर भी कड़ी नज़र रखता है। खेल की शुरुआत में, जब पैसा प्रचुर मात्रा में होता है, तो एक नया रास्ता खोजने के लिए कुछ महंगे जोखिम लेना ठीक है। लेकिन जैसे-जैसे बजट कम होता जाता है, प्रबंधक सख्त हो जाता है, और केवल उन कदमों को मंजूरी देता है जो सस्ते हैं और जिनके सफल होने की पुष्टि हो चुकी है, या अंतिम कुछ टोकनों को एक बड़े, गेम-चेंजिंग गाइड के लिए बचाकर रखता है।

टीम ने दो अलग-अलग AI मस्तिष्क (GLM-5 और GPT-5.4) का उपयोग करके बारह विभिन्न पहेली सेटों (बेंचमार्क) पर इस नए प्रबंधक का परीक्षण किया। परिणाम प्रभावशाली थे। सोलह परीक्षण मामलों में से बारह में, CostAda ने पिछले सर्वोत्तम तरीकों के समान ही समाधान खोज लिए, लेकिन इसने यह सब अधिकतम आधे बजट का उपयोग करके किया। दूसरे शब्दों में, इसने 50% कीमत पर समान उच्च-गुणवत्ता वाले परिणाम प्राप्त किए। सभी आठ प्रमुख चुनौतियों में, CostAda ने लगातार उच्चतम औसत अंतिम गुणवत्ता हासिल की। शोधकर्ताओं ने दिखाया कि प्रत्येक क्रिया की लागत को निर्णय लेने की प्रक्रिया के एक महत्वपूर्ण हिस्से के रूप में देखने से—न कि केवल बाद में देखने वाली एक रसीद के रूप में—AI अधिक कुशलता से अन्वेषण कर सकता है, मृत अंत (dead ends) पर पैसा बर्बाद करने से बच सकता है, और तेजी से तथा समझदारी से फिनिश लाइन तक पहुँच सकता है। यह ऐसा ही है जैसे यह महसूस करना कि कभी-कभी, महंगी हाईवे लेना गैस की बर्बादी है, लेकिन दौड़ जीतने के लिए इसे कब चुकाना है, यह सटीक रूप से जानना ही सफलता की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →