← नवीनतम पेपर
🤖 AI

The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

यह शोध पत्र CLEAR का प्रस्ताव करता है, जो एक आर्थिक-प्रेरित आवंटन ढांचा है जो एक वैश्विक शैडो प्राइस (shadow price) के आधार पर संसाधनों को समाधान योग्य क्वेरीज़ से असाध्य क्वेरीज़ की ओर गतिशील रूप से पुनर्वितरित करके लार्ज लैंग्वेज मॉडल्स के लिए इन्फरेंस बजट को अनुकूलित करता है, जिससे सख्त कम्प्यूटेशनल बाधाओं के तहत सटीकता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xu Wan, Speed Zhu, Jianwei Cai, Guang Chen, XiMing Huang, Wiggin Zhou, Mingyang Sun

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xu Wan, Speed Zhu, Jianwei Cai, Guang Chen, XiMing Huang, Wiggin Zhou, Mingyang Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट किचन के मैनेजर हैं। आपके पास उच्च-गुणवत्ता वाली सामग्री (आपका कंप्यूटेशनल बजट) की एक सीमित मात्रा है और ग्राहकों की एक कतार है जिनके अलग-अलग ऑर्डर हैं (आपके AI क्वेरीज़)।

कुछ ऑर्डर सरल हैं, जैसे ग्रिल्ड चीज़ सैंडविच। उन्हें बनाने में बहुत कम प्रयास लगता है, और एक बार बन जाने के बाद, उन्हें "अधिक उत्तम" बनाने से कोई खास मूल्य नहीं जुड़ता। कुछ ऑर्डर जटिल होते हैं, जैसे कि 10-कोर्स वाला टेस्टिंग मेनू। यदि आप शेफ को केवल 5 मिनट देते हैं, तो वे इसे बिल्कुल भी पका नहीं पाएंगे। लेकिन अगर आप उन्हें 20 मिनट देते हैं, तो वे एक उत्कृष्ट कृति (मास्टरपीस) बना सकते हैं।

आज की मानक AI प्रणालियों के साथ समस्या यह है कि वे हर ग्राहक के साथ एक जैसा व्यवहार करती हैं। वे हर ऑर्डर को समय और सामग्री का बिल्कुल समान हिस्सा देती हैं, चाहे वह सैंडविच हो या भव्य भोज (बैनक्वेट)। यह बर्बादी है: आप जटिल व्यंजनों के लिए भोजन समाप्त कर सकते हैं क्योंकि आपने उन सरल व्यंजनों पर बहुत अधिक खर्च कर दिया जिन्हें इसकी आवश्यकता नहीं थी।

यह शोध पत्र, "द शैडो प्राइस ऑफ रीजनिंग" (The Shadow Price of Reasoning), बुनियादी आर्थिक सिद्धांतों का उपयोग करके इस तरह से किचन चलाने का एक स्मार्ट तरीका प्रस्तावित करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. खाना पकाने का "S-कर्व" (The "S-Curve" of Cooking)

लेखकों ने पाया है कि तर्क (reasoning) सीधा नहीं चलता है। यह एक S-आकार के वक्र (S-shaped curve) का पालन करता है जिसमें तीन स्पष्ट चरण होते हैं:

  • "स्ट्रिक्ट" चरण (मौन शुरुआत - The "Strict" Phase): शुरुआत में, शेफ प्याज काट रहा है और तैयारी कर रहा है। यदि आप घड़ी रोक देते हैं, तो व्यंजन खराब हो जाएगा। आप चाहे कितना भी समय दें, परिणाम शून्य ही रहेगा क्योंकि न्यूनतम सीमा (threshold) पार नहीं हुई है।
  • "सर्ज" चरण (जादुई क्षण - The "Surge" Phase): एक बार तैयारी पूरी हो जाने के बाद, खाना पकाने की प्रक्रिया तेज होती है। यहीं पर जादू होता है। यहाँ थोड़ा और समय देने से गुणवत्ता में भारी उछाल आता है। यह "स्वीट स्पॉट" है।
  • "एम्पल" चरण (घटता हुआ प्रतिफल - The "Ample" Phase): अंततः, व्यंजन तैयार हो जाता है। यदि आप खाना पकाना जारी रखते हैं, तो आप या तो उसे जला देंगे या उसमें बहुत अधिक मसाले डाल देंगे। यहाँ अधिक समय देने से लगभग कोई मूल्य नहीं जुड़ता और यह परिणाम को नुकसान भी पहुँचा सकता है।

2. "शैडो प्राइस" (समय की बाजार कीमत - The "Shadow Price")

अर्थशास्त्र में, शैडो प्राइस एक संसाधन का मूल्य है जब वह दुर्लभ हो। इसे शेफ के समय के एक मिनट की "बाजार कीमत" के रूप में समझें।

पेपर का तर्क है कि सर्वोत्तम परिणाम प्राप्त करने के लिए, आपको समय को बेतरतीब ढंग से नहीं बांटना चाहिए। इसके बजाय, आपको एक स्मार्ट मार्केट की तरह कार्य करना चाहिए:

  • तर्कसंगत परित्याग (Rational Abandonment): यदि किसी ग्राहक ने 10-कोर्स का भोजन ऑर्डर किया है लेकिन आपके पास केवल एक सैंडविच के लिए पर्याप्त सामग्री है, तो आपको विनम्रता से उस ग्राहक से कहना चाहिए, "हम आज आपकी सेवा नहीं कर सकते।" उस असंभव ऑर्डर पर अपने सीमित संसाधनों को बर्बाद करने के बजाय उसे छोड़ देना बेहतर है।
  • पुनर्वितरण (Reallocation): "परित्यक्त" (abandoned) ऑर्डर्स से जो सामग्री बची है, उसे उन ग्राहकों को दिया जाता है जो बिल्कुल "सर्ज चरण" (Surge Phase) में हैं। ये वे ऑर्डर हैं जो बस थोड़े से अतिरिक्त सहयोग से महान बनने ही वाले हैं।

3. CLEAR सिस्टम

लेखकों ने इसे स्वचालित रूप से करने के लिए CLEAR (Constrained Latent-utility Equilibrium Allocation for Reasoning) नामक एक टूल बनाया है।

  • थ्रेशोल्ड का अनुमान लगाना: यह एक प्रश्न को देखता है और अनुमान लगाता है, "इसे शुरू करने के लिए कितने समय की आवश्यकता है?" (थ्रेशोल्ड)।
  • कीमत खोजना: यह समय के लिए एक "ग्लोबल प्राइस" की गणना करता है। यदि कोई प्रश्न बहुत कठिन है (शुरू करने की लागत समय की कीमत से अधिक है), तो उसे छोड़ दिया जाता है।
  • गणितीय जादू: जिन प्रश्नों को सेवा दी जाती है, उनके लिए यह सटीक मात्रा में समय तय करने के लिए एक विशिष्ट गणितीय सूत्र (जिसमें लैम्बर्ट W फंक्शन शामिल है) का उपयोग करता है—इतना समय देना जो बस "सर्ज चरण" के शिखर तक पहुँच जाए, लेकिन इतना भी नहीं कि वे "एम्पल चरण" में चले जाएँ जहाँ समय बर्बाद होता है।

4. परिणाम

टीम ने गणितीय समस्याओं और कोडिंग कार्यों पर इसका परीक्षण किया।

  • जब संसाधन कम हों: CLEAR एक गेम-चेंजर साबित हुआ। इसने मानक पद्धति (जहाँ सबको समान समय दिया जाता है) की तुलना में सटीकता में 3 गुना तक सुधार किया।
  • यह कैसे काम करता है: इसने उन समस्याओं पर समय बर्बाद करना बंद कर दिया जिन्हें उपलब्ध बजट के साथ हल करना बहुत कठिन था और उन संसाधनों को उन समस्याओं में डाल दिया जो हल होने के बिल्कुल करीब थीं।
  • जब संसाधन प्रचुर हों: यदि आपके पास अनंत समय है, तो CLEAR और मानक विधि समान प्रदर्शन करते हैं, क्योंकि हर किसी को अपना भोजन पकाने के लिए पर्याप्त समय मिल जाता है।

सारांश

संक्षेप में, यह पेपर हमें सिखाता है कि निष्पक्ष होना (सबको समान समय देना) कुशल होने के बराबर नहीं है। AI रीजनिंग को सीमित बजट वाले एक मार्केटप्लेस की तरह मानकर, हम असंभव कार्यों पर प्रयास बर्बाद करना बंद कर सकते हैं और अपना ध्यान उन कार्यों पर केंद्रित कर सकते हैं जो सफलता से बस एक कदम दूर हैं। इससे बिना बड़े या अधिक महंगे मॉडल बनाए, अधिक स्मार्ट और सटीक AI प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →