← नवीनतम पेपर
🤖 machine learning

Cost-Aware Learning

यह शोध पत्र कॉस्ट-अवेयर लर्निंग (Cost-Aware Learning) प्रस्तुत करता है, जो विविध सैंपलिंग खर्चों को ध्यान में रखते हुए कुल प्रशिक्षण लागत को कम करने वाला एक ढांचा है, जो सैद्धांतिक गारंटियों और एक सबसेट चयन पद्धति के साथ कॉस्ट-अवेयर SGD एल्गोरिदम का प्रस्ताव देता है, और इन अंतर्दृष्टि को कॉस्ट-अवेयर GRPO विकसित करने में लागू करता है, जो प्रदर्शन को बनाए रखते हुए LLM पॉलिसी ऑप्टिमाइज़ेशन में टोकन उपयोग को 30% तक कम करता है।

मूल लेखक: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नई रेसिपी को बेहतर बनाने की कोशिश कर रहे हैं। आपका लक्ष्य व्यंजन का स्वाद लेना, उसमें मसालों का तालमेल बिठाना और उसे एकदम सही (एक लक्षित "त्रुटि" स्तर तक) बनाना है।

मानक कंप्यूटर प्रशिक्षण की दुनिया में, यह धारणा है कि हर सामग्री को चखने में लगने वाला समय और प्रयास बिल्कुल समान होता है। चाहे आप नमक का एक चुटकी लें या सूप का एक पूरा कटोरा, "लागत" (cost) समान होती है। इसलिए, आप बस तब तक चीजों को रैंडमली चखते रहते हैं जब तक कि आप सही परिणाम तक न पहुँच जाएँ।

लेकिन आधुनिक AI (विशेष रूप से लार्ज लैंग्वेज मॉडल्स) की वास्तविक दुनिया में, ऐसा नहीं है। कुछ "सामग्रियाँ" (प्रशिक्षण डेटा) सस्ती और जल्दी चखी जा सकती हैं (छोटे वाक्य), जबकि अन्य महंगी और धीमी होती हैं (लंबी, जटिल तर्क श्रृंखलाएँ)। एक लंबी, जटिल कहानी को चखने में एक छोटी कहानी की तुलना में 100 गुना अधिक कंप्यूटिंग पावर लग सकती है।

यह पेपर कॉस्ट-अवेयर लर्निंग (Cost-Aware Learning) नामक खाना पकाने का एक नया तरीका पेश करता है। केवल रैंडम तरीके से चखने के बजाय, शेफ (एल्गोरिदम) यह सीखता है कि क्या चखना है और कितनी बार चखना है, जिससे वह जानकारी के मूल्य और चखने की लागत के बीच संतुलन बना सके।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "महंगी सूप" की दुविधा (The "Expensive Soup" Dilemma)

कल्पना कीजिए कि आपके पास 1,000 अलग-अलग सामग्रियों वाला सूप का एक विशाल बर्तन है।

  • सामग्री A: नमक का एक छोटा सा कण। इसे चखना सस्ता है, लेकिन यह समग्र स्वाद के बारे में बहुत कम बताता है।
  • सामग्री B: एक पूरा भुना हुआ चिकन। इसे चखना बहुत महंगा है (इसे चबाने और पचाने में बहुत समय लगता है), लेकिन यह स्वाद के बारे में बहुत कुछ बताता है।
  • सामग्री C: एक मध्यम आकार का गाजर। इसे चखने में थोड़ी लागत आती है और यह स्वाद की अच्छी जानकारी देता है।

पुराने तरीके बस रैंडमली सामग्रियाँ चुनते थे। इससे वे चिकन को बहुत बार चखने में समय बर्बाद करते थे, या नमक जैसी सस्ती चीज़ पर समय बर्बाद करते थे जब उन्हें वास्तव में चिकन के बारे में जानने की ज़रूरत थी।

2. समाधान: "कॉस्ट-अवेयर SGD" (द स्मार्ट टेस्टर)

लेखक कॉस्ट-अवेयर स्टोकेस्टिक ग्रेडिएंट डिसेंट (Cost-Aware Stochastic Gradient Descent - SGD) नामक एक नई रणनीति प्रस्तावित करते हैं।

रैंडम तरीके से सामग्रियाँ चुनने के बजाय, यह एल्गोरिदम एक "स्मार्ट टेस्टर" नियम का उपयोग करता है। यह प्रत्येक सामग्री के लिए एक स्कोर की गणना करता है जो दो चीजों पर आधारित है:

  1. यह कितना स्वाद की जानकारी देता है: (गणितीय शब्दों में, "ग्रेडिएंट नॉर्म" या यह कि यदि आप इसे जोड़ते हैं तो स्वाद कितना बदलता है)।
  2. इसे चखने की कितनी लागत आती है: (गणितीय शब्दों में, आवश्यक टोकन या कंप्यूटिंग पावर की संख्या)।

स्वर्ण नियम (The Golden Rule): एल्गोरिदम कहता है, "मैं ऐसी सामग्रियाँ चखना चाहता हूँ जो मुझे खर्च किए गए प्रति डॉलर पर सबसे अधिक स्वाद परिवर्तन दें।"

  • यदि एक लंबी, महंगी कहानी का AI की सीखने की प्रक्रिया पर बड़ा प्रभाव पड़ता है, तो वह लागत के लायक है।
  • यदि एक छोटी, सस्ती कहानी का लगभग कोई प्रभाव नहीं है, तो उसे छोड़ दें।
  • यदि एक लंबी कहानी का लगभग कोई प्रभाव नहीं है, तो उस पर पैसा बर्बाद न करें, भले ही उसे छोड़ना सस्ता हो।

उन्होंने गणितीय रूप से सिद्ध किया कि "उच्च मूल्य / कम लागत" का यह विशिष्ट मिश्रण बजट को जलाए बिना परफेक्ट रेसिपी प्राप्त करने का सबसे तेज़ तरीका है।

3. "सबसेट सिलेक्शन" (मेन्यू क्यूरेशन)

कभी-कभी, सबसे स्मार्ट टेस्टर भी सबसे महंगी वस्तुओं को चखने का खर्च नहीं उठा पाता है। पेपर एक दूसरा तरीका सुझाता है: सबसेट सिलेक्शन (Subset Selection)

कल्पना कीजिए कि आप अपने चखने के मेनू से "महंगे चिकन" को पूरी तरह से हटाने का निर्णय लेते हैं। आप यह स्वीकार करते हैं कि आपकी अंतिम रेसिपी शायद थोड़ी कम परफेक्ट होगी (एक मामूली सा "बायस"), लेकिन आप चिकन को कभी न चखकर भारी मात्रा में पैसा बचा लेते हैं। आप केवल गाजर और नमक पर ध्यान केंद्रित करते हैं।

लेखक दिखाते हैं कि महंगी वस्तुओं में से सावधानीपूर्वक यह चुनकर कि किसे बाहर करना है, आप अभी भी बहुत कम लागत में एक बहुत अच्छी रेसिपी प्राप्त कर सकते हैं। यह एक व्यंजन का शाकाहारी संस्करण बनाने का निर्णय लेने जैसा है, यह जानते हुए कि यह अभी भी स्वादिष्ट होगा।

4. परीक्षण: "AI शेफ" (कॉस्ट-अवेयर GRPO)

लेखकों ने इन सिद्धांतों को GRPO (Group Relative Policy Optimization) नामक विधि का उपयोग करके लार्ज लैंग्वेज मॉडल्स (LLMs) को प्रशिक्षित करने में लागू किया।

इस संदर्भ में:

  • "लागत" (Cost) प्रॉम्प्ट और AI की प्रतिक्रिया में शब्दों (टोकन) की संख्या है। लंबे, जटिल गणित के सवालों को प्रशिक्षित करने में छोटे सवालों की तुलना में अधिक लागत आती है।
  • "मूल्य" (Value) यह है कि AI का उत्तर उसके व्यवहार को कितना बदलता है (जिसे "एडवांटेज" कहा जाता है)।

उन्होंने कॉस्ट-अवेयर GRPO बनाया। हर उत्पन्न उत्तर पर समान रूप से प्रशिक्षण देने के बजाय, यह उन उत्तरों को प्राथमिकता देता है जो हैं:

  1. उच्च प्रभाव (High Impact): AI ने इस उत्तर से बहुत कुछ सीखा।
  2. कम लागत (Low Cost): उत्तर अनावश्यक रूप से लंबा नहीं था।

परिणाम:
उन्होंने दो AI मॉडल्स (एक 1.5-बिलियन पैरामीटर मॉडल और एक 8-बिलियन पैरामीटर मॉडल) पर गणितीय बेंचमार्क का उपयोग करके इसका परीक्षण किया।

  • परिणाम: वे मानक पद्धति के समान (या उससे भी बेहतर) सटीकता तक पहुँचे।
  • बचत: उन्होंने प्राप्त करने के लिए 30% तक कम टोकन (कंप्यूटिंग रिसोर्स) का उपयोग किया।
  • उपमा: यह उसी स्वादिष्ट भोजन को प्राप्त करने जैसा है लेकिन 30% कम भोजन और 30% कम खाना पकाने के समय के साथ।

सारांश

यह पेपर हमें सिखाता है कि AI प्रशिक्षण की महंगी दुनिया में, "अधिक डेटा" हमेशा बेहतर नहीं होता है। कभी-कभी, "स्मार्ट डेटा" ही कुंजी होती है। हर टुकड़े के डेटा को एक अलग मूल्य टैग और अलग मूल्य के रूप में मानकर, और केवल उन्हीं को चुनकर जो सबसे अच्छा "वैल्यू फॉर मनी" देते हैं, हम गुणवत्ता खोए बिना बहुत तेज़ और सस्ते में शक्तिशाली AI मॉडल प्रशिक्षित कर सकते हैं।

मुख्य निष्कर्ष: बुफे में सब कुछ मत खाइए। केवल वही चीज़ें खाइए जो आपको दिए गए दाम के हिसाब से सबसे बेहतरीन स्वाद देती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →