← नवीनतम पेपर
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

यह शोध पत्र "कंप्यूट अलाइन्ड ट्रेनिंग" (Compute Aligned Training) पेश करता है, जो एक नया फ्रेमवर्क है जो नए लॉस फंक्शन्स को व्युत्पन्न करके लार्ज लैंग्वेज मॉडल्स के ट्रेनिंग ऑब्जेक्टिव्स को टेस्ट-टाइम इन्फरेंस रणनीतियों के साथ संरेखित करता है, जिससे मानक SFT और RL दृष्टिकोणों की तुलना में प्रदर्शन स्केलिंग में महत्वपूर्ण सुधार होता है।

मूल लेखक: Adam Ousherovitch, Ambuj Tewari

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adam Ousherovitch, Ambuj Tewari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक बहुत ही विशिष्ट प्रकार की अंतिम परीक्षा के लिए प्रशिक्षित कर रहे हैं।

पुराना तरीका (मानक प्रशिक्षण):
परंपरागत रूप से, जब हम AI मॉडल (जैसे वे जो निबंध लिखते हैं या गणित की समस्याओं को हल करते हैं) को सिखाते हैं, तो हम एक सख्त शिक्षक की तरह व्यवहार करते हैं जो होमवर्क के हर असाइनमेंट को व्यक्तिगत रूप से ग्रेड करता है। यदि छात्र एक प्रश्न का सही उत्तर देता है, तो हम कहते हैं "बहुत अच्छा!" और यदि वह गलत होता है, तो हम कहते हैं "फिर से प्रयास करें।" हम चाहते हैं कि छात्र पहली बार में ही एकदम सही उत्तर देने में पूर्ण (perfect) हो जाए।

समस्या यह है कि यह उन्हें वास्तविक परीक्षा के लिए तैयार नहीं करता है। वास्तविक दुनिया में, हम मॉडल से केवल एक उत्तर नहीं मांगते। हम उससे कई अलग-अलग उत्तर बनाने के लिए कहते हैं (जैसे कि एक छात्र को निबंध के 10 अलग-अलग ड्राफ्ट लिखने के लिए कहना) और फिर हम सबसे अच्छे को चुनते हैं, या सबसे आम उत्तर पर वोट देते हैं।

यदि आप एक छात्र को पहले ड्राफ्ट में पूर्ण होने के लिए प्रशिक्षित करते हैं, तो वे बहुत अधिक आत्मविश्वासी हो सकते हैं और नए विचारों को तलाशना बंद कर सकते हैं। वे सोचने के एक "सुरक्षित" तरीके में फंस सकते हैं। जब आप बाद में उनसे 10 ड्राफ्ट बनाने के लिए कहते हैं, तो वे शायद एक ही "सुरक्षित" उत्तर के 10 थोड़े अलग संस्करण ही लिख देंगे, और उनमें से कोई भी वह शानदार, रचनात्मक समाधान नहीं होगा जिसकी आपको आवश्यकता थी।

नया तरीका (कंप्यूट अलाइन्ड ट्रेनिंग - CAT):
लेखक इस नए प्रशिक्षण तरीके का प्रस्ताव करते हैं जिसे 'कंप्यूट अलाइन्ड ट्रेनिंग' (CAT) कहा जाता है। एक एकल होमवर्क असाइनमेंट पर छात्र को ग्रेड देने के बजाय, वे छात्र को इस आधार पर ग्रेड देते हैं कि वह वास्तविक परीक्षा के प्रारूप में कैसा प्रदर्शन करेगा।

यह कैसे काम करता है, इसके कुछ उदाहरण यहाँ दिए गए हैं:

1. "Pass@N" का उदाहरण (लॉटरी टिकट)

कल्पना कीजिए कि परीक्षा आपको एक प्रश्न के लिए N लॉटरी टिकट (मान लीजिए 64 टिकट) खरीदने की अनुमति देती है। आप तब जीतते हैं जब आपके 64 टिकटों में से कोई भी एक जीतने वाला नंबर हो।

  • मानक प्रशिक्षण: यदि छात्र के पास एक टिकट के साथ जीतने की 50% संभावना है, तो शिक्षक उसे 90% या 99% तक पहुँचने के लिए प्रेरित करता रहता है। लेकिन 64-टिकट वाली लॉटरी में, एक बार जब आपके पास 50% संभावना होती है, तो अधिक टिकट खरीदना जीत की गारंटी देता है। शिक्षक एक आसान प्रश्न पर एक "अच्छे" छात्र को "पूर्ण" बनाने में अपनी ऊर्जा बर्बाद करता है, जबकि वे उन कठिन प्रश्नों की अनदेखी करते हैं जहाँ छात्र के पास केवल 1% संभावना है।
  • CAT प्रशिक्षण: शिक्षक महसूस करता है, "अरे, इस छात्र के पास 64 टिकटों के साथ जीतने की संभावना पहले से ही अधिक है। मैं इस आसान प्रश्न के लिए इतनी कड़ी ग्रेडिंग करना बंद कर दूँगा।" इसके बजाय, वे अपना सारा ध्यान उन कठिन प्रश्नों पर केंद्रित करते हैं जहाँ छात्र वर्तमान में विफल हो रहा है। वे छात्र को अपने अवसरों को फैलाने के लिए सिखाते हैं, यह सुनिश्चित करने के लिए कि कम से कम एक में से 64 टिकट विजेता हो, न कि किसी एक विशिष्ट टिकट को पूर्ण बनाने के लिए।

2. "मेजोरिटी वोट" का उदाहरण (चुनाव)

कल्पना कीजिए कि परीक्षा मॉडल से 10 उत्तर उत्पन्न करने के लिए कहती है, और कक्षा सबसे लोकप्रिय उत्तर पर वोट करती है।

  • मानक प्रशिक्षण: शिक्षक छात्र के पहले उत्तर को पूर्णतः सबसे लोकप्रिय बनाने की कोशिश करता है, भले ही वह पहले से ही भारी बहुमत से जीत रहा हो। यह उस उम्मीदवार की तरह है जो पहले से ही 90% वोट जीत रहा है; शिक्षक उसे और अधिक प्रचार करने के लिए कहता रहता है, जो समय की बर्बादी है।
  • CAT ट्रेनिंग: शिक्षक "टिपिंग पॉइंट" (निर्णायक बिंदु) को देखता है। यदि छात्र का उत्तर वर्तमान में एक छोटे अंतर से हार रहा है, तो शिक्षक उसे फिनिश लाइन पार करने में मदद करने के लिए एक बड़ा बढ़ावा देता है। यदि छात्र आसानी से जीत रहा है, तो शिक्षक उसे अतिरिक्त अंक देना बंद कर देता है। यह मॉडल को "बैटलग्राउंड" (लड़ाई के मैदान) वाले प्रश्नों पर ध्यान केंद्रित करने के लिए मजबूर करता है जहाँ थोड़ा सा अतिरिक्त प्रयास भी वोट को पलट सकता है।

3. "Best-of-N" का उदाहरण (टैलेंट शो)

कल्पना कीजिए कि मॉडल 10 गाने बनाता है, और आप केवल एक सबसे अच्छे को रखते हैं।

  • मानक प्रशिक्षण: शिक्षक कोशिश करता है कि औसत गाना अच्छा लगे। इससे सुरक्षित, उबाऊ, "मध्यम-स्तर" का संगीत पैदा होता है जो कभी बुरा नहीं होता, लेकिन कभी अद्भुत भी नहीं होता।
  • CAT प्रशिक्षण: शिक्षक मॉडल को कहता है, "यह ठीक है अगर आपके 9 गाने बेकार हैं, जब तक कि 10वाँ गाना एक मास्टरपीस (उत्कृष्ट कृति) हो।" यह मॉडल को जोखिम लेने और अजीब, उच्च-विचलन (high-variance) वाले विचार आज़माने के लिए प्रोत्साहित करता है। यह मॉडल को विविध आउटपुट उत्पन्न करने के लिए प्रशिक्षित करता है, यह जानते हुए कि "खोज" (search) प्रक्रिया विफलताओं को फ़िल्टर करेगी और विजेता को रखेगी।

उन्होंने वास्तव में क्या किया?

शोधकर्ताओं ने इस विचार का तीन विशिष्ट तरीकों से परीक्षण किया:

  1. गणित की समस्याएँ: उन्होंने AI मॉडल को गणित की समस्याओं को हल करने के लिए प्रशिक्षित किया। जब उन्होंने "Pass@N" (कई उत्तर उत्पन्न करना और सही को चुनना) के लिए तैयारी करने हेतु CAT का उपयोग किया, तो मॉडल मानक पद्धति की तुलना में कठिन समस्याओं को हल करने में काफी बेहतर रहे।
  2. वोटिंग: उन्होंने मॉडलों को "मेजोरिटी वोट" के लिए उत्तर उत्पन्न करने के लिए प्रशिक्षित किया। फिर से, जब वोटिंग रणनीति लागू की गई, तो CAT मॉडल बेहतर प्रदर्शन करते रहे।
  3. प्रोटीन डिज़ाइन: उन्होंने इसका परीक्षण एक पूरी तरह से अलग प्रकार के AI पर भी किया जो प्रोटीन (जीवन के निर्माण खंड) डिजाइन करता है। एक ऐसे परिदृश्य में जहाँ AI को कई खराब प्रोटीनों के बीच एक दुर्लभ, उच्च-गुणवत्ता वाले प्रोटीन संरचना को खोजना था, CAT-प्रशिक्षित मॉडल मानक मॉडलों की तुलना में "जैकपॉट" प्रोटीन खोजने में बहुत बेहतर थे।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि आप मॉडल को कैसे प्रशिक्षित करते हैं, यह इस बात पर निर्भर होना चाहिए कि आप उसका उपयोग कैसे करते हैं।

यदि आप मॉडल का उपयोग कई विकल्प उत्पन्न करने और सबसे अच्छे को चुनने के लिए करने की योजना बना रहे हैं, तो आपको इसे पहली कोशिश में पूर्ण होने के लिए प्रशिक्षित नहीं करना चाहिए। आपको इसे विकल्पों का एक ऐसा पूल (pool) बनाने में अच्छा होने के लिए प्रशिक्षित करना चाहिए जहाँ सबसे अच्छा विकल्प मिलने की संभावना अधिक हो।

वे इसे "कंप्यूट अलाइन्ड ट्रेनिंग" कहते हैं क्योंकि यह प्रशिक्षण प्रक्रिया को टेस्ट के समय उपयोग किए जाने वाले "कंप्यूट" (अतिरिक्त सोचने की शक्ति) के साथ संरेखित (align) करता है। यह बिना अधिक शक्तिशाली कंप्यूटरों या अधिक प्रशिक्षण समय की आवश्यकता के बेहतर परिणाम प्राप्त करने का एक तरीका है; आप बस खेल के नियमों को इस वास्तविकता के अनुरूप बदलते हैं कि मॉडल का उपयोग कैसे किया जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →