← नवीनतम पेपर
💬 NLP

Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics

यह शोध पत्र एक स्थिर, संक्षिप्त प्रेडिक्टर प्रस्तावित करता है जो केवल एक एकल लेबल वाले वैलिडेशन-सेट सैंपलिंग पास का उपयोग करके बेस्ट-ऑफ-NN इन्फरेंस स्केलिंग गेन्स का अनुमान लगाता है, जो तीन मुख्य विशेषताओं (प्रॉम्प्ट-लेवल एग्रीमेंट स्प्रेड, लेबल-असिस्टेड फर्स्ट-करेक्ट-सैंपल पोजीशन, और कंप्लीशन-लेंथ वेरिएंस) की पहचान करता है जो मॉडल कॉन्फ़िगरेशन की लागत प्रभावी स्क्रीनिंग सक्षम करने के लिए वास्तविक गेन्स के साथ 0.90 का स्पीयरमैन सहसंबंध प्राप्त करते हैं।

मूल लेखक: Luyang Zhang, Jingyan Li

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luyang Zhang, Jingyan Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन कभी-कभी अप्रत्याशित छात्र (एक AI भाषा मॉडल) है जो एक कठिन गणित या तर्क की परीक्षा दे रहा है। आप जानना चाहते हैं: क्या इस छात्र को 64 बार परीक्षा देने के लिए कहना और सबसे अच्छे उत्तर को चुनना सार्थक है, या यह केवल समय की बर्बादी है?

आमतौर पर, यह पता लगाने के लिए कि यह "Best-of-N" रणनीति काम करती है या नहीं, आपको वास्तव में उस परीक्षण को 64 बार चलाना पड़ता है, हर एक प्रयास का मूल्यांकन एक बहुत ही महंगे, धीमे ग्रेडर (रिवॉर्ड मॉडल) के साथ करना पड़ता है, और देखना पड़ता है कि स्कोर बढ़ता है या नहीं। यह एक छात्र के होमवर्क को ग्रेड करने के लिए 64 ट्यूटर्स की टीम को काम पर रखने जैसा है। यह सटीक है, लेकिन इसमें बहुत अधिक समय और कंप्यूटिंग शक्ति खर्च होती है।

समस्या:
शोधकर्ताओं ने पूछा: क्या वे इस रणनीति के काम करने का अनुमान वास्तव में वह सारा महंगा काम किए बिना लगा सकते हैं? वे एक "सस्ता क्रिस्टल बॉल" (जादुई गोला) चाहते थे जो छात्र के काम के एक छोटे, मुफ्त नमूने को देखे और कहे, "हाँ, 64 प्रयास करें," या "नहीं, बस एक प्रयास काफी है।"

समाधान: "वाइब चेक" प्रेडिक्टर (Vibe Check Predictor)
उन्होंने एक सरल उपकरण बनाया है जो एक वाइब चेक की तरह काम करता है। उत्तरों को ग्रेड करने के बजाय, यह केवल छात्र के उत्तरों के आकार (shape) को देखता है। उन्होंने पाया कि तीन विशिष्ट "वाइब्स" (vibes) सफलता का पूर्वानुमान लगाने का गुप्त मंत्र हैं:

  1. "क्राउड कंट्रोल" वाइब (बहुमत-अनुपात प्रसार - Majority-Fraction Spread):

    • उपमा: यदि आप छात्र से एक ही प्रश्न 64 बार पूछते हैं, तो क्या वे सभी बिल्कुल एक ही उत्तर चिल्लाते हैं, या वहां एक अराजक मिश्रण है?
    • अंतर्दृष्टि: यदि उत्तर हर जगह बिखरे हुए हैं (उच्च प्रसार), तो इसका मतलब है कि छात्र अनिश्चित है, और एक "बेस्ट-ऑफ-एन" सिस्टम का विजेता चुनने के लिए होना बहुत मददगार है। यदि वे सब एक ही बात कहते हैं, तो दोबारा पूछने का कोई फायदा नहीं है।
  2. "लकी ब्रेक" वाइब (प्रथम-सही-नमूना स्थिति - First-Correct-Sample Position):

    • उपमा: कल्पना कीजिए कि छात्र अनुमान लगा रहा है। 64 प्रयासों की सूची में पहला सही उत्तर कितनी जल्दी आता है?
    • अंतर्दृष्टि: यदि सही उत्तर सूची में जल्दी दिखाई देता है, तो यह एक अच्छा संकेत है। इसका मतलब है कि छात्र जानता है कि उत्तर क्या है; उसे बस उसे खोजने के लिए थोड़े से धक्के की आवश्यकता है। यदि सही उत्तर बिल्कुल अंत में (या कभी नहीं) आता है, तो यह रणनीति ज्यादा मदद नहीं करेगी।
  3. "वर्ड काउंट" वाइब (पूर्णता-लंबाई भिन्नता - Completion-Length Variance):

    • उपमा: क्या छात्र हर बार एक छोटा, सटीक उत्तर लिखता है, या वह इधर-उधर भटकता रहता है?
    • अंतर्दृष्टि: यदि उत्तरों की लंबाई बहुत अधिक भिन्न होती है, तो यह सुझाव देता है कि छात्र समस्या को हल करने के विभिन्न तरीकों की खोज कर रहा है। यह "खोज" (exploration) एक अच्छा संकेत है कि एक "बेस्ट-ऑफ-एन" फ़िल्टर सही रास्ते को खोज सकता है।

उन्होंने यह कैसे पाया:
उन्होंने केवल अनुमान नहीं लगाया। उन्होंने बूटस्ट्रैप-लासो (Bootstrap-Lasso) नामक एक सांख्यिकीय पद्धति का उपयोग किया। इसे एक "रियलिटी चेक" लूप की तरह समझें। उन्होंने अपने भविष्यवाणी मॉडल को सैकड़ों बार डेटा के थोड़े अलग हिस्सों पर चलाया ताकि यह देखा जा सके कि कौन सी विशेषताएं लगातार महत्वपूर्ण के रूप में सामने आती हैं।

  • परिणाम: लंबी सूची में से केवल ये तीन विशिष्ट "वाइब्स" ही लगातार महत्वपूर्ण रहे। वे ही "स्थिर कोर" (stable core) हैं।

"मैजिक" एड-ऑन:
उन्होंने एक अतिरिक्त डेटा जोड़ा: एन्ट्रॉपी (Entropy) (एक फैंसी शब्द जिसका अर्थ है "भ्रम" या "यादृच्छिकता")। इसे "कन्फ्यूजन मीटर" के रूप में सोचें जो यह जांचता है कि छात्र कितना घबराया हुआ है। तीन मुख्य वाइब्स में इस "कन्फ्यूजन मीटर" को जोड़ने से उनकी भविष्यवाणी और भी सटीक हो गई।

परिणाम:

  • सटीकता: उनके सरल प्रेडिक्टर ने महंगे, पूर्ण-पैमाने के परीक्षणों के परिणामों को 90% बार मैच किया (0.90 का स्पीयरमैन सहसंबंध)।
  • गति और लागत: 64 उत्तरों को ग्रेड करने के लिए 30 मिनट के महंगे कंप्यूटर समय का इंतजार करने के बजाय, उनका प्रेडिक्टर कुछ सेकंड के सस्ते CPU समय में काम कर लेता है। यह अपने फोन पर मौसम का पूर्वानुमान देखने जैसा है, न कि यह देखने के लिए विमान उड़ाने जैसा कि क्या बारिश हो रही है।
  • स्क्रीनिंग: यदि आपके पास चुनने के लिए 50 अलग-अलग AI मॉडल हैं, तो यह उपकरण तुरंत बता सकता है कि कौन से 5 मॉडल महंगे "बेस्ट-ऑफ-एन" उपचार के लायक हैं, जिससे आपके बहुत सारे पैसे बचते हैं।

जहाँ यह विफल होता है (सीमाएँ):
पेपर ईमानदार है कि उसका "क्रिस्टल बॉल" कहाँ टूट जाता है:

  • कोडिंग कार्य: यह गणित और तर्क पहेलियों के लिए बहुत अच्छा काम करता है जहाँ उत्तर एक विशिष्ट संख्या या शब्द होता है। लेकिन कोडिंग के लिए, यह विफल हो जाता है। क्यों? क्योंकि कोडिंग में, दो प्रोग्राम बिल्कुल एक जैसा काम कर सकते हैं लेकिन वे दिखने में पूरी तरह से अलग हो सकते हैं (जैसे अंग्रेजी बनाम फ्रेंच में वाक्य लिखना)। "वाइब चेक" उन्हें अलग-अलग उत्तरों के रूप में देखता है, भ्रमित हो जाता है, और भविष्यवाणी विफल हो जाती है।
  • वोटिंग बनाम ग्रेडिंग: यह उपकरण तब सफलता की भविष्यवाणी करता है जब एक "स्मार्ट ग्रेडर" सबसे अच्छे उत्तर को चुनता है। यह काम नहीं करता यदि आप केवल बहुमत के वोट (जैसे लोकतंत्र) को उत्तर तय करने के लिए छोड़ देते हैं।

संक्षेप में:
यह पेपर हमें एक तरीका देता है जिससे हम एक AI के उत्तरों के छोटे, सस्ते नमूने को देखकर उच्च विश्वास के साथ भविष्यवाणी कर सकते हैं कि क्या उसे और अधिक प्रयास करने के लिए कहना (कई बार) वास्तव में उसे स्मार्ट बनाएगा। यह एक महंगी, अंधेरी परीक्षा को एक त्वरित, डेटा-संचालित निर्णय में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →