← नवीनतम पेपर
🤖 AI

Parallel Test-Time Scaling with Multi-Sequence Verifiers

यह शोध पत्र मल्टी-सीक्वेंस वेरिफायर (MSV) का परिचय देता है, जो एक नवीन फ्रेमवर्क है जो बेहतर उत्तर चयन के लिए कैलिब्रेशन में सुधार करने हेतु कई संभावित समाधानों को संयुक्त रूप से संसाधित करता है और एक समानांतर अर्ली-स्टॉपिंग रणनीति को सक्षम बनाता है, जिससे मौजूदा आइसोलेशन-आधारित सत्यापन विधियों की तुलना में इन्फरेंस लेटेंसी में काफी कमी आती है।

मूल लेखक: Yegon Kim, Seungyoo Lee, Chaeyun Jang, Hyungi Lee, Juho Lee

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yegon Kim, Seungyoo Lee, Chaeyun Jang, Hyungi Lee, Juho Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक बहुत ही महत्वपूर्ण डिनर पार्टी के लिए एक आदर्श व्यंजन बनाने की कोशिश कर रहे हैं। आपके पास एक रेसिपी (समस्या) है, लेकिन आप उसके सटीक चरणों के बारे में 100% सुनिश्चित नहीं हैं।

पुराना तरीका: "सोलो शेफ" बनाम "वोटिंग कमेटी"

AI की दुनिया में, जब कोई कंप्यूटर (एक लार्ज लैंग्वेज मॉडल) किसी कठिन गणितीय समस्या को हल करने की कोशिश करता है, तो वह अक्सर अटक जाता है या गलतियाँ कर देता है। इसे ठीक करने के लिए, शोधकर्ता एक ट्रिक का उपयोग करते हैं जिसे पैरेलल स्केलिंग (Parallel Scaling) कहा जाता है। समस्या को एक बार हल करने के लिए पूछने के बजाय, वे एक ही समय में 64 अलग-अलग समाधान उत्पन्न करने के लिए कहते हैं, जैसे कि एक ही समय में एक ही व्यंजन बनाने के लिए 64 अलग-अलग शेफ से पूछना।

एक बार जब आपके पास 64 व्यंजन हो जाते हैं, तो आपको एक जज (जिसे वेरिफायर कहा जाता है) की आवश्यकता होती है जो उन्हें चख सके और सबसे अच्छा वाला चुन सके।

  • पुराने जजों की समस्या: पहले, जज प्रत्येक व्यंजन को एक-एक करके, अलग-थलग चखता था। उसने व्यंजन #1 को देखा, उसे एक स्कोर दिया, फिर व्यंजन #2 को देखा, उसे एक स्कोर दिया, और इसी तरह। यह तुलना करने जैसा नहीं था। यह एक सूप को चखने, एक नोट लिखने, और फिर अगले सूप को चखने जैसा था जैसे कि जज ने पहले वाले को याद ही न रखा हो। यह धीमा (हाई लेटेंसी) था और अक्सर खराब चुनाव का कारण बनता था क्योंकि जज बड़ी तस्वीर (बिग पिक्चर) को देखने में चूक जाता था।
  • "सेल्फ-कंसिस्टेंसी" (Self-Consistency) का जुगाड़: कुछ समझदार लोगों ने महसूस किया कि यदि 60 शेफ सभी सूप में "नमक" डालते हैं, और केवल 2 "चीनी" डालते हैं, तो "नमक" वाला सूप शायद सही है। इसे वोटिंग कहा जाता है। लेकिन वोटिंग एक मोटा औजार है; यह नहीं समझता कि उत्तर क्यों सही है, बस यह जानता है कि वह लोकप्रिय है।

नया समाधान: "सुपर-जज" (MSV)

यह पेपर एक नए प्रकार के जज को पेश करता है जिसे मल्टी-सीक्वेंस वेरिफायर (MSV) कहा जाता है।

सोचिए कि MSV एक व्यक्ति नहीं है जो एक-एक करके व्यंजन चखता है, बल्कि एक सुपर-इंटेलिजेंट फूड क्रिटिक है जो रसोई में आता है और एक ही समय में सभी 64 व्यंजनों को देखता है।

  1. जानकारी का "ग्रुप हग": किसी व्यंजन को अलग-थलग तरीके से आंकने के बजाय, MSV यह देखता है कि व्यंजन #1 का व्यंजन #2, व्यंजन #3 आदि के साथ क्या संबंध है। यह पैटर्न देखता है। यदि व्यंजन #1 और व्यंजन #5 दोनों ने एक ही अजीब गलती की, तो MSV दोनों पर संदेह करेगा। यदि व्यंजन #12 एकमात्र ऐसा है जिसने गणित सही किया है, तो MSV उस विशिष्टता को तुरंत पहचान लेता है।
  2. बेहतर कैलिब्रेशन (Calibration): AI के संदर्भ में, "कैलिब्रेशन" का अर्थ है कि AI अपने आत्मविश्वास के बारे में कितना ईमानदार है।
    • पुराना जज: "मुझे 99% यकीन है कि यह सूप परफेक्ट है!" (लेकिन वास्तव में यह जल गया है)।
    • MSV: "मुझे 99% यकीन है कि यह सूप परफेक्ट है क्योंकि मैंने इसकी तुलना अन्य 63 के साथ की है, और यह एकमात्र है जो रेसिपी की तरह स्वाद देता है।"
    • MSV बहुत अधिक ईमानदार है। वह जानता है कि वह कब सही है और कब वह केवल अनुमान लगा रहा है।

जादुई ट्रिक: "अर्ली एग्जिट" (स्ट्रीमिंग)

यहाँ सबसे रोमांचक हिस्सा है। आमतौर पर, सबसे अच्छा व्यंजन चुनने के लिए, आपको सभी 64 शेफ के खाना पकाने के पूरा होने तक इंतजार करना पड़ता है। इसमें बहुत समय लगता है।

MSV एक स्ट्रीमिंग (Streaming) विधि पेश करता है। कल्पना कीजिए कि शेफ खाना बना रहे हैं, और MSV वास्तविक समय (रियल-टाइम) में उन्हें देख रहा है।

  • जैसे ही शेफ #12 एक ऐसा व्यंजन परोसना शुरू करता है जो परफेक्ट दिखता है और MSV 99% सुनिश्चित है कि वही विजेता है, MSV चिल्लाता है: "रुकिए! हमें विजेता मिल गया! बाकी 63 शेफ को रोक दें!"
  • यह बहुत सारा समय बचाता है। आपको धीमे शेफ के खत्म होने तक इंतजार करने की जरूरत नहीं है। आपको आधे समय में सही उत्तर मिल जाता है।

यह क्यों मायने रखता है

  • सटीकता (Accuracy): सभी उत्तरों को एक साथ देखकर, MSV किसी भी पिछले तरीके की तुलना में सही उत्तर अधिक बार चुनता है (कठिन गणितीय समस्याओं पर 6% से अधिक सुधार के साथ)।
  • गति (Speed): जब वह आश्वस्त होता है, तो प्रक्रिया को जल्दी रोककर, यह प्रतीक्षा समय को आधा कर देता है।
  • भरोसा (Trust): क्योंकि MSV "कैलिब्रेटेड" है, यदि वह कहता है "मुझे 90% यकीन है," तो आप वास्तव में उस संख्या पर भरोसा कर सकते हैं। यह उच्च-जोखिम वाले निर्णयों (जैसे चिकित्सा निदान या वित्तीय सलाह) के लिए महत्वपूर्ण है जहाँ आप आत्मविश्वास के साथ गलत होने का जोखिम नहीं उठा सकते।

संक्षेप में

यह पेपर AI को सिखाता है कि वह अपने काम को शून्य में कैसे न आँके। एक उत्तर को देखकर अनुमान लगाने के बजाय, यह AI को उत्तरों की एक पूरी भीड़ को देखने, उनकी तुलना करने और तुरंत विजेता को पहचानने के लिए सिखाता है। यह एक अकेले जासूस से बदलकर टीम के जासूसों के रूप में काम करने जैसा है, जो तेजी से और बहुत अधिक विश्वास के साथ अपराधों को सुलझाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →