← नवीनतम पेपर
🤖 machine learning

Efficient Test-Time Scaling for Small Vision-Language Models

यह शोध पत्र दो कुशल टेस्ट-टाइम स्केलिंग रणनीतियों, टेस्ट-टाइम ऑग्मेंटेशन (TTAug) और टेस्ट-टाइम अडैप्टेशन (TTAdapt) का प्रस्ताव करता है, जो संसाधन-बाधित वातावरण के अनुकूल कम्प्यूटेशनल दक्षता बनाए रखते हुए विभिन्न बेंचमार्क पर छोटे विजन-लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए आंतरिक मॉडल फीचर्स का लाभ उठाते हैं।

मूल लेखक: Mehmet Onurcan Kaya, Desmond Elliott, Dim P. Papadopoulos

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mehmet Onurcan Kaya, Desmond Elliott, Dim P. Papadopoulos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास स्मोल (Smol) नाम का एक बहुत ही बुद्धिमान, लेकिन छोटा, रोबोट सहायक है। स्मोल तस्वीरों को देखने और उन पर आधारित सवालों के जवाब देने में माहिर है (जैसे कि "इस फोटो में कितने तौलिए हैं?"), लेकिन क्योंकि यह छोटा और कुशल है, इसलिए यह कभी-कभी भ्रमित हो जाता है या गलतियाँ कर देता है, खासकर जब दुनिया वैसी नहीं दिखती जैसी इसे प्रशिक्षित किया गया था।

आमतौर पर, एक रोबोट को स्मार्ट बनाने के लिए, आपको उसका एक विशाल, महंगा सुपर-कंप्यूटर वाला संस्करण बनाने की आवश्यकता होगी। लेकिन इससे उस छोटे, कुशल रोबट का उद्देश्य ही खत्म हो जाएगा जिसे एक साधारण लैपटॉप या फोन पर चलाना है।

यह पेपर स्मोल को काम करते समय बहुत अधिक स्मार्ट बनाने के दो चतुर तरीके पेश करता है, बिना किसी अतिरिक्त प्रशिक्षण या सुपर-कंप्यूटर की आवश्यकता के। इसे स्मोल को सवाल का जवाब देने से ठीक पहले एक "दूसरी राय" और एक "त्वरित अध्ययन सत्र" देने जैसा समझें।

समस्या: "एक बार में ही सब कुछ" वाली गलती

सामान्यतः, जब आप स्मोल से कोई सवाल पूछते हैं, तो वह तस्वीर को देखता है और तुरंत जवाब दे देता है। यदि वह किसी धुंधले अक्षर को गलत पढ़ लेता है या किसी छाया से विचलित हो जाता है, तो वह गलती करता है और आगे बढ़ जाता है। यह एक छात्र से एक ही बार में गणित का सवाल हल करने को कहने जैसा है बिना अपना काम दोबारा जांचे।

समाधान: दो नई महाशक्तियाँ

लेखकों ने स्मोल को दो नई क्षमताएं दी हैं: टेस्ट-टाइम ऑगमेंटेशन (TTAug) और टेस्ट-टाइम अडैप्टेशन (TTAdapt)

1. टेस्ट-टाइम ऑगमेंटेशन (TTAug): "सामूहिक सोच" की रणनीति

कल्पना कीजिए कि आप एक बिखरे हुए, हाथ से लिखे नोट को पढ़ने की कोशिश कर रहे हैं। यदि आप इसे एक बार देखते हैं, तो आप शायद एक शब्द को गलत पढ़ लें। लेकिन क्या होगा यदि आप:

  • इसे थोड़ी धुंधली खिड़की के माध्यम से देखें।
  • अपना सिर एक तरफ झुका लें।
  • अपनी आँखें सिकोड़ लें।
  • इसे रोशनी के सामने ऊपर उठाएं।

उसी नोट को थोड़े अलग तरीकों से देखने से, आपका मस्तिष्क इस बात पर सहमत होने लगता है कि वह शब्द वास्तव में क्या है।

TTAug स्मोल के लिए बिल्कुल यही करता है:

  • ट्रिक: जवाब देने से पहले, सिस्टम मूल छवि और प्रश्न को लेता है और उनके 16 थोड़े अलग संस्करण बनाता है। यह छवि में थोड़ा सा शोर (noise) जोड़ सकता है, शब्द का कैपिटलाइजेशन बदल सकता है, या एक छोटी सी टाइपिंग त्रुटि जोड़ सकता है (जैसे "towels" को "towels" बनाना)।
  • प्रक्रिया: स्मोल इन सभी 16 संस्करणों को देखता है। केवल एक उत्तर चुनने के बजाय, वह हर एक संस्करण के लिए अगले शब्द को देखता है जिसे वह कहना चाहता है।
  • जादू: यह इन 16 सूक्ष्म भविष्यवाणियों का औसत निकालता है। यदि 15 संस्करण कहते हैं कि अगला शब्द "Germany" है और 1 कहता है "France," तो रोबोट आत्मविश्वास से "Germany" चुनता है।
  • यह क्यों काम करता है: यह तुरंत छोटी गलतियों को पकड़ लेता है। यदि रोबमा एक संस्करण में टाइपो से भ्रमित हो जाता है, तो अन्य 15 साफ संस्करण उसे सुधार देते हैं। यह एक समिति द्वारा वाक्य लिखे जाने के दौरान हर एक शब्द पर वोट देने जैसा है, न कि अंत तक इंतजार करने जैसा कि पूरा निबंध समझ में आए।

2. टेस्ट-टाइम अडैप्टेशन (TTAdapt): "फ्लैश स्टडी" की रणनीति

एक बार जब रोबोट ने एक बहुत अच्छा, उच्च-विश्वास वाला उत्तर उत्पन्न करने के लिए "ग्रुप थिंक" पद्धति का उपयोग कर लिया है, तो वह उस उत्तर का उपयोग सीखने के लिए कर सकता है।

  • ट्रिक: रोबोट कहता है, "मेरे समूह वोट के आधार पर मुझे 99% यकीन है कि उत्तर 'Germany' है।"
  • प्रक्रिया: यह उस आत्मविश्वासी उत्तर को ऐसे मान लेता है जैसे कि वह एक "सही उत्तर कुंजी" हो। इसके बाद, यह अपने आंतरिक मस्तिष्क सेटिंग्स को उस उत्तर के साथ मिलाने के लिए एक सुपर-फास्ट, मिनी-ट्रेनिंग सत्र (सीखने के कुछ सेकंड) करता है।
  • रीसेट: महत्वपूर्ण रूप से, इस विशिष्ट प्रश्न का उत्तर देने के बाद, यह अपनी मेमोरी को पूरी तरह साफ कर देता है और अपनी मूल स्थिति में वापस चला जाता है। यह अन्य चीजें करना नहीं भूलता; यह बस खुद को इस विशिष्ट प्रकार की समस्या के लिए एकदम सटीक बनाने के लिए अस्थायी रूप से ट्यून करता है जो इसने अभी देखी है।
  • यह क्यों काम करता है: यह एक छात्र द्वारा अभ्यास परीक्षण देने, सही उत्तर प्राप्त करने और तुरंत उसके पीछे के तर्क को समझने जैसा है ताकि वह अगली बार इसी तरह की समस्या को बेहतर ढंग से हल कर सके।

यह एक बड़ी बात क्यों है

  • अतिरिक्त दिमाग की आवश्यकता नहीं: आपको काम की जांच करने के लिए दूसरे, विशाल रोबोट की आवश्यकता नहीं है। स्मोल अपना काम खुद चेक करता है।
  • अत्यधिक कुशल: यह सामान्य कंप्यूटरों पर चलता है। इसके लिए भारी ऊर्जा या महंगे हार्डवेयर की आवश्यकता नहीं होती है।
  • "टेम्परेचर" से बेहतर: आमतौर पर, रोबोट को अलग-अलग उत्तर देने के लिए, लोग उसे "रैंडम अनुमान" लगाने के लिए बनाते हैं (जैसे पासा फेंकना)। इस पेपर ने पाया कि रोबोट को "समस्या को अलग तरह से देखने" (छवि/पाठ को थोड़ा बदलकर) के लिए कहना केवल पासा फेंकने से कहीं अधिक स्मार्ट है।
  • शब्द-दर-शब्द बनाम पूरा वाक्य: अधिकांश तरीके रोबोट के पूरा वाक्य खत्म करने का इंतजार करते हैं कि वह सही है या नहीं। यह तरीका हर एक शब्द को लिखते समय चेक करता है, जिससे गलतियां बढ़ने से पहले ही पकड़ी जाती हैं।

परिणाम

लेखकों ने चार्ट पढ़ने से लेकर तस्वीरों में वस्तुओं की पहचान करने तक, नौ अलग-अलग चुनौतियों पर इसका परीक्षण किया।

  • पहले: स्मोट ठीक था लेकिन अक्सर गलतियाँ करता था।
  • बाद में: स्मोट काफी अधिक सटीक हो गया, और अक्सर बड़े, अधिक महंगे मॉडलों को भी पीछे छोड़ दिया।

संक्षेप में: यह पेपर छोटे, कुशल AI मॉडल्स को यह सिखाता है कि कैसे समस्याओं को कई कोणों से देखकर "धीरे चलें और सोचें" और अपने ही सबसे अच्छे अनुमानों से सीखें, वह भी बिना दोबारा बनाए या बड़ा किए। यह एक छात्र द्वारा उत्तर का अनुमान लगाने और एक छात्र द्वारा अपना काम दोबारा जांचने और उससे वास्तविक समय में सीखने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →