Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
यह शोध पत्र यह प्रदर्शित करता है कि छोटे बहुभाषी विजन-लैंग्वेज मॉडल्स के लिए, टेस्ट-टाइम स्केलिंग लाभ मुख्य रूप से जटिल खोज या सत्यापन तंत्र के बजाय प्रॉम्प्ट पारसेबिलिटी (parseability) और पर्याप्त डिकोडिंग बजट सुनिश्चित करने से संचालित होते हैं, जिसमें विजुअल मल्टीपल-चॉइस बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए अंतर्निहित पॉलिसी मॉडल सबसे महत्वपूर्ण कारक है।