Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
यह शोध पत्र MERIT को पेश करता है, जो एक प्रशिक्षण-मुक्त, परत-चयनात्मक (layer-selective) मॉडल विलय ढांचा है जो एक वीडियो मॉडल और उसके टेक्स्ट-ओनली बैकबोन से विशिष्ट परतों को रणनीतिक रूप से संयोजित करके वीडियो-लैंग्वेज मॉडलों में टेम्पोरल रीजनिंग क्षमताओं को प्रभावी ढंग से पुनर्स्थापित करता है, जिससे बिना पुन: प्रशिक्षण के विजुअल अलाइनमेंट के कारण होने वाली रीजनिंग गिरावट को दूर किया जा सकता है।