MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
تكشف هذه الورقة أن النماذج اللغوية الكبيرة متعددة الوسائط تمتلك قدرات كامنة في الربط الزمني ضمن انتباه مرحلة التعبئة المسبقة (prefill attention) لكنها تفشل في استغلالها أثناء التوليد، مما دفع إلى ابتكار إطار عمل للاستدلال بدون تدريب يستخلص إشارات الانتباه هذه لتقييد السياق البصري وتحسين أداء الربط الزمني للفيديو بشكل كبير.